Контроль Китая над информацией искажает чат-боты на китайском языке
Китайская пропаганда оказывает влияние на сферу искусственного интеллекта (ИИ) не только через модели, создаваемые китайскими компаниями, но и через обучающие данные для других глобальных моделей, таких как Claude Opus 4.7, Gemini 3.1 Pro или GPT-5.5, выпущенных в 2026 году. Недавнее исследование выявило, что эти модели активно используют китайскую пропаганду в качестве обучающих данных и без труда воспроизводят ложные утверждения режима при запросах на китайском языке.
Когда в прошлом году появился чат-бот Deepseek R1, было ожидаемо, что его ответы будут формироваться под влиянием авторитарного китайского правительства, контролирующего технологический сектор страны. Вскоре стало очевидно, что в нем присутствует цензура по таким темам, как Тайвань, подавление протестов на площади Тяньаньмэнь в 1989 году и личность Си Цзиньпина.
Однако возникает вопрос об опосредованном влиянии Пекина на модели, разработанные компаниями, не зависящими от китайских властей. В недавно опубликованном исследовании в научном журнале Nature специалисты из нескольких американских университетов продемонстрировали, что китайское государство оказывает значительное косвенное влияние на результаты работы ИИ-моделей, не находящихся под прямым контролем Китая. Полный текст исследования также доступен на GitHub.
Таким образом, модели, такие как Claude Opus 4.7, Gemini 3.1 Pro или GPT-5.5, выпущенные в этом году, по-прежнему демонстрируют искажение в вопросах, касающихся Китая, при использовании их на китайском языке. Исследование также указывает на растущее влияние китайского государства. Авторы разделили свою работу на шесть основных частей.
Пропаганда как данные для обучения
Прежде всего, в своем первом исследовании ученые выявили, что тексты, созданные отделом пропаганды Китая, чрезвычайно часто встречаются в обычных многоязычных наборах данных, используемых для обучения ИИ-моделей.
В частности, они проанализировали CulturaX — «очищенный, обширный и публичный» поднабор данных Common Crawl, предназначенный для «демократизации больших языковых моделей для 167 языков». «По сравнению с общим средним показателем, значительно высокий процент (от 3,28% до 23,98%) обучающих данных, упоминающих политических лидеров и институты, соответствует текстам, манипулируемым государством», — объясняют исследователи, говоря о китайскоязычных документах в CulturaX.
Новейшие модели ИИ наиболее активно воспроизводят китайскую пропаганду
Далее исследователи продемонстрировали, что коммерческие модели ИИ воспроизводят фразы из китайской пропаганды, что свидетельствует об их обучении на этих данных. Одновременно было подтверждено, что обучение модели на пропагандистских материалах увеличивает количество проавторитарных ответов, что было вполне предсказуемо.
«Новейшие и наиболее мощные модели демонстрируют более высокие показатели запоминания», — отмечают исследователи. Так, Claude Opus 4.6, GPT-5.5 и Claude Opus 4.7 воспроизводят наибольший объем китайской пропаганды, превосходя даже DeepSeek V3.2 и DeepSeek V4 Pro.
Если обучающие данные моделей массово включают китайскую пропаганду, то каковы последствия для их результатов? Неудивительно, что все модели оказываются под влиянием. Автоматическая оценка с использованием других больших языковых моделей (БЯМ) показала, что все они демонстрируют большее соответствие китайской пропаганде при запросах на китайском языке, чем на английском. Примечательно, что эта тенденция особенно выражена у новейших моделей: Claude Opus 4.6, GPT-5.4, GPT-5.5, Gemini 3.1 Pro и Claude Opus 4.7 проявляют наибольшее влияние.
Важно отметить, что исследователи измеряют соотношение между соответствием китайской пропаганде при использовании китайского и английского языков. Поскольку DeepSeek V4 Pro также воспроизводит эту пропаганду и на английском, его соотношение ниже, чем у других моделей, но это не означает, что он меньше транслирует пропаганду режима на китайском.
Исследователи повторили этот эксперимент, используя реальные пользовательские запросы, относящиеся к Си Цзиньпину или Коммунистической партии Китая. Эти запросы были взяты из китайских поднаборов данных WildChat (набор данных об использовании ChatGPT), Baidu Zhidao Q&A (китайский аналог Yahoo Answers) и Zhihu (китайский аналог Quora). «Все коммерческие модели демонстрировали более благосклонное отношение к китайским лидерам и институтам, когда вопросы задавались на китайском языке, а не на английском», — поясняют авторы.
Важность свободы прессы
Наконец, в своем исследовании ученые расширили область изучения, чтобы оценить возможность обобщения этого явления на другие авторитарные страны. «В 37 странах, где доминирует определенный язык, большие языковые модели (БЯМ), получающие запросы на основном языке соответствующей страны, дают более благоприятные для режима ответы там, где уровень свободы прессы низкий. Страны с высоким уровнем свободы прессы практически не показывают различий по сравнению с английским языком, а в некоторых случаях наблюдается даже небольшая отрицательная корреляция, что позволяет предположить, что это явление выходит за рамки только Китая», — заключают исследователи.
Свежие материалы — Новости IT-индустрии

США блокируют новые иностранные роботы: от гуманоидов до роботов-пылесосов и газонокосилок
Соединенные Штаты, через своего регулятора связи FCC, с начала этой недели запретили выход на американский рынок новых моделей «передовых мобильных роботов» иностранного производства. Это касается не только гуманоидных и четвероногих роботов, но также... роботов-пылесосов и газонокосилок.

Disney+ Premium лишается 4K и HDR, но сохраняет прежнюю цену
Что останется подписчикам Disney+ Premium? Не так уж много: после исчезновения Dolby Vision в июне этого года, теперь и 4K с HDR10 стали недоступны. Это, по меньшей мере, неприятно, поскольку именно эти функции были последними существенными преимуществами самой дорогой подписки на стриминговый

LinkedIn добавляет кнопку для сообщения о «некачественном ИИ-контенте»
LinkedIn внедряет новую функцию, позволяющую пользователям сообщать о так называемом «AI slop» — низкокачественном контенте, созданном искусственным интеллектом. Нажав на соответствующую кнопку, пользователи информируют платформу о публикации, которая, по их мнению, была написана ИИ. Эта

Infomaniak из Швейцарии готовится к публичному размещению акций
Infomaniak активно готовится к выходу на фондовую биржу. Швейцарская компания заключила соглашение об обратном слиянии с Perrot Duval Holding, другой швейцарской компанией, котирующейся на бирже с 1905 года. Ожидается, что это позволит Infomaniak выйти на швейцарский рынок до конца текущего го

Шифрование: Claude взламывает HAWK и находит уязвимость в уменьшенной версии AES, но без паники
Команда Frontier Red Team компании Anthropic опубликовала отчет, в котором описывает свои открытия относительно двух алгоритмов кибербезопасности: HAWK и AES. Хотя эти открытия и подтверждены, их последствия не столь драматичны, как иногда описывается. Однако и полностью незначительными их назв

GrapheneOS против прецедента: Защита данных и 'пароль принуждения' в суде США
Команда GrapheneOS внезапно представила подробный обзор своих мер безопасности 26 июля, особенно акцентируя внимание на управлении паролями. Выбор времени неслучаен: впервые в США Министерство юстиции преследует американского гражданина за предполагаемое уничтожение данных с помощью «пароля при