Журналісти отримали доступ до внутрішньої бази даних, яка свідчить про розробку в Китаї потужної цензурної системи на основі великих мовних моделей (LLM). Згідно з інформацією, оприлюдненою у березні 2025 року, система дозволяє в автоматичному режимі виявляти, аналізувати та блокувати публікації, що містять політично чутливий або критичний до влади зміст.
Повідомляє видання TechCrunch.
Систему виявив дослідник кібербезпеки, який знайшов відкриту базу даних на сервері Baidu. В базі містилися численні приклади контенту, понад 130 тисяч, який використовуються для навчання моделі штучного інтелекту. Метою навчання було виявлення матеріалів, що можуть загрожувати “стабільності суспільної думки”.
Цікаво, що модель навчалася не лише на прямих фразах, котрі містили скарги на поліцію, забрудненість довкілля чи фінансові махінацій. Але й вивчала метафоричні вислови.
Один із записів містить китайський вислів “Коли дерево падає, мавпи розбігаються” — метафору, яка вважається завуальованою критикою влади. Саме такі “м’які” форми інакомислення система також автоматично позначає як пріоритетні для блокування.
На відміну від традиційного фільтрування ключових слів, система використовує LLM — великі мовні моделі, подібні до ChatGPT. Це дає їй можливість вивчати контент і з точки зору прихованих сенсів.
Згідно з інформацією, знайденою у файлах, система створена для “public opinion work” — поняття, яким у Китаї позначають цензуру та пропаганду, що координуються Управлінням кіберпростору Китаю (CAC). Основна мета — усунути альтернативні наративи та забезпечити домінування офіційної точки зору в інформаційному просторі.
Нагадаємо, Китай тривалий час застосовує цензуру для блокування інформації про події, які влада вважає “загрозливими”, зокрема згадки про розгін на площі Тяньаньмень, критику президента Сі Цзіньпіна, а також теми, пов’язані з Тайванем, Сіньцзяном і правами людини.