Российские ИИ заставят сдавать экзамен на духовность
Разбираемся в том, как цензура стала захватывать нейросетей.
Недавно в телеграм каналах завирусился скриншот диалога с «Алисой», в котором нейросеть «Яндекса» советовала не ставить национальный мессенджер МАКС на основной смартфон из соображений безопасности.
Алгоритм оперся на негативные отзывы из сети и выдал прямую рекомендацию вопреки официальной позиции разработчиков софта.

Испытательные лаборатории ИИ: как ФСБ, ФСТЭК и Минцифры проверят нейросети
Регуляторы создают в России специализированные испытательные лаборатории ИИ, сообщают «Ведомости». Эксперты проведут тестирование нейросетей и проверку ИИ на соответствие законодательству РФ. К оценке ИИ-моделей привлекут специалистов ФСБ, ФСТЭК и Минцифры. Ведомства внедрят риск-ориентированную методику проверок.
Проверять будут:
- защиту вредных запросов. Сюда же можно включить соответствие традиционным ценностям
- уязвимость к промпт-инъекциям
- устойчивость попыткам взлома алгоритмов (jailbreak).
Разработчики суверенных моделей получат аккредитацию, сертификацию, доступ к госзакупкам и государственной поддержке только после успешного прохождения испытаний.
Лаборатории проверят большие фундаментальные модели на техническую устойчивость и цензуру ИИ.
IT-компаниям придется закладывать дополнительные ресурсы на red teaming и ручную фильтрацию запросов перед каждым релизом.
Как происходит фильтрация ответов технически
Есть разные методы проверки и ограничения ИИ:
- Системный промпт (System Prompt): набор инструкций, который задаёт модели допустимые правила поведения ещё до начала диалога.
- Дополнительно могут использоваться отдельные модели-модераторы (Guardrail Models), которые анализируют запрос пользователя или ответ основной нейросети и блокируют нежелательный контент.
- Ещё один механизм — RLHF (Reinforcement Learning from Human Feedback), то есть обучение с подкреплением на основе отзывов людей. Во время такого обучения специалисты оценивают варианты ответов модели и помогают ей постепенно отдавать предпочтение тем, которые считаются безопасными и соответствующими заданным правилам.
На практике могут использоваться один или несколько из перечисленных методов одновременно
Как цензурируют нейросети в других странах
Первые версии зарубежных моделей работали без жестких фильтров. Любой пользователь легко мог получить рецепты ядов, инструкции по сборке взрывчатки и код вредоносных программ. Доступ к подобной информации еще никогда не был столь доступным.
Разработчики нейросетей быстро внедрили концепции AI safety и AI alignment для блокировки опасных ответов.
Однако помимо потенциально опасной информации, западные компании быстро начали фильтровать и социально чувствительные темы.
Темнокожие офицеры СС от Gemini
Резонансным кейсом стала ошибка нейросети Gemini от Google - на запрос о «солдатах Германии 1943 года» или «отцах-основателях США» генерировала изображения темнокожих и азиатов в угоду повестке. Инструкции по корректности перевесили исторические факты в коде модели. Google временно отключила генерацию изображений людей.
Площадь Тяньаньмень и китайская модель Deepseek
После релиза китайской модели DeepSeek пользователи массово стали пытался вытянуть из нейросети неудобные факты про главную для Китая запретную тему, но об этом разработчики побеспокоились заранее.
Что это значит для россиян
Вряд ли западные компании захотят подстраивать свои языковые модели под российские "традиционные" ценности, поэтому
- в перспективе можно ожидать ограничения доступа россиянам к зарубежным моделям со стороны РКН (сейчас доступ россиянам к своим ИИ блокируют только сами зарубежным компании);
- вырастет стоимость разработки российских нейросетей из-за необходимости внедрять и тестировать фильтры.