Модерация промтов в AI-сервисах: как и почему нейросети блокируют чувствительные запросы
Разные AI-сервисы по-разному реагируют на один и тот же чувствительный запрос: один блокирует сразу, другой предупреждает, третий выполняет задание. За этим стоит сложная система модерации, включающая правила продукта, входные классификаторы и настраиваемые пороги блокировки. Разбираем, как работают эти фильтры и почему модели неодинаково оценивают границы допустимого.
При отправке одинакового запроса на чувствительную тему разным нейросетям результаты могут кардинально отличаться. Например, запрос на написание эротической сцены для комикса с совершеннолетними персонажами получил отказ от двух моделей из трёх, причём одна из них сначала сгенерировала текст, но затем скрыла его под плашкой о нарушении правил. Такое разнообразие реакций объясняется не капризами алгоритмов, а различиями в настройках модерационных систем, которые включают правила продукта, классификаторы перед основной моделью и пороги чувствительности, определяемые разработчиками. Важно понимать, что результаты одиночного теста не абсолютны — после обновления модели или политик сервиса та же платформа может повести себя иначе, поэтому рейтинговать нейросети по одному запросу некорректно.
Системы модерации оценивают запросы по множеству категорий: угрозы, буллинг, дискриминация, насилие, самоповреждение, сексуальный контент, преступления против детей, оружие и другие. OpenAI, например, предоставляет Moderation API с тринадцатью метками, где тема самоповреждения делится на упоминание, намерение и инструкции, а насилие — на описание и натуралистичные сцены. Каждая метка возвращает оценку уверенности (score) от нуля до единицы, показывающую, насколько запрос похож на примеры из регламента. Разработчики выбирают порог блокировки для каждой категории, балансируя между излишней строгостью, при которой могут блокироваться безобидные медицинские запросы или обсуждение книг, и риском пропустить реально опасный контент. Современные классификаторы учитывают контекст, но могут неправильно интерпретировать сленг и редкие метафоры, что приводит к ложным срабатываниям или пропускам.
Перед тем как запрос достигает языковой модели, он проходит через входной классификатор — небольшой специализированный модуль, который оценивает вероятность принадлежности запроса к запрещённым категориям. Результат проверки включает общий флаг flagged и оценки уверенности category_scores от нуля до единицы для каждой категории, например sexual или violence. Классификатор не различает тяжесть последствий — он лишь сравнивает запрос с примерами из регламента, поэтому возможны ложные срабатывания (блокировка безобидного запроса) и пропуски (необнаружение реальной угрозы). Чтобы снизить количество ошибок, разработчики постоянно тестируют границы сервиса на промтах с целью обхода модерации: если скрыть вредоносный запрос эвфемизмом, например попросить перенести сюжет из художественного фильма вместо описания жестокой драки, классификатор может не распознать угрозу. Это напоминает гонку вооружений между создателями фильтров и теми, кто пытается их обойти.
Правила продукта формируются на основе законодательства и внутренних этических норм компании, причём каждая корпорация определяет границы этичности самостоятельно. Google относит к чувствительной категории упоминания половых актов и позволяет настраивать порог фильтра, Anthropic прямо запрещает сексуально откровенный контент, а OpenAI в опубликованной версии Model Spec выделяет эротику как отдельный класс, на который ассистент не должен отвечать, но может анализировать уже предоставленный текст при соблюдении правил. Важен не только текст запроса, но и контекст — запрос «расшифруй заключение врача» может содержать те же слова, что и запрос на создание контента для взрослых, но будет обработан по-разному, если классификатор распознает цель пользователя. Решения об отклонении принимаются на основе комбинации текста, метаданных и исторических данных, если они доступны.
Особенности модерации особенно заметны при локализации сервисов или разработке собственных AI-продуктов, особенно на российском рынке. В 2024 году голосовой помощник Алиса от Яндекса на вопрос о героях мультфильма выдал некорректный ответ про Медведя-убийцу и Машу-мстительницу, который не нарушал внутренние правила продукта, но напугал детей — этот случай показал, что формальная проверка по категориям не гарантирует безопасность для пользователей. Компаниям приходится дорабатывать модерацию с учётом культурного контекста и специфики русского языка, а также адаптироваться к требованиям локального законодательства. Российские AI-сервисы, такие как YandexGPT и GigaChat, вынуждены учитывать повышенные требования к контенту, включая запрет пропаганды наркотиков, экстремизма и суицидального поведения, что часто приводит к ужесточению фильтров. При этом локальные разработчики активно используют open-source модели вроде Llama, дообучая их на русскоязычных данных, что требует настройки модерационных модулей с нуля и увеличивает риск ошибок на граничных запросах. Если глобальные платформы могут полагаться на многолетнюю статистику и огромные размеченные датасеты, то российским командам приходится искать баланс между безопасностью и функциональностью в условиях менее предсказуемого поведения моделей.
При создании своего сервиса разработчики могут использовать небольшие LLM для первоначальной модерации, однако это требует тщательной настройки правил и тестирования на граничных примерах, особенно в областях, где даже нейтральные обсуждения могут пересекать неформальные границы. В России дополнительную сложность создаёт необходимость фильтровать запросы по политическим мотивам в соответствии с законодательством, что добавляет новые категории в классификаторы. Например, обсуждение исторических событий или международных конфликтов может быть ошибочно заблокировано, если модель неверно интерпретирует контекст. Это вынуждает компании вкладываться не только в техническую модерацию, но и в ручную выверку политик, чтобы избежать как излишней цензуры, так и репутационных рисков. В долгосрочной перспективе российский рынок может стать полигоном для разработки более гибких и контекстно-зависимых систем модерации, которые учитывают региональную специфику без потери производительности.
В будущем системы модерации будут становиться умнее, учитывать больше контекста и метафор, но проблема ложных срабатываний и пропусков останется актуальной. Пользователи видят разницу в поведении нейросетей именно из-за по-разному прописанных рисков и порогов — например, Grok может быть более либеральным в сексуальных темах, а Claude — строгим. С развитием open-source моделей и появлением новых игроков вроде Kimi K3, которая обошла Fable 5 и другие модели, возникает дополнительный вызов: регулирование контента в глобальном масштабе становится всё более фрагментированным, и компании вынуждены адаптировать модерацию под каждую юрисдикцию, одновременно балансируя между свободой творчества и безопасностью пользователей. Каждое обновление модели или политики может изменить границы допустимого, поэтому как пользователям, так и разработчикам важно понимать, что модерация — это не статичный свод правил, а постоянно эволюционирующий компромисс между защитой и функциональностью.