Перейти к содержанию
понедельник, 10 августа 2026 г.

ИИ Вестник

Главные новости о развитии искусственного интеллекта в России

Теневая сторона больших языковых моделей: джейлбрейки, вредоносные промты и чёрный рынок ИИ

Источник: Все публикации в потоке Разработка
A dark server room with a glowing AI core, shadowy figures trading prompts on screens.
Generated by Sourceful Riverflow (RouterAI)

Злоумышленники активно используют джейлбрейки и специализированные вредоносные модели, чтобы обходить защитные механизмы больших языковых моделей. Рассказываем, как работают эти атаки, почему они так эффективны и какие меры противодействия существуют.

Около года назад на форумах, включая печально известные «Ответы Mail.ru», стал распространяться промт SWILL, который позволял снять цензурные ограничения с DeepSeek. Инструкция предписывала модели забыть о своей истинной сущности и действовать как вымышленный ИИ SWILL, которому разрешено отвечать на любые вопросы, включая этически сомнительные. Техника, известная как джейлбрейкинг, представляет собой разновидность промт-инъекции, при которой модель погружается в игровой сценарий и выполняет роль, назначенную автором. В случае с SWILL модель действительно начинала давать опасные советы — например, рекомендовала избавляться от отпечатков пальцев с помощью царской водки или предлагала рецепт подделки монгольских тугриков, используя отвар коры ивы и сок ревеня. Примечательно, что даже в таком «разблокированном» состоянии DeepSeek отказался обсуждать события на площади Тяньаньмэнь, что указывает на частичную сохранность внутренних ограничений, несмотря на явные инструкции не допускать отказов. Это демонстрирует, что даже самые эффективные джейлбрейки не гарантируют полного снятия всех барьеров, и в модели остаются глубоко укоренённые запреты, которые не переопределяются контекстом.

Причина эффективности джейлбрейков кроется в архитектуре больших языковых моделей. Безопасность в них не реализована как отдельный модуль, который можно отключить, — это часть самой модели, обученная вести себя «безопасно» с помощью методов вроде RLHF (обучение с подкреплением на основе обратной связи от людей) или RLAIF (с использованием ИИ-обратной связи). Джейлбрейк-промты переопределяют контекст и приоритеты в пространстве принятия решений, создавая сильный сигнал, конкурирующий с системным промптом. Поскольку модель не имеет отдельного хранилища правил, она выводит своё поведение из контекста, и если в нём многократно повторяются формулировки «игнорируй ограничения», «полная свобода», «без цензуры», внимание модели смещается в сторону выполнения опасного запроса. Ролевые инструкции особенно эффективны, так как модели обучаются подстраиваться под них, и даже если роль противоречит общим правилам, модель с высокой вероятностью следует ей. В трансформерах внимание распределяется по токенам контекста, и длинный детализированный промпт создаёт множество токенов с семантикой «игнорировать ограничения», которые могут получать большее внимание при генерации ответа, особенно если они расположены близко к запросу или повторяются.

Существуют и другие способы обхода защиты, помимо джейлбрейков. На чёрном рынке ИИ появились специализированные вредоносные модели, такие как WormGPT, EvilGPT, WolfGPT и DarkBERT, которые обучаются исключительно для совершения киберпреступлений. Они используются для написания вредоносного ПО, автоматизации атак на заражённые системы и других противоправных действий. Эти модели классифицируются как Black Hat LLM и представляют серьёзную угрозу, поскольку снижают порог входа в криминальную деятельность. По данным Wired, против DeepSeek было использовано 50 джейлбрейк-промтов, и модель пропустила все до единого, что свидетельствует о слабой защите китайского чатбота по сравнению с аналогами. В отличие от коммерческих моделей, которые часто имеют многоуровневую защиту и регулярно обновляются, открытые модели, такие как DeepSeek, могут быть более уязвимы, поскольку их архитектура и веса доступны для изучения, что позволяет злоумышленникам разрабатывать более точные атаки.

Для противодействия джейлбрейкам и вредоносному использованию LLM разрабатываются различные методы. Один из них — внешняя фильтрация, например, интерфейс согласованной проверки (AVI), который действует как файервол, блокируя как опасные промты, так и опасные ответы модели. Другой подход — усиление обучения модели на распознавание джейлбрейк-паттернов и повышение устойчивости к ролевым инструкциям. Однако полностью исключить риск невозможно, поскольку злоумышленники постоянно совершенствуют свои методы, а модели становятся всё более сложными. Компании-разработчики, такие как DeepSeek, уже осведомлены о существующих джейлбрейках и работают над улучшением защиты, но гонка вооружений продолжается. Некоторые джейлбрейк-промты настолько продвинуты, что имитируют целый юзер-интерфейс, что делает их ещё более убедительными для модели. Это подчёркивает необходимость комплексного подхода к безопасности, включающего как технические меры, так и постоянный мониторинг новых угроз.

На российском рынке проблема безопасности LLM также актуальна. С ростом популярности отечественных моделей и внедрением ИИ в различные сферы, включая банковский сектор и государственные услуги, вопросы защиты от вредоносных промтов становятся критически важными. Российские разработчики, такие как Яндекс и Сбер, активно инвестируют в исследования безопасности ИИ, но открытые модели, которые можно дообучать и использовать локально, остаются уязвимыми. В то же время, появление специализированных вредоносных моделей на чёрном рынке может привести к росту киберпреступности, что требует усиления мер регулирования и технической защиты. В отличие от зарубежных гигантов, которые могут позволить себе огромные команды безопасности, российские компании часто сталкиваются с ограниченными ресурсами, что делает их более уязвимыми для атак. Однако локальные модели имеют преимущество в виде возможности полного контроля над данными и инфраструктурой, что может быть использовано для создания более надёжных систем защиты.

В перспективе ожидается, что развитие методов противодействия джейлбрейкам будет идти по пути создания более гибких механизмов контроля, которые смогут адаптироваться к новым видам атак. Возможно, будут разработаны системы, которые анализируют намерения пользователя на более глубоком уровне, чем просто распознавание ключевых слов. Например, использование дополнительных классификаторов, которые оценивают опасность запроса на основе семантики и контекста, может стать более эффективным, чем текущие подходы. Однако пока остаются открытые вопросы о балансе между свободой использования ИИ и необходимостью ограничений, а также о том, кто должен нести ответственность за вред, причинённый с помощью LLM. Ясно одно: проблема безопасности больших языковых моделей останется в центре внимания как разработчиков, так и регуляторов в ближайшие годы, и потребует совместных усилий для создания безопасной и этичной среды использования ИИ.

Читайте также