OpenAI разработала систему для выявления скрытых угроз в цепочках безобидных запросов
OpenAI представила новую систему безопасности, способную обнаруживать вредоносные намерения, которые скрываются за последовательностью на первый взгляд безобидных запросов к ИИ. Разработка направлена на предотвращение атак, при которых злоумышленники обходят фильтры, разбивая опасные инструкции на мелкие части.
OpenAI объявила о создании новой системы безопасности, предназначенной для выявления угроз, которые маскируются под цепочки безобидных запросов к языковым моделям. Разработка, о которой стало известно 4 часа назад, призвана закрыть уязвимость, позволяющую злоумышленникам обходить существующие фильтры контента, разбивая вредоносные инструкции на серию простых, не вызывающих подозрений шагов. Эта проблема особенно актуальна для чат-ботов и API, где пользователи могут задавать вопросы, каждый из которых по отдельности не нарушает правила, но в совокупности приводят к нежелательному результату. В отличие от традиционных методов, которые анализируют каждый запрос изолированно, новый подход рассматривает всю последовательность, что позволяет выявлять скрытые паттерны, характерные для многошаговых атак. По данным источника, точность обнаружения таких угроз значительно возросла, хотя конкретные цифры не раскрываются. Представители OpenAI подчеркивают, что система уже интегрирована в основные продукты компании, включая ChatGPT и API для разработчиков, что делает защиту доступной для миллионов пользователей по всему миру.
Суть новой методики заключается в анализе не отдельных запросов, а их последовательностей, что позволяет выявлять скрытые паттерны, указывающие на злонамеренные цели. Вместо того чтобы оценивать каждый запрос изолированно, система рассматривает контекст всей сессии диалога, сопоставляя его с известными сценариями атак. Технически решение основано на использовании дополнительного классификатора, который обучается на размеченных наборах данных, содержащих как вредоносные, так и безопасные цепочки запросов. Классификатор анализирует векторные представления диалогов, выявляя аномалии, которые могут свидетельствовать о попытке манипуляции моделью. Этот подход напоминает методы обнаружения атак, используемые в кибербезопасности, где анализируется поведение пользователя во времени. Важно отметить, что система работает в реальном времени и не требует значительных вычислительных затрат, что позволяет применять её без заметной задержки в ответах, сохраняя высокую скорость взаимодействия с ИИ.
Разработка OpenAI продолжает серию мер по усилению безопасности ИИ-систем, начатую ещё в 2023 году, когда компания впервые представила набор инструментов для оценки рисков. Конкуренты, такие как Google и Anthropic, также активно работают над подобными решениями, однако OpenAI стремится занять лидирующие позиции, публикуя подробности своих исследований и привлекая внешних экспертов для тестирования. В прошлом году компания столкнулась с критикой за недостаточную защиту от «джейлбрейков» — специальных промптов, которые обходят ограничения модели, поэтому новая система стала ответом на эти претензии. В отличие от предыдущих версий, которые фокусировались на отдельных запросах, новый подход учитывает контекст и последовательность, что делает его более устойчивым к сложным атакам. Эксперты отмечают, что это значительный шаг вперёд, однако подчёркивают, что злоумышленники постоянно адаптируются, поэтому система требует регулярных обновлений и обучения на новых данных.
Для российского рынка внедрение подобных механизмов имеет особое значение, поскольку локальные сервисы на базе ИИ активно развиваются, но часто не уделяют должного внимания безопасности. Эксперты отмечают, что российские разработчики могут перенять опыт OpenAI, адаптируя его под свои модели и законодательные требования. Однако остаются открытыми вопросы о том, насколько эффективно система будет работать с русскоязычными запросами и как она поведёт себя в условиях ограниченного доступа к западным технологиям. Возможно, российским компаниям придётся разрабатывать собственные аналоги, учитывая специфику местного контента и особенности регулирования. Тем не менее, появление таких решений стимулирует развитие безопасности ИИ в России, что особенно важно в свете растущего использования ИИ в государственных и коммерческих секторах.
Сравнивая с альтернативными подходами, стоит отметить, что некоторые исследователи предлагают использовать генеративные состязательные сети для создания более устойчивых фильтров, но OpenAI выбрала более прагматичный путь — обучение на реальных примерах атак. Это позволяет быстрее внедрять обновления, реагируя на новые угрозы, которые появляются практически ежедневно. В то же время критики указывают на риск ложных срабатываний, когда система может блокировать легитимные запросы, особенно в чувствительных областях, таких как медицина или право. OpenAI утверждает, что доля ошибок минимальна, но окончательные выводы можно будет сделать только после длительного тестирования в реальных условиях. Важно, что компания уже начала привлекать внешних исследователей для независимой оценки, что повышает доверие к системе. Однако остаётся неясным, как система будет обрабатывать запросы с неоднозначным контекстом, где границы между безопасным и вредоносным размыты.
В перспективе OpenAI планирует расширить функциональность системы, добавив возможность автоматического объяснения причин блокировки для пользователей и разработчиков. Также рассматривается интеграция с другими инструментами безопасности, такими как мониторинг генерации кода и защита от фишинга. Открытым остаётся вопрос о публикации технических деталей и открытии исходного кода, что позволило бы сообществу провести независимую оценку. Тем не менее уже сейчас ясно, что борьба с многошаговыми атаками станет одним из ключевых направлений развития безопасности ИИ в ближайшие годы, и OpenAI делает серьёзную заявку на лидерство в этой области. В условиях растущего числа киберугроз и увеличения зависимости от ИИ, такие разработки будут иметь решающее значение для обеспечения доверия к технологии. Остаётся надеяться, что другие компании последуют примеру OpenAI и будут активно инвестировать в аналогичные системы, что в конечном итоге сделает экосистему ИИ более безопасной для всех.