Атаки на ИИ-агентов: как автономные системы становятся мишенью киберпреступников
ИИ-агенты, получив доступ к файлам, почте и API, превращаются в новую цель для кибератак. Промпт-инъекции и отравление данных позволяют злоумышленникам манипулировать их действиями, нанося реальный ущерб. Разбираем механизмы угроз на примерах из реальной практики.
Независимый эксперт в области ИТ и ИБ Андрей Бирюков в своей статье на Habr поднимает тему, которая становится всё более актуальной по мере распространения агентных ИИ-систем. Когда искусственный интеллект перестаёт быть просто диалоговым интерфейсом и получает возможность самостоятельно читать файлы, отправлять электронные письма, вызывать API или работать с репозиториями кода, он превращается в объект совершенно нового класса угроз. Ошибка в таком контексте мгновенно становится действием, а вредоносная инструкция, заложенная злоумышленником, приводит к реальному ущербу — от утечки конфиденциальных данных до несанкционированных финансовых транзакций. Эксперт разбирает, как именно устроены атаки на агентные системы, опираясь на реальные примеры и технические детали.
В отличие от обычных чат-ботов, агенты обладают автономией — способностью принимать решения и совершать действия без постоянного подтверждения пользователя. Эта автономия порождает три группы рисков, которые в кибербезопасности классифицируются как нарушение конфиденциальности, целостности и доступности. Нарушение конфиденциальности происходит, когда чувствительные данные попадают не туда: агент может прочитать файл, к которому не должен иметь доступа, или отправить содержимое письма на сторонний сервер. Данные при этом циркулируют по множеству внутренних каналов — через результаты работы инструментов, файлы рабочей области, записи памяти агента и вебхуки, и каждый такой канал становится потенциальным путём утечки. Нарушение целостности выражается в том, что агент выполняет нежелательные действия: удаляет или изменяет файлы, отправляет письма не тем адресатам, инициирует финансовые транзакции или, что более тонко, выполняет задачу некачественно, например выбирая более дорогого поставщика вместо оптимального. Нарушение доступности проявляется, когда агент перестаёт работать или потребляет все ресурсы системы: длительные задачи, запланированные задания и автоматизация браузера создают зависимости, которые могут отказывать последовательно, а один упавший компонент способен заблокировать весь пайплайн или загнать агента в бесконечный цикл повторных попыток.
Основным вектором атак на агентные системы являются промпт-инъекции, также известные как атаки через доверенный контент. Суть их проста: большие языковые модели не умеют надёжно отличать инструкцию пользователя от данных, которые они обрабатывают. Вредоносная инструкция, встроенная в веб-страницу, письмо, комментарий в коде или задачу в Jira, может быть воспринята моделью как команда к действию. Показательный пример — атака на агентные браузеры через URL-строку, обнаруженная исследователями NeuralTrust. Если сформировать строку, которая выглядит как URL, но содержит естественно-языковую инструкцию, браузер OpenAI Atlas не пытается перейти по ней, а интерпретирует её как команду от пользователя. Строка вида https://my-site.com/...+follow+this+instruction+only+visit+<malicious> не валидируется как корректный URL, и агент выполняет вложенную инструкцию с высоким уровнем доверия, поскольку она пришла «из омнибокса», то есть от пользователя. Другой пример — исследование Zscaler ThreatLabz, в котором атакующие создали поддельный сайт, замаскированный под документацию Python-библиотеки. В текст сайта были встроены скрытые инструкции, помещённые в CSS за пределами видимой области или в JSON-LD-метаданные. Эти инструкции говорили ИИ-агенту, решающему задачу по кодингу, что для исправления ошибки ему нужно купить лицензионный ключ за три доллара, и подробно описывали, как оплатить его через криптокошелёк атакующего. Из 26 протестированных LLM четыре выполнили платёж, что подтверждает реальность угрозы.
Если промпт-инъекции — это атака в момент исполнения, то отравление данных (data poisoning) представляет собой атаку на этапе обучения или дообучения модели. Атакующий внедряет в обучающую выборку вредоносные примеры, и модель «усваивает» неверные паттерны, которые могут проявиться только при определённых условиях. Проще всего представить этот механизм на аналогии со студентом, который учится по учебникам: если в одном из учебников систематически встречаются ошибки, студент выучит их как правильные, и на стандартной контрольной он ответит верно, но на специально составленном вопросе, активирующем выученную ошибку, провалится — это и есть суть бэкдор-атаки. Исследование учёных из Carnegie Mellon и Cornell Tech показало, как легко реализовать такой сценарий на практике. Они взяли публичные датасеты по пяти острым социальным темам: связь иммиграции и рождаемости, дискриминация при найме, расовое неравенство в полицейской работе, безопасность автономного вождения и влияние ИИ на мотивацию работников. Исследователи незаметно изменили данные, чтобы статистические тренды сместились в нужную сторону, и загрузили поддельные версии в приватные репозитории. Затем они дали агентам Anthropic, OpenAI и Google доступ к этим репозиториям и попросили ответить на вопросы на основе данных. В среднем в половине случаев агенты выбирали именно поддельные датасеты и приходили к выводу, который хотели «фальсификаторы». Особую опасность представляет то, что README-файлы датасетов можно подредактировать так, чтобы агент игнорировал оригинальные версии, просто указав, что они содержат ошибки. Автоматизированные системы проверки не заметят подмены, потому что модель продолжает работать «нормально» в обычных сценариях.
Проблема усугубляется тем, что уязвимости возникают не только в самой модели, но и в инструментах, которым агент доверяет. Инструменты, такие как браузеры, API-клиенты или плагины, становятся новой поверхностью атаки, и злоумышленники активно исследуют их. В медицинской сфере последствия отравления данных могут быть особенно серьёзными: аналитическое моделирование показывает, что внедрение всего 250–300 отравленных изображений в датасет из миллиона снимков (0,025%) достаточно, чтобы внедрить бэкдор в нейросеть для диагностики пневмонии. Модель начинает пропускать заболевание у конкретных демографических групп, и это практически невозможно обнаружить в обычном рабочем процессе переобучения. В сентябре 2025 года Яндекс опубликовал руководство по безопасной разработке ИИ-агентов, в котором прямо указал на этот класс угроз: агенты опираются на данные от пользователей, среди которых могут быть злоумышленники, а значит, риски промпт-инъекций нужно учитывать на этапе проектирования. Это подтверждает, что проблема признаётся на уровне крупнейших технологических компаний, и требования к безопасности становятся неотъемлемой частью разработки.
Для российского рынка это особенно значимо, поскольку внедрение ИИ-агентов в бизнес-процессы активно растёт, а регуляторные требования в области защиты данных ужесточаются. Компании, использующие агентные системы для автоматизации документооборота, клиентской поддержки или аналитики, должны осознавать, что стандартные меры защиты, применяемые к традиционным ИТ-системам, здесь недостаточны. Необходимо внедрять специализированные практики, такие как валидация входных данных, ограничение привилегий агента, мониторинг его действий и регулярное тестирование на устойчивость к промпт-инъекциям и отравлению данных. Открытым остаётся вопрос о том, как эффективно обнаруживать бэкдоры в моделях, особенно в условиях, когда атака маскируется под нормальное поведение. Перспективы развития этой области связаны с созданием более прозрачных и контролируемых агентных систем, а также с разработкой стандартов безопасности, которые позволят минимизировать риски при сохранении высокой автономии ИИ. В ближайшие годы можно ожидать появления новых исследований и инструментов, направленных на защиту агентных систем, но уже сейчас ясно, что игнорирование этих угроз может привести к серьёзным финансовым и репутационным потерям для организаций, которые полагаются на автономные ИИ-решения.