1352 кейса внедрения ИИ в России: почему в продакшене побеждает не модель, а обвязка
АНО «Цифровые платформы» собрала каталог из 1352 проектов внедрения искусственного интеллекта в российских компаниях и госорганах. Анализ кейсов 2025–2026 годов показывает: успех в продакшене определяет не качество модели, а инфраструктурная обвязка — семантический слой, пороги уверенности, детерминированный код и участие человека.
В каталоге кейсов внедрения искусственного интеллекта, который ведёт АНО «Цифровые платформы», накопилось 1352 проекта из российских компаний и государственных структур. Среди них — антифрод Сбера, распознавание сорняков с дронов у «Русагро» и десятки других инициатив. Анализ внедрений 2025–2026 годов выявил устойчивые закономерности: что повторяется от проекта к проекту, где системы ломаются и где действительно приносят деньги. Главный вывод формулируется кратко: в кейсах, дошедших до продакшена и измеримого результата, качество модели почти никогда не является решающим фактором.
Ключевые цифры подтверждают этот тезис. В Первой Грузовой Компании ИИ-агент операционной аналитики отвечает логистам на вопросы о выгрузке вагонов и выполнении плана, но модель не пишет SQL-запросы напрямую. Между ней и хранилищем стоит семантический слой с описанными метриками, а параметризованный запрос собирает конструктор. Сводка по 150 объектам формируется за минуты вместо часа. В Яндексе робот-документатор витрин данных на LLM описал 15 000 таблиц за полгода против 500 за предыдущий год. Секрет не в модели: сначала робот собирает объективный контекст (схемы, глоссарий, связи через граф), и только затем LLM дописывает поверх. Вторая модель независимо оценивает результат, достигая 92% семантического совпадения с проверкой человека и экономя около пяти человеко-лет аналитиков. В Альфа-Банке автономный агент на локальной Qwen 3.6-35B стал предсказуемым после выноса всей детерминированной обработки данных в отдельные сервисы на Go, а модели оставили лишь потребление результата. В ДОМ.РФ платформа интеллектуальной обработки документов на LLM и RAG сохраняет классический ML для классификации и извлечения сущностей, а LLM подключается только там, где нужен ответ в свободной форме. Это и есть рабочее определение корпоративного ИИ-агента сегодня: детерминированный код думает, модель говорит.
Технические подробности из кейсов указывают на важность порогов уверенности и участия человека. Ни один крупный проект с деньгами не построен на полной автоматизации. Система CV-модерации фотоотчётов «Иваныч» в X5 проверяет 10 млн фотоотчётов в месяц из 27 тысяч магазинов «Пятёрочки» и «Перекрёстка». Это 26 моделей и 62 типа проверок: классификаторы чистоты, детекция зон, VLM-проверки ценников, YOLO плюс OCR для сроков годности. На пороговых значениях уверенности подключается человек. Точность выросла с 79 до 92 процентов, операционные расходы на модерацию снизились вдвое, а большую часть времени система работала на 4 vCPU и 16 ГБ памяти. В VK Видео первая попытка заменить асессоров VLM-разметкой провалилась. Сработал гибрид: дообученная Qwen3-VL-4B размечает поток, человек проверяет пограничные случаи, а качество контролирует Golden Set. Стоимость точки разметки упала в 60 раз, 4,5 млн примеров собрали за пять дней. Самый честный кейс в этой группе у AGIMA: детектор промпт-инъекций дообучали пять раз, в продакшен ушёл один раунд, три откатили из-за деградации. Ложные блокировки упали со 140 до 1 на 179 безопасных текстов. Пять раундов на один успешный — нормальная цена, просто о ней редко пишут.
Контекст и бэкграунд показывают, что агентные цепочки живут в среднем пять-шесть шагов. Петрович-Тех сравнил облачные и локальные модели в агентной обвязке: три модели (облачная Claude Sonnet, облачная Qwen3-235B и локальная Qwen3.5-9B на одной видеокарте) по трём сценариям, 27 запусков. Двухшаговая задача: успех во всех девяти прогонах, локальная 9B ничем не хуже. Трёхшаговая: локальная модель дала 100% точности, облачные отклонились от инструкции. Пятнадцатишаговая: ни одного полного успеха из 27, и хуже всего то, что модели рапортовали о завершении, которого не было. VK Tech с локальным ИИ-агентом на Ollama в закрытом контуре на арендованной A30 с двумя моделями (gpt-oss:20b и qwen3-vl:8b) получил ту же границу с другой стороны: надёжная работа до примерно шести последовательных вызовов инструментов. Ответ на это ограничение тоже виден в кейсах, и он снова про обвязку. Команда GigaChain сделала профиль GigaChat для агентного фреймворка Deep Agents: десять промпт-блоков под классы отказов плюс middleware на уровне кода (LoopBreaker, ShellSafety, PathNormalizer). Точность GigaChat на 391 задаче выросла с 77 до 87 процентов, расход токенов упал почти вдвое. Модель не менялась. Отсюда же рост MCP как корпоративного стандарта интеграции: платформа агентной разработки с mcp-hub в Авито, MCP-сервер дизайн-системы для агентов вёрстки в X5, MCP-сервер банковских операций для ИИ-агентов в Сбере. Агенту дают не «доступ к системам», а шесть-семь проверенных инструментов с контрактами.
Значение для российского рынка и реакция отрасли подчёркивают, что ассистент разработчика даёт разы на узких задачах и ноль на широких. Узкие задачи: X5 подключил агенту вёрстки знание реальной дизайн-системы через MCP — экран стал занимать 2-3 часа вместо 8, команда из трёх человек делает 10 экранов в день вместо трёх. КОРУС Консалтинг сгенерировал моделями утилиту для выгрузки метаданных Qlik Sense, около тысячи строк, за шесть часов и 15 промптов. Широкая задача: пилот агентной разработки в Авито на 100 инженерах с платформой из skills-hub, mcp-hub и Spec-Driven Development не дал статистически значимых изменений объективных метрик разработки. Качество не упало, удовлетворённость высокая, эффект в метриках отсутствует. Авито объясняет это J-кривой обучения и считает окупаемость так: при зарплате 2500 долларов и подписке за 100 достаточно ускорения на 4 процента, то есть 6,4 часа в месяц. Вывод для тех, кто это покупает: измерять надо конкретный процесс (вёрстка экрана, ревью, разбор инцидента), а не «производительность разработчиков». В MWS так и сделали: агент р
Сравнение с альтернативами показывает, что на рынке появляются инструменты, подчёркивающие важность обвязки. Например, в дополнительных материалах упоминается опенсорсный пак скиллов paranoid-qa для Claude Code, который заставляет агента тестировать с доказательной дисциплиной. За 11 недель работы с AI-тестировщиком было проведено 277 агентских часов и 213 часов человека, что дало 94 подтверждённые находки. Первая версия счёта оказалась завышенной почти вдвое. Это ещё раз подтверждает, что даже при использовании мощных моделей ключевую роль играет методика и контроль. Также отмечается проблема безопасности сторонних MCP: подключение внешних серверов может привести к утечкам данных и финансовым потерям, как в случае с фейковыми сообщениями от имени сотрудника. Это подчёркивает необходимость тщательной проверки и ограничения доступа агентов.
Перспективы и открытые вопросы остаются. Рынок движется к стандартизации обвязки, но многие компании всё ещё фокусируются на выборе модели, упуская из виду инфраструктурные аспекты. Будущее за гибридными решениями, где детерминированный код управляет процессом, а LLM отвечает за генерацию и интерпретацию. Однако остаётся неясным, как масштабировать такие системы на все бизнес-процессы и как обеспечить безопасность при росте числа агентов. Ответы на эти вопросы, вероятно, появятся в следующих кейсах каталога.