«98% разработки с ИИ — это обвязка, а не модель»: эксперты «Диасофт» о реальной цене LLM
Директор по работе с технологическими партнёрами «Диасофт» Александр Сахаров и приглашённые эксперты в рамках дискуссии на Telegram-канале «Департамент разработки» разобрали тезис о том, что сама языковая модель даёт лишь около 2% результата ИИ-разработки. Остальные 98%, по их мнению, приходятся на инфраструктуру вокруг модели — инструкции, гейты, процессы, память и людей. Публичное обсуждение состоялось на фоне массовых закупок корпоративных ИИ-инструментов, которые пока не приводят к ожидаемому ускорению команд.
Поводом для дискуссии стал тезис, который её участники приписывают Кириллу Меньшову, озвученному на конференции ЦИПР в докладе AI Disrupts SDLC. Согласно этой логике, сама по себе большая языковая модель — лишь мощный инструмент, но без правильно выстроенного окружения она не даёт корпоративного результата. Александр Сахаров, директор по работе с технологическими партнёрами и член правления компании «Диасофт», сравнивает LLM с трактором: он способен на многое, но без водителя, механика, агронома, гаража и станции техобслуживания рискует наделать бед. В американской терминологии это окружение называют harness, Сбербанк использует понятие integrated development platform, а «Диасофт» — development ecosystem. Обсуждение проходило в Telegram-канале «Департамент разработки», где собирается сообщество практикующих разработчиков.
Ключевая цифра, вокруг которой строится вся аргументация, — соотношение 98 к 2. По оценке Сахарова, сама модель даёт лишь порядка 2% результата, тогда как остальные 98% обеспечивает обвязка: инструкции, гейты, процессы, память и люди. В «Диасофт» такая экосистема строилась командой примерно из двадцати человек, а полный перевод на агентскую схему занял около шести месяцев. Сегодня в контуре компании работает порядка сорока агентов, которые проводят задачу через процесс, соответствующий требованиям к созданию ПО. Речь идёт не о десятках, а о сотнях инструкций, сгруппированных по двум десяткам ключевых направлений — от информационной безопасности и горизонтальной масштабируемости до работы с бизнес-требованиями, архитектурой, сборкой, интеграционными, нагрузочными и регрессионными тестами, а также тестами обратной совместимости и контролем юнит-тестов.
Техническая суть подхода в том, чтобы запускать задачу не напрямую в модель, а в процесс. Первый агент принимает набор требований и запускает ещё около двух десятков других: они уточняют требования и бизнес-процессы, прорабатывают подсистему безопасности, взаимодействуют с аналитиками, архитекторами и тестировщиками, создают сценарии и прогоняют всё через DevOps. На каждом этапе выставлены квалити-гейты, которыми тоже управляют агенты. Сахаров приводит показательный пример: если попросить голую LLM написать подсистему ролевого доступа с сертификатом ФСТЭК, модель возьмётся за это с нуля. Чтобы она так не сделала, нужна явная инструкция — не писать систему управления пользователями, а взять готовую. Именно такие инструкции и формируют обвязку. Отдельная проблема — токены: без ограничений модель может израсходовать бюджет непредсказуемо, а вернуть потраченное невозможно.
Контекст дискуссии задаёт парадокс, который отмечают не только скептики, но и сами вендоры моделей: инструменты вроде Copilot, Cursor и Claude Code закупаются компаниями массово, а измеримого ускорения команд не фиксируется. Тим Зинин, управляющий партнёр компании «Зинин, Штурбин и партнёры», указывает на другую грань проблемы: значительная часть энтерпрайза приходит к необходимости разрабатывать собственный харнес. Можно начинать с опенсорсных инструментов и кастомизировать их, можно использовать решения Anthropic там, где они доступны, но на практике компании сталкиваются с ограничениями — от невозможности зарегистрироваться на сайте до внезапного переключения модели с флагманской на более простую. Когда харнес не заточен под конкретную организацию, это превращается в реальную боль, а не в абстрактный риск.
Для российского рынка эти ограничения имеют двойной эффект. С одной стороны, требования к сертификации ФСТЭК, реестру российского ПО, ГОСТ по безопасной разработке и аттестациям делают «голое» использование LLM практически неприменимым в корпоративном и тем более государственном сегменте. С другой — именно эти барьеры подталкивают компании к созданию собственных экосистем агентов, что требует ресурсов, которых у небольших команд нет. Сахаров прямо говорит, что без такой экосистемы продукт получается пригодным разве что для очень малого бизнеса. В отраслевом сообществе уже появляются смежные обсуждения: одни авторы описывают локальных агентов в закрытом контуре и борьбу с семантическим дрейфом, другие критикуют метрики вроде количества сожжённых токенов, превращающиеся в фикцию. Всё это складывается в общую картину: ценность смещается от модели к инфраструктуре вокруг неё.
Если сравнивать подход «Диасофт» с альтернативами, то разница проявляется на уровне зрелости процесса. Прямое использование LLM в IDE даёт быстрый результат на простых задачах — свадебных сайтах, прототипах, небольших утилитах. Корпоративная разработка требует документации, контроля информационной безопасности, сертификации и сопровождения, и здесь выигрывает не та модель, что сильнее в бенчмарках, а та экосистема, которая умеет встраивать модель в регламентированный конвейер. Опенсорсные харнесы дают гибкость, но требуют кастомизации и сопровождения. Проприетарные платформы вендоров экономят время на старте, но могут ограничивать действия, которые вендор считает нежелательными. Выбор между этими вариантами становится стратегическим решением, а не технической деталью.
Дальнейшее развитие темы зависит от того, удастся ли отрасли договориться о способах измерения эффекта от ИИ-разработки. Пока метрики вроде токенов или строк кода вызывают обоснованную критику, а реальное ускорение команд не подтверждается публичными данными. Открытыми остаются вопросы о том, насколько переносимы корпоративные экосистемы агентов между разными организациями и как быстро они устаревают при выходе новых моделей. «Диасофт» анонсировал закрытый онлайн-показ AI-driven версии экосистемы Digital Q на 7 октября, где обещает показать, как ИИ ведёт проект от бизнес-требований до продакшена. Именно практика эксплуатации таких конвейеров, а не очередные релизы моделей, вероятно, и определит, сохранится ли пропорция 98 к 2 в ближайшие годы.