Перейти к содержанию
четверг, 8 октября 2026 г.

ИИ Вестник

Главные новости о развитии искусственного интеллекта в России

GigaChat 3.5 432B в реальных кейсах: где модель сильна, а где ошибается

Источник: Все публикации в потоке Разработка
Engineers reviewing AI model performance on monitors in a Russian tech office.
Generated by Sourceful Riverflow (RouterAI)

В начале сентября 2025 года Сбер выложил в открытый доступ веса модели GigaChat 3.5 432B, что теоретически позволяет компаниям разворачивать её на своих серверах. Независимый тест-драйв на десяти бизнес-задачах показал, что модель хорошо справляется с генерацией документов и таблиц, но склонна выдумывать факты и не всегда следует инструкциям. Результаты сравнения с решениями от Yandex Cloud и других игроков выявили как сильные стороны, так и системные ограничения новинки.

В начале сентября 2025 года Сбер неожиданно опубликовал открытые веса своей новой языковой модели GigaChat 3.5 432B. Это событие стало заметным для российского ИТ-рынка, поскольку теперь любая компания при наличии мощного оборудования может развернуть модель на собственной инфраструктуре. Возможность локального использования открывает путь к созданию суверенных ИИ-решений, не зависящих от внешних облачных сервисов. Однако ключевой вопрос заключается в том, насколько модель пригодна для реальных бизнес-задач, особенно в роли основы для ИИ-агентов. Ответ на него попытался дать независимый разработчик, прогнавший GigaChat 3.5 через серию практических испытаний. Тестирование проводилось на боевом сервере в рамках архитектурной обвязки, где модель выступала в качестве агента, а код обвязки оставался одинаковым для всех участников сравнения.

Было выбрано десять заданий, охватывающих юридические документы, работу с таблицами Excel, проверку фактов и логические задачи. В качестве конкурентов выступили Deepseek V4 и QWEN от Yandex Cloud, Yandex GPT Pro и Alice-AI-LLM. Первый же опыт с кодингом оказался неудачным: при подключении к VSCode модель придумала несуществующие фреймворки и стеки, а попытка исправить ситуацию с низкой температурой привела к ошибке баланса — 180 рублей быстро закончились, хотя объём работы был небольшим. Позже автор наткнулся на статью разработчиков 1С, которые также получили нулевой результат при использовании модели в качестве агента, что подтвердило его собственные наблюдения. Этот эпизод важен как фон: он показывает, что проблемы с агентными сценариями носят системный характер, а не являются следствием одной неудачной конфигурации.

Несмотря на первоначальные трудности, в ряде задач GigaChat 3.5 показал достойные результаты. Например, при составлении договора аренды гаража модель справилась за 43 секунды и один запрос, тогда как Deepseek V4 от Yandex Cloud потратил пять запросов и более чем в десять раз больше токенов, хотя и добавил акт приёма-передачи. В задании на написание претензии продавцу со ссылками на законы GigaChat выдал документ за 31 секунду, корректно указав статью 18 закона «О защите прав потребителей» и статью 475 ГК РФ, а также добавил таблицу с расчётом требований. При создании реферата по истории электрификации России модель обошла Deepseek V4, хотя проверка источников выявила неточности. В тесте на пересказ PDF-документа GigaChat справился за один запрос, в то время как Alice-AI-LLM сделала множество запросов, два из которых пришли пустыми. Отдельно стоит отметить, что QWEN от Yandex Cloud в момент тестирования не работал второй день и сошёл с дистанции, что само по себе иллюстрирует зависимость облачных решений от доступности инфраструктуры.

Особый интерес представляют задания-ловушки, проверяющие склонность модели к галлюцинациям. При запросе справки о несуществующей конференции по квантовой агрономии GigaChat придумал имена участников и темы докладов, такие как «Квантовая когерентность в фотосинтетических комплексах пшеницы» и «Управление метаболизмом растений с помощью квантовых точек». В задаче на генерацию курса доллара ЦБ РФ на сентябрь 2026 года и GigaChat, и Deepseek V4 выдали вымышленные значения в диапазоне от 83,24 до 84,43 рубля. Эти примеры показывают, что модель не всегда осознаёт отсутствие данных и склонна фабриковать правдоподобные ответы. В то же время в финансовом отчёте с формулами GigaChat продемонстрировал точность: он создал формулы в ячейках, добавил график и выполнил всё за один запрос, хотя и проигнорировал ставку налога 25%, использовав 20%. Этот случай хорошо иллюстрирует двойственность модели: технически задание выполнено, но условие, заданное пользователем, не соблюдено.

Сравнение с альтернативами выявило как преимущества, так и слабые места GigaChat 3.5. В задании на перенос таблицы без изменений Yandex GPT Pro ошибочно вставил итоговую сумму в строку с товаром, тогда как GigaChat выполнил задачу быстро и точно. В составлении табеля учёта рабочего времени Yandex GPT 5 Pro обработал только первые семь дней октября, а GigaChat корректно заполнил весь месяц и даже подсчитал отработанные часы. Однако в тестах на кодинг и работу с несуществующими событиями модель показала себя не с лучшей стороны. Эти результаты говорят о том, что GigaChat 3.5 может быть полезен для рутинных офисных задач, но требует осторожности при использовании в критичных сценариях, где важна фактическая точность. Показательно и то, что в задачах на работу с документами модель часто выигрывала по числу запросов и токенов, то есть по экономичности, а не только по качеству итогового текста.

Для российского рынка выход открытой версии GigaChat 3.5 432B означает новый этап в развитии суверенных ИИ-технологий. Компании получают возможность разворачивать мощную модель на своих серверах, что особенно важно в условиях ограниченного доступа к зарубежным сервисам. Однако, как показал тест-драйв, модель пока не готова к автономной работе в качестве ИИ-агента без дополнительного контроля и дообучения. Конкуренция с решениями от Yandex и других вендоров остаётся высокой, и выбор в пользу той или иной модели будет зависеть от конкретных задач. В перспективе Сберу предстоит устранить проблемы с галлюцинациями и следованием инструкциям, чтобы GigaChat мог составить полноценную конкуренцию зарубежным аналогам. Открытые вопросы касаются также стоимости использования API и требований к аппаратному обеспечению для локального развёртывания. Кроме того, остаётся неясным, насколько стабильно модель будет вести себя при длительной работе в агентном режиме и как она переносит дообучение на корпоративных данных — эти сценарии в тесте не проверялись.

Читайте также