GigaChat 3.5 Reasoning — первая в России открытая модель с рассуждениями
Команда GigaChat представила GigaChat 3.5 Reasoning — первую отечественную открытую языковую модель, обученную с применением онлайн-обучения с подкреплением (online RL) для полноценных рассуждений. Модель показала значительный рост на ряде бенчмарков по сравнению с предыдущей версией GigaChat 3.5 Instant и доступна на Hugging Face, а также в веб-интерфейсе giga.chat.
Новая модель стала результатом более чем девяти месяцев исследований и экспериментов. В отличие от предыдущих версий, где упор делался на supervised fine-tuning (SFT), здесь после SFT был применён полный цикл online RL. Ключевая особенность — обучение сразу шести независимых экспертов, каждый из которых специализируется на своём домене: математике, программировании, агентных задачах и других. Затем эти эксперты были объединены в одну модель с помощью on-policy дистилляции. По словам разработчиков, такой подход позволил добиться существенного прироста качества именно на задачах, требующих многошаговых рассуждений. Важно понимать, зачем вообще понадобился online RL. На этапе SFT модель запоминает, как выглядит правильный ответ, но не то, как до него дойти: дайте задачу, которой не было в обучающей выборке, и разница видна сразу — модель уверенно начинает, повторяет знакомую структуру рассуждения и сыплется на третьем шаге, не заметив, что противоречит сама себе. Online RL устроен иначе: модель сама решает задачу, результат оценивается, и веса сдвигаются в сторону тех попыток, которые сработали. Слово «online» означает, что обучающие данные модель производит сама по ходу дела, а не берёт из собранного заранее датасета. Постепенно закрепляются приёмы, которые повышают шанс дойти до ответа: перепроверить промежуточный результат, вернуться на шаг назад, зайти с другой стороны. Именно это и называют рассуждением.
Сравнение с GigaChat 3.5 Instant показывает впечатляющую динамику. На бенчмарке GPQA-Diamond (научные вопросы уровня выпускника вуза) точность выросла с 61,11% до 82,32%. На AIME-2026 (математическое соревнование) средний результат при 32 попытках увеличился с 67 до 92 баллов. На IFBench Loose Prompt (оценка следования инструкциям) показатель поднялся с 43,66% до 77,00%. Эти цифры демонстрируют, что модель научилась не просто запоминать шаблоны, а выстраивать цепочки рассуждений и самостоятельно исправлять ошибки. Полные таблицы с результатами и конфигурациями оценок опубликованы в техническом отчёте. Отдельно стоит отметить, почему разработчики отказались от идеи учить одну модель сразу всему. Сначала они попробовали именно такой путь и упёрлись в два ограничения: домены конкурируют за одни и те же веса — прогресс в коде откатывал качество на диалогах, — и оценивать домены приходится по-разному. У задачи по алгебре есть правильный ответ, который можно сверить, а у совета, как написать письмо, такого ответа не существует. Поэтому из одного SFT-чекпоинта были обучены шесть отдельных экспертов, каждый со своей наградой, а затем собранных обратно в одну модель.
Технически обучение строилось на алгоритме CISPO, который является развитием идеи GRPO. Оба алгоритма работают по схеме: модель генерирует несколько ответов на задачу, затем ответы лучше среднего по группе подкрепляются, а хуже — подавляются. Однако GRPO при обновлении весов отключает обучение на токенах, вероятность которых сильно отклонилась от исходной. Для рассуждающих моделей это критично, поскольку самые важные токены — «однако», «проверим», «стоп, здесь ошибка» — изначально редки, и при попытке их усилить они первыми выпадают из обучения. CISPO вместо отключения просто снижает вклад таких токенов, сохраняя сигнал. Это ускоряет сходимость и позволяет модели осваивать именно навык сомнения и возврата к предыдущим шагам. Авторы MiniMax показали это на AIME 2024, у команды GigaChat то же самое повторилось на собственных экспертах. Кроме того, применена динамическая система отбора задач: если модель решает задачу чаще, чем в 75% случаев, она исключается из дальнейшего обучения как уже освоенная. Логика здесь простая: если модель решает задачу во всех попытках, награды в группе одинаковые, среднее равно каждому ответу и градиент нулевой; то же самое происходит, если не решает ни в одной попытке. Полезный сигнал даёт только зона, где модель справляется примерно в половине случаев. Эта зона двигается по мере обучения, поэтому расписание построено вокруг сложности задач. Такой подход не только повышает эффективность, но и экономит до 50% вычислений на инференсе.
Контекст разработки важен для понимания места модели на рынке. До сих пор открытые reasoning-модели в основном появлялись за рубежом — например, серия DeepSeek-R1 или Qwen с поддержкой рассуждений. В России GigaChat 3.5 Reasoning становится первой ласточкой в этом классе. Предыдущие версии GigaChat (3.5 Instant) были хороши в диалогах и генерации текста, но уступали в задачах, требующих логического вывода. Новая модель призвана закрыть этот разрыв и предоставить исследователям и разработчикам инструмент для создания приложений, где нужен не просто ответ, а обоснованное решение. Открытая публикация весов на Hugging Face позволяет сообществу дообучать модель под свои задачи и проводить независимые оценки. Это особенно важно в условиях, когда доступ к некоторым зарубежным сервисам ограничен, а потребность в инструментах логического вывода растёт.
Для российского рынка это событие имеет двойное значение. Во-первых, появляется отечественная альтернатива зарубежным reasoning-моделям, что важно в условиях ограниченного доступа к некоторым зарубежным сервисам. Во-вторых, открытость кода и весов стимулирует локальные исследования в области RL и рассуждений. Отраслевые эксперты отмечают, что такие модели могут найти применение в образовании, науке, разработке ПО и аналитике. Однако остаются вопросы к производительности и стоимости инференса: reasoning-модели обычно требуют больше вычислений из-за генерации длинных цепочек рассуждений. Разработчики пока не раскрывают точных требований к железу, но обещают оптимизации в будущих релизах. Косвенно на масштаб задач указывает и общий фон: по прогнозу Gartner, к концу 2026 года task-specific AI-агенты будут встроены в 40% корпоративных приложений против менее чем 5% в 2025-м по оценке той же Gartner. Для таких сценариев наличие локальной reasoning-модели с открытыми весами может оказаться принципиальным.
В сравнении с альтернативами GigaChat 3.5 Reasoning выглядит конкурентоспособно. Например, на GPQA-Diamond результат 82,32% близок к показателям лучших зарубежных моделей среднего размера. На математическом AIME-2026 рост до 92 баллов также впечатляет. Однако прямое сравнение затруднено из-за разных методологий оценки. Тем не менее, сам факт появления открытой reasoning-модели в России — значимый шаг. В дальнейшем команда планирует расширять число экспертов, улучшать качество награды и, возможно, выпускать специализированные версии для конкретных отраслей. Открытым остаётся вопрос о поддержке мультиязычности и работе с длинными контекстами, что критично для enterprise-задач. Не менее важен и вопрос безопасности: чем автономнее становятся модели и агенты на их основе, тем острее встаёт тема изоляции, разграничения прав и контроля трафика — темы, которые в последние месяцы активно обсуждаются в профессиональном сообществе.
Перспективы GigaChat 3.5 Reasoning зависят от того, как быстро сообщество адаптирует модель и какие сценарии окажутся востребованными. Уже сейчас её можно протестировать в giga.chat, а разработчики могут скачать веса и запустить локально. В ближайшие месяцы ожидаются статьи с деталями обучения, а также обратная связь от пользователей. Если модель покажет стабильность и полезность, она может стать основой для новых продуктов и сервисов. Однако конкуренция в области ИИ усиливается, и чтобы оставаться на передовой, команде GigaChat придётся регулярно обновлять модель и расширять её возможности.