Перейти к содержанию
понедельник, 21 сентября 2026 г.

ИИ Вестник

Главные новости о развитии искусственного интеллекта в России

Яндекс открыл веса AliceAI-Foundation-80B-A3B-Base: обучена с нуля и обходит более крупные модели

Источник: Все публикации в потоке Разработка
Server racks glowing in a dim data center, engineer reviewing code.
Generated by Sourceful Riverflow (RouterAI)

Яндекс выложил в открытый доступ веса новой языковой модели AliceAI-Foundation-80B-A3B-Base под лицензией Apache 2.0. Модель обучена с нуля без использования сторонних опенсорсных весов и, по заявлениям разработчиков, превосходит более крупные аналоги на ряде задач.

Яндекс объявил о публикации весов языковой модели AliceAI-Foundation-80B-A3B-Base. Релиз распространяется под лицензией Apache 2.0, что позволяет свободно использовать модель, модифицировать и распространять её, в том числе в коммерческих целях. Ключевая особенность новинки в том, что она прошла полный цикл обучения в Яндексе с нуля: разработчики не применяли веса сторонних опенсорс-моделей. По словам компании, это ещё один шаг к созданию единой рассуждающей модели (ЕРМ), на базе которой будут развиваться агентские возможности Алисы AI. Публикация именно весов, а не только технического отчёта, означает, что сообщество получает не просто описание архитектуры, а готовый артефакт для дообучения и экспериментов.

В претрейн-замерах модель обходит более крупные DeepSeek-V4-Flash-Base и Nemotron-3-Super на многих задачах — от фактологических и экспертных вопросов до математики и программирования. На сложных бенчмарках IMO AnswerBench и LiveCodeBench она лидирует среди сравниваемых открытых претрейнов. Предыдущую закрытую Alice AI LLM 235B новая модель превосходит по фактологическим знаниям, математике, программированию и работе с длинным контекстом, имея при этом почти втрое меньше общих параметров и примерно в семь раз меньше активных. В сравнении с Qwen3.5-35B-A3B-Base, GLM-4.5-Air-Base (106B-A12B), Nemotron-3-Super-120B-A12B-Base и DeepSeek-V4-Flash-Base (284B-13B) новая модель занимает первое место на 8 из 10 бенчмарков фактологических знаний, образования и экспертных навыков, несмотря на то что все конкуренты, кроме Qwen, крупнее неё. Важная оговорка: все результаты получены на финальном чекпоинте после reasoning-стадии претрейна, а агентские навыки проверялись отдельно после SFT, поэтому прямое сравнение с конкурентами требует аккуратности.

Архитектурно AliceAI-Foundation-80B-A3B-Base использует схему Mixture-of-Experts (MoE), что подтверждается обозначением A3B (около 3 млрд активных параметров при 80 млрд общих). Обучение заняло около полугода: за это время команда пересобрала корпус данных, перебрала архитектурные решения, подобрала гиперпараметры и добавила данные для рассуждений и агентских взаимодействий. Вместе с весами опубликован большой технический отчёт, охватывающий пайплайны подготовки данных, протоколы оценки, стабилизацию обучения и scaling laws. Для ключевых решений приведены абляционные эксперименты и разбор подходов, от которых пришлось отказаться. Вклад обновлённого корпуса, архитектуры и гиперпараметров проверяли в серии обучений с нуля — по 2 трлн токенов каждое. Отдельная часть отчёта посвящена сложностям измерения качества претрейнов: результат базовой модели сильно зависит от примеров в промпте, а правильное решение сложной задачи может появляться лишь в одной из многих попыток, поэтому использовались метрики pass@k. Вместе с весами открыты два фактологических бенчмарка — WikiWebFacts и HardMultiQA с акцентом на русскоязычный контекст — и протоколы их оценки. Среди неожиданных наблюдений: loss на отложенной части корпуса плохо предсказывал качество на целевых бенчмарках, а после пересчёта гиперпараметров по scaling laws обучение «взорвалось» — MoE-активации начали расти, а затем резко подскочил loss. Кроме того, рецепт аугментаций, помогавший при инициализации из опенсорс-моделей, пришлось переработать для более длинного претрейна, а обучения сложным рассуждениям оказалось недостаточно для агентских навыков — добавление взаимодействий с инструментами уже в претрейн улучшило агентские бенчмарки после посттрейна.

Контекст релиза важен: ранее в декабре 2025 года Яндекс уже представлял технический отчёт об Alice AI LLM, но тогда обучение начиналось с весов Qwen3-235B-A22B. Теперь же модель обучена полностью с нуля, что подчёркивает накопленный командой опыт и стремление к независимости от сторонних разработок. Кроме того, недавно коллеги открыли претрейн Alice AI Search, также обученный без применения весов опенсорс-моделей, и рассказали о модели быстрых ответов Алисы на Поиске. Новый релиз продолжает эту линию на открытость и развитие собственных технологий. На рынке открытых языковых моделей конкуренция высока: свои претрейны публикуют Qwen, DeepSeek, Google (Gemma), Meta (Llama) и другие. Яндекс вступает в эту гонку с моделью, которая при меньшем размере показывает конкурентные результаты, что может усилить позиции компании как разработчика ИИ-решений. При этом конкуренты не стоят на месте, и их следующие версии могут изменить расстановку сил.

Для российского рынка открытие весов под Apache 2.0 означает, что отечественные разработчики и исследователи получают доступ к мощной языковой модели, которую можно дообучать под свои задачи без лицензионных отчислений. Это особенно важно в условиях ограниченного доступа к зарубежным моделям и сервисам. Модель показывает сильные результаты на задачах, связанных с российской культурой, русским языком, литературой, историей, медициной и правом, что делает её привлекательной для локальных продуктов. Отраслевые эксперты отмечают, что появление такой модели может ускорить разработку ИИ-приложений в России и снизить зависимость от иностранных решений. Кроме того, публикация технического отчёта с подробностями обучения и оценки даёт российским командам ценный материал для собственных экспериментов. Открытые бенчмарки WikiWebFacts и HardMultiQA с русскоязычным акцентом также снижают порог входа для тех, кто хочет объективно сравнивать свои дообученные версии.

В сравнении с альтернативами AliceAI-Foundation-80B-A3B-Base выглядит конкурентоспособно: она превосходит более крупные DeepSeek-V4-Flash-Base и Nemotron-3-Super на многих задачах, а на сложных бенчмарках IMO AnswerBench и LiveCodeBench лидирует среди открытых претрейнов. При этом модель эффективнее по числу активных параметров, что снижает затраты на инференс. Однако стоит учитывать, что сравнение проводилось на финальном чекпоинте после reasoning-стадии претрейна, а агентские навыки проверялись отдельно после SFT. Полные результаты и методология описаны в техническом отчёте. Конкуренты также не стоят на месте, и их следующие версии могут изменить расстановку сил.

Перспективы модели связаны с развитием единой рассуждающей модели (ЕРМ) и агентских возможностей Алисы AI. Яндекс планирует использовать AliceAI-Foundation-80B-A3B-Base как основу для посттрейна в своих продуктах, а также предлагает сообществу экспериментировать с ней. Открытые вопросы касаются того, как модель поведёт себя после дообучения на конкретных доменах, насколько она устойчива к состязательным атакам и как быстро сможет адаптироваться к новым данным. Также интересно, будут ли опубликованы другие размеры модели из этой серии. Пока же релиз демонстрирует серьёзные амбиции Яндекса в области открытых языковых моделей и задаёт новый уровень для российских разработок.

Читайте также