Яндекс открыл претрейн Alice AI Search: как устроена модель быстрых ответов
Команда Alice AI Search опубликовала технические детали претрейна и архитектуры модели, которая генерирует быстрые ответы Алисы в Поиске. В открытый доступ выложена обученная с нуля модель Alice AI-T5-35B-A0.6B Base, однако оптимизированный production-инференс остаётся внутренним.
Яндекс в рамках направления Alice AI Search раскрыл подробности о претрейне и архитектуре генеративной модели, отвечающей за быстрые ответы Алисы в Поиске. Это самый массовый генеративный продукт компании: с ним ежедневно сталкиваются миллионы пользователей, и даже в часы пиковой нагрузки ответ должен появляться за считаные секунды. Быстрый ответ Алисы AI — это первое соприкосновение с Алисой для многих пользователей Поиска, поэтому требования к скорости и качеству здесь особенно высоки. Для этого команда адаптировала весь пайплайн — от собственного претрейна с кастомной архитектурой до онлайн-RL-обучения на поведенческих сигналах. В июньском релизе были представлены ключевые улучшения, включая ускорение ответов за счёт коротких инфоконтекстов и совмещение Encoder-Decoder с разреженной MoE-архитектурой. Устройство быстрого ответа напоминает работу Алисы в чате: сначала запрос поступает в модель, которая обращается к разным видам поиска — например, текстовому и поиску по изображениям — и собирает необходимую информацию. Затем все текстовые документы обрабатывает отдельная модель, оставляющая только релевантные фрагменты, которые в Яндексе называют инфоконтекстами. На последнем этапе инфоконтексты вместе с изображениями, видео и другими найденными материалами поступают в модель, формирующую итоговый ответ Alice AI.
Одним из центральных изменений стала оптимизация этапа Agentic Search, отвечающего за сбор и фильтрацию информации из поисковой выдачи. Поиск даёт языковой модели актуальные факты и детали, которых может не быть в её весах, но найденные документы содержат гораздо больше текста, чем требуется для конкретного ответа, а каждый дополнительный токен в контексте увеличивает время генерации. Человек обычно открывает топ выдачи и выборочно читает нужные части, тогда как модель последовательно обрабатывает весь переданный контекст. Чтобы сократить время генерации, исследователи обучили «крошечную» BERT-подобную модель-экстрактор на 80 млн параметров, которая оставляет в документах только релевантные фрагменты — инфоконтексты. Обучение проводилось на 4 трлн токенов из корпоративного корпуса, а разметку для дообучения собирали с помощью опенсорсных LLM. Так была получена cold start-версия экстрактора, уже неплохо решающая поставленную задачу. Однако простой релевантности запросу оказалось недостаточно: некоторые факты модель уже могла усвоить во время претрейна, и их передача только увеличивала длину контекста. Для поиска минимально достаточного набора токенов применили алгоритм на основе Cross-Entropy RL, который итеративно отбирает «элитные» кандидаты и штрафует за размер инфоконтекста. В первых поколениях порог отбора низкий, поэтому кандидаты получаются длинными и включают большинство токенов документа, что расширяет область поиска. С каждым следующим поколением порог растёт, а кандидаты становятся короче. В результате экстрактор научился оставлять более компактный контекст, что позволило сократить число входных токенов и увеличить пропускную способность. В описании алгоритма команда отдельно оговаривает допущение: польза одного инфоконтекста считается независимой от остальных, хотя в реальной генерации фрагменты из разных документов могут дополнять или дублировать друг друга. Тем не менее такая постановка позволяет точнее оценивать вклад каждого инфоконтекста, чем в случае, когда на один ответ одновременно влияют несколько фрагментов.
Архитектурно модель быстрых ответов сочетает Encoder-Decoder с разреженной Mixture-of-Experts (MoE). Такая конфигурация позволяет эффективно масштабировать число параметров, активируя лишь часть экспертов на каждом шаге генерации. Общее число параметров модели Alice AI-T5-35B-A0.6B Base составляет 35 млрд, но активных — всего 0,6 млрд, что критически важно для скорости инференса. В отличие от плотных моделей, где все параметры задействованы постоянно, MoE даёт выигрыш в вычислениях без пропорционального роста задержки. Это особенно значимо для поисковых сценариев, где ответ должен формироваться за доли секунды при огромном потоке запросов. Именно сочетание компактного экстрактора инфоконтекстов и разреженной архитектуры генератора образует тот самый пайплайн, который команда адаптировала под пиковые нагрузки. При этом обучение на реальных пользовательских сигналах влияет не только на качество, но и на использование продукта: онлайн-RL позволяет модели постоянно дообучаться на поведенческих данных, что должно улучшать ответы со временем.
Предыдущие версии быстрых ответов Алисы строились на той же инфраструктуре, что и ответы в чате, но без столь агрессивной оптимизации контекста. Ранее в поисковую выдачу передавались целые документы или их крупные фрагменты, что увеличивало время генерации и стоимость вычислений. С появлением Agentic Search полгода назад команда начала целенаправленно адаптировать поисковые технологии под особенности языковых моделей семейства Alice AI. Конкуренты в лице Google с Gemini Flash и OpenAI с их моделями также активно развивают направление быстрых ответов, однако Яндекс делает ставку на собственный претрейн и глубокую интеграцию с поисковыми сигналами. Открытие базовой модели призвано стимулировать исследования в области эффективных архитектур, хотя production-инференс остаётся закрытым. Показательно, что Gemini 3.8 Flash, вышедшая через три недели после 3.7 Flash, делает акцент на увеличении числа шагов рассуждений и вызовов инструментов — то есть на «большей работе» на сложных задачах, тогда как подход Яндекса фокусируется на сокращении входного контекста и повышении пропускной способности. Обе стратегии направлены на ускорение ответов, но достигают цели разными путями.
Для российского рынка этот шаг означает, что Яндекс продолжает удерживать лидерство в области генеративных поисковых ответов, предлагая решение, оптимизированное под локальную инфраструктуру и нагрузку. Доступность модели через Hugging Face Transformers позволит внешним разработчикам и исследователям экспериментировать с архитектурой, но без возможности воспроизвести production-уровень оптимизации. Отраслевые эксперты отмечают, что публикация претрейна — редкий случай для российских компаний, обычно предпочитающих закрытые разработки. Это может усилить позиции Яндекса как технологического центра и привлечь внимание к его подходам в области RL и MoE. Модель Alice AI-T5-35B-A0.6B Base с 35 млрд общих и 0,6 млрд активных параметров выглядит конкурентоспособно на фоне других разреженных архитектур, однако прямые сравнения пока затруднены из-за отсутствия публичных бенчмарков для русскоязычных поисковых задач. Тем не менее онлайн-RL на поведенческих сигналах пользователей даёт Яндексу уникальное преимущество: модель постоянно дообучается на реальных данных, что должно улучшать качество и использование продукта.
В дальнейшем команда Alice AI Search, вероятно, продолжит оптимизировать пайплайн, возможно, расширяя применение MoE и улучшая экстрактор инфоконтекстов. Открытым остаётся вопрос, появится ли возможность у внешних разработчиков запускать оптимизированный инференс или хотя бы получить доступ к промежуточным чекпоинтам. Пока же публикация базовой модели — это скорее жест в сторону научного сообщества, чем полноценный опенсорс. Перспективы также связаны с масштабированием на другие языки и сценарии, где требуется мгновенная генерация. Наблюдатели будут следить за тем, как быстро Яндекс внедрит следующие улучшения и сможет ли удержать баланс между качеством, скоростью и стоимостью вычислений в условиях растущей конкуренции.