Alibaba представила Qwen3.8-Max: 2,4 трлн параметров, открытые веса и автономная работа на протяжении недель
Китайская Alibaba 3 августа 2026 года выпустила флагманскую модель Qwen3.8-Max с 2,4 триллиона параметров и контекстом в миллион токенов. Впервые компания открывает веса модели Max-класса, а демонстрации показывают способность ИИ работать автономно до 16 дней без участия человека.
Пока одни запускали GPT-5.6 Sol Max, другие ломали копья в холиварах «Kimi K3 vs Claude Opus 5», Alibaba тихо (ага, с ростом акций на 7% в моменте – очень тихо) вкатила модель, которую сама называет «новой планкой для кодинга и совместной работы». Знакомьтесь: Qwen3.8-Max, 2,4 триллиона параметров (всего-то), контекст на миллион токенов и обученная не просто быстро отвечать, а не сдаваться днями. Привычный рефлекс «очередной китайский флагман – очередные астрономические циферки – очередное “мы почти догнали Anthropic”» отчасти правдив. Но тут три вещи, ради которых стоит потратить пять минут: во-первых, Alibaba внезапно впервые открывает веса модели Max-класса; во-вторых, независимая проверка разошлась с вендорскими цифрами, и это отдельная маленькая драма в твиттере; в-третьих – релиз подсвечивает тренд, который многие стараются не замечать – дело, возможно, не в модели, а в том, что вокруг неё построено.
Модель доступна через QwenCloud, Alibaba Cloud Model Studio и приложение QwenWork (новая рабочая ИИ-платформа). Из-за архитектуры Mixture-of-Experts на каждый запрос реально включается только около 95 млрд параметров – это держит скорость и цену в разумных пределах. Контекстное окно – миллион токенов, по грубой прикидке три-четыре толстых романа разом. Размерами такими уже не удивить – ещё в ChatGPT-4o образца мая 2024-го, по слухам, было что-то в том же порядке. Так что реакция «ого, триллионы!» устарела вместе с трендами двухлетней давности. Гораздо интереснее, что модель умеет делать с этими параметрами. Официальный анонс от @Alibaba_Qwen в X гласил: «Meet Qwen3.8-Max – our most capable model to date. Next week, the open weights of Qwen3.8-Max will be released, and Qwen3.8-27B is also going open-weights to meet you all!». Alibaba недавно выкатила ещё и Qwen-Image-3.0 – генератор изображений с фокусом на реальность, умеющий рендерить текст размером до 10 пикселей, что дополняет экосистему Qwen и покрывает мультимодальные задачи.
Вместо простой таблички бенчмарков Alibaba показала пять демонстраций автономной работы, каждая со своей историей. Цифры вендорские, независимых прогонов пока не было, но сами сценарии показывают, куда движется индустрия. Первый кейс: модели дали пустую папку и задачу построить самообновляющийся CLI-инструмент oh-my-cli. Она сама превращала запросы в GitHub Issues, брала их в работу, писала код, гоняла тесты и мёрджила пул-реквесты. К 30 июля счётчик показывал 265 коммитов, 127 PR’ов и 151 закрытую задачу – и всё это за 16 дней без единого коммита от человека. Проект открыт на GitHub. Второй кейс: модель воспроизвела научную статью «Unified data selection for LLM reasoning» без единой строчки кода. За пять суток (около 125 часов) написала ~7600 строк и прогнала 33 раунда GPU-обучения. Сначала воспроизвела все шесть ключевых результатов, потом запустила цикл самоулучшения и обошла оригинал на +2,7 балла на AIME24.
Третий кейс: модель заявили в реальное соревнование WWW2025 Multimodal Dialogue Intent Recognition Challenge. За 24 часа через 45 итераций точность выросла с 0,60 до 0,853, обойдя 458 из 526 живых команд (87% участников). Четвёртый кейс: модели поручили спроектировать криптографический аппаратный ускоритель. За ~500 итераций дизайн ужался с 8298 логических вентилей до 678, физическая площадь кристалла сократилась на 81%. Пятый кейс: E-Commerce Bench симулирует год онлайн-торговли: 12 типов магазинов, ~600 поставщиков, 7000 товаров, из которых 152 – замаскированные мошенники. Модель закончила год с балансом 416 252 юаня – 4,16x к стартовому капиталу, на 38% больше второго места. Также заявлена автономная разработка ETF-ротационной стратегии с параллельным запуском ~330 суб-агентов и ~6000 бэктестов. Раньше нейросеть измеряли качеством одного ответа, теперь тем, сколько дней она способна не потерять нить задачи.
Есть показательный пример, подчёркивающий важность харнесса: на сложнейшем бенчмарке ARC-AGI топовые модели показывали единичные проценты – GPT-5.6 Sol брал 7% при цене прогона $21 тыс. А потом сторонняя команда поместила ту же модель в улучшенный харнесс – и результат подскочил до 95% и 99% с нулевым дообучением. Официальные харнессы лабораторий часто проигрывают сторонним: GLM-5.2 в стороннем харнессе Pi обходит Opus 4.8 в родном для Anthropic Claude Code. Причина прозаична: лабораториям выгодно, чтобы вы потребляли больше токенов. Alibaba здесь играет от обратного: заявляет совместимость с Claude Code, Codex, Qoder CLI, Qwen Code и OpenClaw и говорит, что производительность примерно одинакова во всех них. Это стратегический ход, который может перераспределить рынок ИИ-инструментов в пользу открытых экосистем.
Для российского рынка ИИ Qwen3.8-Max значима по нескольким причинам. Во-первых, открытые веса модели Max-класса позволяют локальным командам дообучать и адаптировать её под русскоязычные задачи без привязки к западным API. Во-вторых, автономные сценарии, такие как написание кода и научных статей, могут быть использованы для автоматизации рутинных процессов в российских компаниях, особенно в условиях кадрового голода в IT. В-третьих, совместимость с популярными харнессами снижает барьер входа для разработчиков, привыкших к Claude Code или Codex. Однако остаются открытые вопросы: насколько стабильно модель работает в долгосрочных автономных сессиях, каковы реальные затраты на инференс при таком масштабе, и не возникнут ли проблемы с регулированием ИИ в России. Независимые тесты, особенно на русскоязычных данных, пока не проводились, поэтому окончательные выводы делать рано.
Помимо основной модели, Alibaba недавно выпустила генератор изображений Qwen-Image-3.0, который умеет рендерить текст размером до 10 пикселей, что может быть полезно для создания реалистичных изображений с текстом. Это дополняет экосистему Qwen и показывает, что Alibaba стремится покрыть не только текстовые, но и мультимодальные задачи. В целом, Qwen3.8-Max представляет собой значительный шаг вперёд для китайских моделей, особенно в контексте автономной работы и открытости. Однако окончательные выводы о её месте в иерархии ИИ можно будет сделать только после независимых тестов и реального использования в проектах. Пока же модель вызывает интерес и споры, что уже является признаком её значимости на рынке. Ближайшие месяцы покажут, сможет ли Alibaba удержать лидерство и как отреагируют конкуренты – как западные, так и китайские, включая Baidu и Tencent, которые также активно развивают свои ИИ-платформы.