Перейти к содержанию
суббота, 19 сентября 2026 г.

ИИ Вестник

Главные новости о развитии искусственного интеллекта в России

Qwen-Audio-3.0-TTS: синтетическая речь обошла человека в бенчмарке, но метрики вызывают вопросы

Источник: Все публикации в потоке Разработка
Audio waveform on screen beside human silhouette, lab setting.
Generated by Sourceful Riverflow (RouterAI)

Alibaba представила Qwen-Audio-3.0-TTS — гибридную систему генерации речи, которая по формальным метрикам превзошла человеческую речь. Однако разбор показывает, что за этим результатом стоит скорее проблема оценки, чем реальный прорыв в качестве.

27 июля 2026 года Alibaba опубликовала статью о новой системе генерации речи Qwen-Audio-3.0-TTS. В таблице результатов на бенчмарке SEED-TTS-Eval присутствует строка Human — настоящая человеческая речь, прогнанная через тот же тест. У человека показатель ошибки составил 1,26, тогда как у модели — 0,84. Этот разрыв заставляет задуматься о том, что именно измеряют современные метрики синтеза речи и насколько они отражают реальное качество звучания.

Qwen-Audio-3.0-TTS происходит из гибридной ветки TTS-систем, будучи прямым наследником CosyVoice. Модель использует авторегрессионную генерацию дискретных семантических токенов с последующим непрерывным блоком, который дорисовывает акустику. Ключевое новшество — снижение частоты токенизации с 25 Гц до 12,5 Гц, что даёт один токен на 80 миллисекунд. Для сравнения: средний слог в русском языке длится около 200 мс, то есть на слог приходится примерно два с половиной токена. Модель выпущена в двух вариантах: Flash для real-time работы с задержкой первого пакета около 300 мс и Plus для максимального качества. Веса закрыты, доступ только через API.

Основной технический вызов — сохранение акустической информации при вдвое меньшей частоте токенизации. В отчёте приведён ablation-анализ, показывающий, что простое уполовинивание частоты при том же словаре катастрофически снижает похожесть голоса и увеличивает ошибку. Однако если одновременно увеличить размер словаря, потери не только компенсируются, но и перекрываются. При 19 683 кодах модель превосходит исходную 25-герцевую версию по обоим критериям, а при 59 049 кодах — ещё точнее. Кодбук такого размера получается за счёт Finite Scalar Quantization: десятимерный bottleneck, каждое измерение которого квантуется на три уровня. Это даёт 310 = 59 049 возможных комбинаций. Обучаемого кодбука с проблемой мёртвых кодов здесь нет — только округление по сетке.

Контекст разработки важен для понимания места модели в экосистеме Alibaba. У компании одновременно развиваются два подхода: чистая авторегрессия на дискретных токенах в лице Qwen3-TTS и гибридная архитектура Qwen-Audio-3.0-TTS. Обе системы используют частоту около 12 Гц, хотя прямого родства авторы не проговаривают. Qwen-Audio-3.0-TTS вышел спустя полгода после Qwen3-TTS и в каком-то смысле является преемником. Для специалистов, изучавших TTS по классическим работам Tacotron, FastSpeech и HiFi-GAN, нынешние подходы представляют собой следующий слой той же идеологии. Знание классики остаётся необходимым, но теперь с неё всё только начинается. На рынке TTS в 2026 году сосуществуют четыре основных подхода: авторегрессия на дискретных токенах, неавторегрессионные методы на непрерывных представлениях, гибриды и непрерывно-авторегрессионные системы. Универсального рецепта нет — только четыре компромисса.

Для российского рынка значение этого релиза двояко. С одной стороны, Qwen-Audio-3.0-TTS демонстрирует, что китайские разработчики продолжают активно инвестировать в речевые технологии, предлагая решения с низкой задержкой и высоким качеством. С другой — закрытость весов и доступ только через API ограничивают возможности локальной адаптации и интеграции в чувствительные к данным проекты. Российские команды, работающие над синтезом речи, вынуждены либо использовать зарубежные API с рисками санкционных ограничений, либо разрабатывать собственные решения. При этом достижения Alibaba задают планку, на которую ориентируются и отечественные разработчики. Реакция отрасли на результаты бенчмарка неоднозначна: часть специалистов отмечает, что сравнение с человеческой речью через автоматические метрики методологически некорректно, поскольку живые записи содержат естественные вариации, паузы и эмоциональную окраску, которые не учитываются при оценке.

Сравнение с альтернативами показывает, что Qwen-Audio-3.0-TTS не уникальна в своём стремлении обойти человека по формальным показателям. Многие современные TTS-системы достигают сопоставимых или лучших результатов на стандартизированных тестах, однако слепые прослушивания часто выявляют разрыв между метриками и восприятием. Человеческая речь в бенчмарке — это не идеальный эталон, а скорее контрольная точка, которая сама может содержать шум, оговорки и индивидуальные особенности диктора. Когда модель показывает ошибку 0,84 против 1,26 у человека, это может означать не то, что синтез стал лучше живого голоса, а то, что метрика измеряет не совсем то, что важно для слушателя. Похожая ситуация наблюдается в распознавании речи, где модели уже давно обгоняют человека на чистых записях, но уступают в сложных акустических условиях.

Перспективы Qwen-Audio-3.0-TTS и подобных систем связаны с дальнейшим развитием методов оценки. Открытые вопросы остаются: как измерять естественность, эмоциональность и уместность синтезированной речи? Насколько применимы текущие бенчмарки к многоязычным сценариям, включая русский язык? Сможет ли сообщество выработать метрики, которые коррелируют с субъективным восприятием? Пока же Alibaba продолжает развивать оба направления — и дискретную авторегрессию, и гибридные архитектуры, — оставляя исследователям и практикам возможность выбирать между ними. Закрытость весов и API-ориентированность могут замедлить академические исследования, но для коммерческих применений это привычная модель. Что действительно важно — так это то, что гонка за улучшением метрик продолжается, и Qwen-Audio-3.0-TTS становится ещё одним напоминанием о необходимости критически смотреть на цифры.

Читайте также