Новый бенчмарк 23 ASR-моделей для русского IT-диктанта: Whisper Large v3 больше не лидер
Автор провёл масштабное сравнение 23 моделей распознавания речи в 60+ конфигурациях на русско-английском IT-корпусе. Результат: рекомендация Whisper Large v3, данная в марте, устарела. Неожиданный фаворит — модель breeze-asr, изначально оптимизированная для тайваньского мандарина.
В марте автор опубликовал статью о voice-to-text, где рекомендовал Whisper Large v3 с кастомным промптом для пунктуации. Однако случайное обнаружение модели breeze-asr в списке поддерживаемых Handy заставило его усомниться в выборе. После нескольких недель тестирования и создания Frankenstein-fork в три уровня глубиной, он пересобрал всё по-научному и выяснил: качество breeze-asr не хуже, а возможно, и лучше. Теперь мартовская рекомендация официально признана устаревшей, и автор делится новыми выводами.
Методология предыдущего сравнения была честной, но не научной: автор переключал модели в Handy и диктовал в обычном режиме, полагаясь на ощущения. Это приводило к трём искажениям: эффект памяти (лучше помнятся недавние ошибки), эффект адаптации (речь подстраивается под текущую модель) и разное аудио для каждой модели. Поэтому он решил провести полноценный бенчмарк: 23 модели в 60+ конфигурациях, более 100 000 прогонов на русско-английском IT-корпусе, 120+ часов чистого инференса на одной RTX 5070 Ti. Такой подход позволил впервые поставить модели рядом на общем эталоне.
Ключевые критерии оценки включали три аспекта: точность распознавания слов (WER), качество пунктуации и сохранение английских терминов латиницей. Последний пункт особенно важен для IT-специалистов, которые часто используют code-switching — смешение русского и английского в одной фразе. Модели, которые не ставят знаки препинания, выдают простыню текста без точек и запятых, что затрудняет чтение и последующую обработку LLM. Латинская запись терминов предпочтительна, так как она экономнее по токенам и точнее соответствует официальным названиям.
В ходе тестирования выяснилось, что breeze-asr, несмотря на пометку «Optimized for Taiwanese Mandarin», отлично справляется с русско-английской диктовкой. Автор провёл несколько версий пунктуационного промпта и измерил его эффект. Оказалось, что кастомный промпт значительно улучшает расстановку знаков препинания, но breeze-asr справляется с этим и без него. Это стало главным открытием: модель, предназначенная для другого языка, превзошла Whisper Large v3 в целевом сценарии.
Контекст: рынок ASR-моделей активно развивается, и Whisper долгое время считался эталоном. Однако новые модели, такие как breeze-asr, показывают, что нишевые fine-tune могут быть универсальнее, чем ожидалось. Это ставит под сомнение подход, при котором выбирается модель на основе популярности, а не реальных тестов. Для российских разработчиков это особенно актуально, так как русский язык часто остаётся на периферии внимания крупных вендоров, и локальные решения могут оказаться эффективнее. Например, в условиях санкций и ограничений на доступ к зарубежным облачным сервисам, локальные ASR-модели становятся критически важными для компаний, работающих с чувствительными данными. Возможность запускать модели на собственном оборудовании без передачи аудио в облако обеспечивает дополнительный уровень безопасности и конфиденциальности, что особенно ценно для российских организаций.
Сравнение с альтернативами: в бенчмарке участвовали не только Whisper и breeze-asr, но и другие модели, включая коммерческие решения. Однако breeze-asr показал лучший баланс между скоростью, качеством и стоимостью. При этом автор отмечает, что Handy с Vulkan-ускорением оказался быстрее CUDA, что также повлияло на итоговую рекомендацию. Это важный технический нюанс для тех, кто использует локальные модели на GPU. Для российских пользователей это означает, что даже без самого современного оборудования можно добиться высокой производительности, используя open-source решения и оптимизированные рантаймы. Это снижает барьер входа для малых и средних компаний, которые не могут позволить себе дорогие GPU-кластеры.
Перспективы: автор планирует обновить мартовскую статью, добавив ссылку на новые выводы. Он также намерен продолжить тестирование других моделей, включая те, что появятся в будущем. Открытым остаётся вопрос, насколько breeze-asr эффективен для других языковых пар и сценариев, но для русско-английской IT-диктовки он уже доказал свою состоятельность. Всем, кто работает с voice-to-text, рекомендуется провести собственный бенчмарк, так как выбор модели сильно зависит от конкретных задач и аудио-условий. В российском контексте это особенно важно, поскольку многие глобальные модели обучаются преимущественно на английском языке и могут демонстрировать худшие результаты на русском. Локальные и нишевые модели, адаптированные под специфику русского IT-жаргона, могут стать более надёжным выбором для местных пользователей.