Перейти к содержанию
суббота, 19 сентября 2026 г.

ИИ Вестник

Главные новости о развитии искусственного интеллекта в России

FastWave: самая лёгкая диффузионная модель для восстановления высоких частот звука

Источник: Все публикации в потоке Разработка
Audio waveform visualization on a laptop screen in a dim research lab.
Generated by Sourceful Riverflow (RouterAI)

Студент НИУ ВШЭ и VK Никита Кузнецов представил FastWave — диффузионную модель для Bandwidth Extension, которая повышает частоту дискретизации аудио до 48 кГц, имея всего 1,3 млн параметров. Модель обучалась на одной GPU V100 до 30 часов и превосходит NU-Wave 2 по эффективности, сохраняя качество на уровне SOTA.

В сообществе разработчиков и исследователей ИИ появился проект FastWave, о котором рассказал Никита Кузнецов, студент мастерской по сервисам и платформам ИИ Инженерно-математической школы НИУ ВШЭ и VK. Работа выполнена под руководством Максима Каледина, доцента ФКН НИУ ВШЭ, и Александра Тараканова, исследователя AI VK и доцента ФКН НИУ ВШЭ. Задача, которую решает FastWave, относится к классу Bandwidth Extension (BWE) — восстановлению высокочастотных компонент аудиосигнала для повышения его частоты дискретизации до студийных 48 кГц. Модель весит всего 1,3 млн параметров, что делает её одной из самых лёгких среди диффузионных решений в этой области.

Ключевая особенность FastWave заключается в существенном снижении вычислительных затрат как на этапе обучения, так и при инференсе. Если оригинальная модель NU-Wave 2, взятая за основу, содержит 1,8 млн параметров и требует около 19 GFLOPs на один вызов, то FastWave обходится 1,3 млн параметров и 12,9 GFLOPs. Сокращение составило 30% по числу параметров и примерно 32% по вычислительной сложности. При этом модель демонстрирует результаты лучше, чем NU-Wave 2, и сопоставима с более тяжёлыми SOTA-решениями. Обучение FastWave заняло до 30 часов на одной GPU V100, тогда как NU-Wave 2 обучалась около двух недель на двух A100. Для генерации одного аудиофрагмента FastWave требует всего 4 вызова модели (NFE) вместо 8 у предшественника, что вдвое ускоряет инференс.

Технически проект опирается на три направления оптимизации. Первое — адаптация методологии EDM (Elucidating the Design Space of Diffusion Models), изначально созданной для изображений. Вместо предсказания шума модель учится предсказывать чистый сигнал (σ-параметризация), применяется предобуславливание входов и выходов в зависимости от уровня шума, используется log-нормальное распределение уровней шума при обучении и непрерывное шумовое расписание при инференсе. Второе — архитектурные изменения из ConvNeXt V2: обычные свёртки заменены на depthwise separable convolutions, что снижает параметрическую сложность, а для компенсации ослабленного взаимодействия между каналами добавлена Global Response Normalization (GRN). Третье — сокращение числа шагов инференса благодаря улучшенному обучению и гибкому расписанию шумов. Все эти изменения позволили достичь пиковых метрик за втрое меньше итераций по сравнению с NU-Wave.

Контекст разработки определяется текущим состоянием области BWE. Сегодня доминируют два подхода: диффузионные модели (NU-Wave, NU-Wave 2, AudioSR) и flow-based модели (FlowHigh). Диффузионные модели дают высокое качество, но страдают от большого числа параметров и медленного инференса из-за итеративного денойзинга. Flow-based модели обеспечивают компромисс: один шаг инференса и качество, близкое к SOTA, но остаются крупными — например, FlowHigh содержит 49 млн параметров. Большинство решений фокусируются на качестве звука, оставляя вычислительную эффективность на втором плане. FastWave предлагает альтернативу, показывая, что можно достичь высокого качества при значительно меньших ресурсах. Это особенно актуально в условиях ограниченного доступа к мощным GPU, что и стало отправной точкой проекта: у авторов были только V100, а не A100.

Для российского рынка и отрасли в целом значение FastWave выходит за рамки академического результата. Модель демонстрирует, что даже при скромных вычислительных ресурсах можно создавать конкурентоспособные решения в области аудиообработки. Это снижает порог входа для небольших команд и стартапов, работающих над улучшением качества звука в стриминговых сервисах, подкастах, телефонии и системах записи. Кроме того, проект открывает возможности для дальнейших исследований в направлении облегчения диффузионных моделей. Код FastWave выложен в открытый доступ, что способствует воспроизводимости и развитию сообщества. В условиях, когда ведущие лаборатории мира инвестируют в крупные модели, российские исследователи показывают, что эффективность и компактность могут быть не менее важны, чем масштаб.

Сравнение с альтернативами подчёркивает преимущества FastWave. По сравнению с NU-Wave 2 удалось уменьшить число параметров на 30% и вдвое сократить количество шагов инференса, сохранив или улучшив качество. По сравнению с FlowHigh, который имеет 49 млн параметров, FastWave легче почти в 38 раз, хотя и требует 4 шага вместо одного. Однако за счёт малого размера и оптимизированного обучения общая скорость генерации остаётся высокой. Относительно AudioSR и других диффузионных моделей FastWave выигрывает по вычислительной сложности и времени обучения. Таким образом, модель занимает нишу между сверхлёгкими flow-based решениями и тяжёлыми диффузионными, предлагая баланс качества и эффективности.

Перспективы FastWave связаны с дальнейшим расширением функциональности и адаптацией к другим задачам аудиообработки. Открытыми остаются вопросы о работе с различными типами сигналов (речь, музыка, шумы), о масштабировании на более высокие частоты дискретизации и о возможности ещё большего сокращения шагов инференса без потери качества. Также интересно, как модель поведёт себя на реальных записях с артефактами сжатия. Авторы приглашают сообщество к сотрудничеству и экспериментам. Учитывая тренд на энергоэффективный ИИ, подобные проекты могут стать основой для новых стандартов в обработке звука. Дальнейшие шаги включают интеграцию FastWave в прикладные сервисы и участие в бенчмарках.

Читайте также