Перейти к содержанию
вторник, 11 августа 2026 г.

ИИ Вестник

Главные новости о развитии искусственного интеллекта в России

Диффузионные языковые модели: прорыв или компромисс? Разбор сильных и слабых сторон

Источник: Все публикации в потоке Разработка
A researcher analyzing a glowing neural network model in a modern lab.
Generated by Sourceful Riverflow (RouterAI)

Диффузионные языковые модели (dLLM) обещают параллельную генерацию текста и заполнение пропусков, что может ускорить инференс и расширить сценарии использования. Однако на пути к практическому применению стоят серьёзные ограничения, связанные с кэшированием и воспроизводимостью. Разбираемся, что уже работает, а что остаётся под вопросом.

Исследователи из AIRI и SberAI представили развёрнутый обзор диффузионных языковых моделей (dLLM) — альтернативного подхода к генерации текста, который в последние годы привлекает всё больше внимания. В отличие от классических авторегрессионных LLM, генерирующих токены последовательно слева направо, dLLM восстанавливают замаскированные фрагменты текста параллельно, что теоретически позволяет кратно ускорить инференс и открывает возможности для заполнения произвольных пропусков в промпте. Авторы, накопившие практический опыт работы с такими моделями, делятся выводами о том, какие архитектурные решения действительно работают, а какие вызывают вопросы, и публикуют этот анализ в открытом доступе.

Основной принцип работы dLLM строится на двух процессах: прямом и обратном диффузионных процессах. В прямом процессе часть токенов исходного текста заменяется специальным токеном MASK, что и является аналогом шума в текстовой модальности. Обратный процесс учит модель восстанавливать оригинальные токены на замаскированных позициях, причём на каждом шаге модели раскрывают сразу несколько пропусков, что и обеспечивает параллельность. Такой подход называют маскирующими диффузионными моделями (MDM), и он, как отмечают авторы, является обобщением как BERT, так и авторегрессионных LLM, что было показано ещё в 2021 году в работе D3PM. Параллельно развивается ветка непрерывной диффузии, где текст переводится в эмбеддинги или логиты, но эти методы пока не доказали свою масштабируемость на больших объёмах данных, поэтому основным практическим направлением остаются дискретные MDM.

Среди ключевых преимуществ dLLM авторы выделяют параллельную генерацию, возможность заполнения пропусков в тексте, устойчивость к обратным запросам и эффективность при ограниченных данных. Параллельная генерация позволяет выдавать несколько токенов за один проход модели, что критично для ускорения инференса. Заполнение пропусков, или infilling, является «родной» задачей для dLLM, что делает их особенно полезными для редактирования кода и генерации по заданному каркасу. Например, метод Template Infilling распределяет опорные фрагменты по будущему ответу и заполняет промежутки, улучшая результаты в математике и программировании. Кроме того, эксперименты с моделью LLaDA показали, что dLLM значительно меньше страдают от проблемы асимметрии в обратных запросах: если у GPT-4o разрыв между прямым и обратным направлением более чем двукратный, то у LLaDA 8B Instruct обратное направление почти не проседает.

Однако у dLLM есть и серьёзные недостатки, главный из которых — неработоспособность KV-кэша. В авторегрессионных моделях генерация нового токена зависит только от левых токенов, что позволяет кэшировать их представления и не пересчитывать их на каждом шаге. В диффузионных моделях токены могут появляться в любой позиции, поэтому кэширование не применимо, и каждый шаг требует полного пересчёта всех представлений. Это приводит к значительному замедлению инференса, что нивелирует преимущество параллельной генерации. Кроме того, авторы отмечают проблемы с воспроизводимостью: многие опубликованные результаты dLLM трудно повторить, что ставит под сомнение их практическую ценность. В обзоре также упоминаются сложности с обучением, связанные с выбором функции потерь и стратегией шумления.

Для российского рынка развитие dLLM имеет особое значение, поскольку отечественные компании активно ищут альтернативы западным моделям, особенно в условиях санкционных ограничений. Работы AIRI и SberAI в области интерпретируемого ИИ и генеративной поэзии показывают, что российские исследователи способны вносить вклад в передовые направления, не уступая мировому уровню. Однако отсутствие единых стандартов и бенчмарков для dLLM затрудняет сравнение результатов и внедрение этих моделей в промышленные продукты. Тем не менее, интерес к dLLM растёт, и в 2026 году непрерывная генерация текста вновь стала популярной темой в академических кругах, что говорит о потенциальном прорыве в ближайшие годы.

Сравнивая dLLM с альтернативами, такими как классические LLM и недавние гибридные подходы, можно заметить, что dLLM пока проигрывают в скорости инференса из-за проблем с кэшированием, но выигрывают в гибкости генерации. Например, flow matching методы, такие как FLM и ELF, работают с непрерывными представлениями и обещают лучшую масштабируемость, но они ещё не проверены на больших моделях. Среди открытых вопросов — возможность создания эффективного кэша для dLLM, оптимизация числа шагов денойзинга и разработка более стабильных алгоритмов обучения. Авторы обзора подчёркивают, что, несмотря на текущие ограничения, dLLM — это перспективное направление, которое может изменить ландшафт генеративного ИИ, если удастся решить проблемы производительности и воспроизводимости.

В перспективе можно ожидать, что dLLM найдут применение в задачах, где параллельная генерация и заполнение пропусков критичны, например, в дополнении кода, редактировании текста и создании контента по шаблонам. Однако для широкого внедрения потребуется преодолеть технические барьеры, в том числе разработать аппаратные ускорители, адаптированные под параллельные вычисления, и создать стандартизированные бенчмарки для оценки качества. Российские исследователи уже активно работают над этими вопросами, и их обзор — важный шаг к систематизации знаний в этой области. В ближайшие годы стоит ожидать появления новых моделей dLLM, которые, возможно, смогут конкурировать с авторегрессионными гигантами на равных, но пока остаются экспериментальной технологией с большим потенциалом и нерешёнными проблемами.

Читайте также