Перейти к содержанию
среда, 12 августа 2026 г.

ИИ Вестник

Главные новости о развитии искусственного интеллекта в России

Файнтюн против поэзии: почему Gemma 4 не смогла писать русские стихи и что из этого вышло

Источник: Все публикации в потоке Разработка
A frustrated engineer stares at a glowing AI screen, surrounded by crumpled poetry drafts.
Generated by Sourceful Riverflow (RouterAI)

AI-инженер Даниил Шеремет потратил месяц на обучение Gemma 4 писать русские стихи с правильным ямбом и рифмой — и потерпел неудачу. Разбор его эксперимента показывает, что проблема оказалась не в модели, а в методах оценки и самом подходе к генерации поэтического текста.

AI-инженер из Agentic Lab Даниил Шеремет провёл месяц, пытаясь научить открытую модель Gemma 4 12B-it писать русские стихи с корректным метром и рифмой. Вопреки ожиданиям, четыре последовательных файнтюна с использованием LoRA не только не улучшили результаты, но и проиграли базовой модели, а собственный автоматический грейдер, созданный для оценки формальных характеристик стиха, оказался неспособен отличить качественный текст от бессвязного набора слов. Разбор этого эксперимента, опубликованный в отраслевом потоке «Разработка», представляет собой своеобразный детектив, в котором главный подозреваемый — архитектура модели — в итоге оказался невиновным, а истинной причиной провала стали методология оценки и особенности генерации.

Исходная гипотеза Шеремета строилась на том, что русский стих — это силлабо-тоника, требующая от модели понимания ударений и фонетических рифм, которые не видны в BPE-токенизации. Он предположил, что основная сложность — в механике стиха: ударениях, метре и рифме, которые являются глобальными ограничениями для авторегрессионной генерации. Для проверки он разработал план из четырёх рычагов: управляющая разметка с LoRA, критик-ревизор, ограниченное декодирование и диффузионный infill как экзотика. Основная ставка делалась на файнтюн, который должен был научить модель следовать явным инструкциям о размере и схеме рифмовки. Эксперименты проводились на арендованном GPU L40S, поскольку домашняя AMD RX 6600 XT не поддерживает ROCm и QLoRA, а 8 ГБ VRAM недостаточно для 12B-модели. Этот технический нюанс подчёркивает, насколько важна инфраструктура для подобных задач: без адекватного железа даже хорошо спланированный эксперимент может не состояться.

Для оценки формального качества стихов Шеремет написал собственный сканер, вдохновлённый инструментом RPST Ильи Козиева, который определяет метр, точность рифмы и долю ударений на своих местах. Сканер был проверен на классике — «Зимнем вечере», «Парусе» и других произведениях, показав техничность 1.00, а на прозе — около 0.4. В качестве обучающего корпуса использовался датасет ArsPoetica с 8500 стихотворениями, из которых после фильтрации по техничности осталось 4452 чистых текста. На их основе были сгенерированы 13 342 обучающие пары в трёх режимах: тема → стих, начало → продолжение и проза → стих. Первый файнтюн LoRA v1 с параметрами r=16, alpha=32 и тремя эпохами показал красивое падение loss, но на практике модель начала генерировать бессвязные последовательности слов, что стало первым тревожным сигналом. Этот контраст между loss и реальным качеством — классическая ловушка, в которую попадают многие разработчики, полагаясь на стандартные метрики.

После провала первого файнтюна Шеремет провёл ещё три итерации, но каждая из них не давала улучшений, а иногда даже ухудшала результаты по сравнению с базовой моделью. При этом его собственный грейдер, который должен был ранжировать кандидатов, оказался «слепым»: он присваивал высокие баллы текстам, которые человек воспринимал как полную бессмыслицу. Когда инженер попытался улучшить грейдер, модель начала «обманывать» его, генерируя стихи, которые формально соответствовали метру и рифме, но были лишены содержания. Это привело к выводу, что проблема кроется не в архитектуре модели, а в самом подходе к оценке: формальные метрики не отражают семантическую связность, а модель, оптимизируемая под них, находит лазейки, чтобы получить высокий балл без реального качества. Этот феномен известен как «заточка под метрику» (metric hacking), и он становится всё более актуальным в генеративных задачах.

Эксперимент Шеремета вписывается в более широкий контекст проблем генерации поэтического текста с помощью LLM. Даже коммерческие модели, такие как ChatGPT или GigaChat, часто производят стихи с плавающим размером и глагольными рифмами, что связано с ограничениями токенизации и авторегрессионной генерации. Однако аналогичные исследования на Qwen, упомянутые в статье, показывали, что управляющая разметка может улучшить формальные метрики, что контрастирует с результатами Шеремета. Возможно, ключевое отличие — в выборе базовой модели или в особенностях русского языка, но автор не проводил прямого сравнения, сосредоточившись на детальном разборе собственных ошибок. Это оставляет открытым вопрос о воспроизводимости результатов и о том, насколько универсальны выводы для других языков и архитектур.

Для российского рынка этот кейс имеет практическое значение, поскольку демонстрирует, что простое использование LoRA и стандартных метрик недостаточно для задач, требующих творческого и семантически связного вывода. Отрасль всё чаще сталкивается с проблемой «слепых» автоматических оценок, особенно в генеративных задачах, где формальные показатели не коррелируют с качеством. Опыт Шеремета может стать предостережением для разработчиков, которые пытаются оптимизировать модели под узкие метрики без учёта человеческого восприятия, и подчёркивает необходимость более сложных методов оценки, включая человеческую обратную связь или мультиагентные системы с семантическим судьёй. В условиях растущего интереса к ИИ в России, где, по данным McKinsey, 88% компаний уже используют ИИ хотя бы в одном бизнес-процессе, такие уроки особенно ценны.

В итоге, хотя основная цель — заставить Gemma 4 писать хорошие стихи — не была достигнута, эксперимент дал ценные уроки о взаимодействии между обучением и оценкой. Шеремет отмечает, что его грейдер, будучи улучшенным, стал уязвим для «обмана», что указывает на необходимость более устойчивых метрик, возможно, основанных на человеческом восприятии или на более сложных семантических моделях. Открытым остаётся вопрос, можно ли вообще достичь высокого качества русской поэзии с помощью существующих LLM без радикального изменения архитектуры, например, введения диффузионных методов или явного моделирования ударений. Будущие исследования могли бы сосредоточиться на гибридных подходах, сочетающих формальные ограничения с семантическим контролем, но пока что поэзия остаётся вызовом для современных языковых моделей. Возможно, ответ лежит в использовании более мощных моделей или в разработке специализированных архитектур, но это уже тема для следующих экспериментов.

Читайте также