Перейти к содержанию
среда, 23 сентября 2026 г.

ИИ Вестник

Главные новости о развитии искусственного интеллекта в России

Бенчмарк BookTrans: GPT-6 Astra лидирует в англо-русском переводе, китайские LLM обходят Claude

Источник: Все публикации в потоке Разработка
AI translation benchmark: glowing language model interfaces on a dark desk, open book beside them.
Generated by Sourceful Riverflow (RouterAI)

Разработчик конвейера BookTrans представил новый бенчмарк для оценки качества художественного перевода с английского на русский. Лучший результат показала GPT-6 Astra — 90 баллов из 100, за ней следует Gemini 3.8 Flash с 88 баллами. Китайские модели GLM 5.3 и DeepSeek V4 Flash неожиданно обошли флагманы Claude, набрав 84 и 82,3 балла соответственно.

В сообществе разработчиков BookTrans появился воспроизводимый бенчмарк для оценки качества англо-русского художественного перевода, выполненного большими языковыми моделями. Тестирование проводилось на специально адаптированном рассказе О. Генри «The Skylight Room», в который было встроено сто контрольных точек-ловушек. Лидером стала GPT-6 Astra с результатом 90 баллов из 100, второе место у Gemini 3.8 Flash (88 баллов). Неожиданно высокие результаты показали китайские модели: GLM 5.3 набрала 84 балла, DeepSeek V4 Flash — 82,3, обойдя флагманы Anthropic Claude Fable 5.1 (79) и Opus 5.5 (78,3). Замыкают группу лидеров Kimi K2.7 Code и Hy4, которые выступили на уровне Claude.

Бенчмарк создан для устранения недостатков предыдущего метода, где качество перевода измерялось числом правок, внесённых моделью-редактором. Такой подход критиковали за субъективность судьи и поощрение осторожных, упрощённых переводов. Новый инструмент опирается на индустриальный стандарт MQM и практику экзаменационных ключей: LLM-судья получает список контрольных точек с указанием, что считается правильным ответом, и по каждой выносит вердикт «пройдена» или «провалена». Итоговый балл вычисляется программно, что обеспечивает воспроизводимость. Тестовый текст представляет собой переработанную версию рассказа О. Генри 1906 года, действие перенесено в наши дни, устаревшие обороты заменены, имена изменены, финал переписан. Объём — около 3100 слов, 66 абзацев и эпиграф-четверостишие. Сто ловушек распределены по двенадцати областям, каждая стоит одно очко, поэтому итог читается как процент. Например, одна из ловушек проверяет, сможет ли модель правильно определить род врача скорой помощи, который упоминается без указания пола шесть абзацев, а затем оказывается женщиной. В русском переводе необходимо заранее выбрать род глаголов, и модель, не дочитавшая текст, ошибается. Другая ловушка — многозначное слово fair, которое встречается в трёх разных значениях: меткий выстрел, уличная ярмарка и светлая кожа. Также проверяется передача повторяющейся реплики «Well, really!» как характеристики персонажа и правильное произношение фамилий Beauchamp (Бичем), Cholmondeley (Чамли) и Siobhan (Шивон).

Ключ к бенчмарку написан на английском и не зависит от языка перевода, что позволяет использовать его для тестирования перевода с английского на любой другой язык. Переводчик не видит ключ, а сам текст и ключ хранятся в сжатом виде в публичном репозитории, чтобы избежать попадания в обучающие выборки. Помимо ключевых точек, судья фиксирует отсебятину (факты, действия или оценки, отсутствующие в оригинале) и непереведённые фрагменты. Программная часть без участия судьи подсчитывает потерянные абзацы, нарушения разметки, наличие иероглифов в русском тексте и количество попыток. Последний параметр важен: если модель не отвечает по форме, конвейер переспрашивает до пяти раз с подсказкой. Без штрафа за попытки модель, исправившаяся с третьего раза, получила бы тот же балл, что и справившаяся с первого, хотя затраты времени и денег втрое выше. Итоговый балл области равен числу пройденных точек, общий — сумме областей минус штрафы, нормированной к ста. Судья не выставляет свободную оценку от 0 до 100, так как такие оценки сильно варьируются между запусками, тогда как ответы «да/нет» по конкретным требованиям воспроизводимы. Повторное тестирование одного и того же перевода дало 82 и 83 балла с расхождением в одной точке из ста.

Для надёжности каждый перевод выполняется и оценивается три раза, прогоны идут параллельно, в отчёт попадают среднее значение и разброс. У средних моделей два перевода одного текста могут расходиться на 10–20 баллов, у сильных — на 3–7. Выбор среднего, а не медианы, объясняется тем, что медиана трёх прогонов отбрасывает худший результат целиком, что для книги из тридцати фрагментов может быть неоправданно. Бенчмарк встроен в конвейер BookTrans, что обеспечивает его воспроизводимость и учёт реальных промптов и форматов ответа. Предыдущий метод, основанный на подсчёте правок, страдал вкусовщиной судьи: разные модели-редакторы вносили разное количество правок, и сравнение было возможно только при едином судье. Кроме того, счёт правок льстил осторожным переводам, которые упрощали метафоры и предложения, получая меньше правок, но теряя точность. Новый подход призван устранить эти изъяны, сохранив измерение качества в реальном пайплайне.

На российском рынке машинного перевода появление такого бенчмарка может повысить требования к качеству локализации. Китайские модели GLM 5.3 и DeepSeek V4 Flash показали результаты, близкие к лидерам, и могут стать привлекательной альтернативой для компаний, ищущих экономичные решения. Однако, как отмечает автор, китайские модели бывают и слабыми: MiniMax M3, Qwen и LongCat набрали от 61 до 72 баллов. Это говорит о неоднородности качества даже внутри одного лагеря. Для российских разработчиков и издателей важна воспроизводимость оценки: бенчмарк позволяет сравнивать модели на одном тексте с чёткими критериями, что упрощает выбор инструмента для перевода книг, документации или контента. Открытый исходный код и публичный репозиторий способствуют дальнейшему развитию метода и адаптации к другим языковым парам.

Сравнивая с альтернативами, можно отметить, что многие существующие бенчмарки для перевода либо используют автоматические метрики типа BLEU, которые плохо коррелируют с человеческим восприятием, либо требуют дорогостоящей экспертной оценки. Подход BookTrans сочетает автоматизацию с элементами экспертного ключа, что даёт более сбалансированную картину. Кроме того, в отличие от закрытых коммерческих тестов, этот бенчмарк доступен для независимой проверки. В перспективе автор планирует расширять набор текстов и языковых пар, а также учитывать другие аспекты, такие как стилистическая точность и сохранение авторского голоса. Открытым остаётся вопрос, насколько результаты, полученные на одном рассказе, можно обобщить на другие жанры и объёмы. Также пока неясно, как поведёт себя бенчмарк при переводе специализированных текстов, например технических или юридических. Тем не менее, появление такого инструмента — шаг вперёд для объективной оценки качества машинного перевода, и он может стимулировать конкуренцию между разработчиками LLM.

Читайте также