Перейти к содержанию
четверг, 1 октября 2026 г.

ИИ Вестник

Главные новости о развитии искусственного интеллекта в России

Токенизаторы решают: русский текст в Claude Opus 5 обходится в 3,9 раза дороже, чем в GPT-5.5

Источник: Все публикации в потоке Разработка
Developer comparing token counts on dual monitors with Russian text code.
Generated by Sourceful Riverflow (RouterAI)

Эксперимент с прогоном одного и того же русского текста через Claude Opus 5 и GPT-5.5 показал: Opus 5 насчитал в 3,9 раза больше токенов. Это означает, что при одинаковой цене за миллион токенов обработка русского текста на Opus 5 будет почти вчетверо дороже, чем на GPT-5.5, и разница не зависит от поставщика доступа.

Пользователь провёл сравнительное тестирование токенизаторов популярных языковых моделей, чтобы выяснить, как они обрабатывают русскоязычные тексты. Оказалось, что количество токенов, необходимое для кодирования одного и того же смыслового фрагмента, может различаться в пять раз в зависимости от модели. В частности, для Claude Opus 5 русский текст требует почти в 3,9 раза больше токенов, чем для GPT-5.5. Поскольку цены на API обычно указываются за миллион токенов, при одинаковой стоимости за токен реальные расходы на русскоязычный продукт с использованием Opus 5 будут почти вчетверо выше, чем с GPT-5.5. Это не связано с ошибкой или наценкой конкретного продавца — всё дело в разных алгоритмах токенизации.

В ходе эксперимента были проанализированы 11 токенизаторов, включая модели семейств GPT, Claude, Gemini, DeepSeek, Qwen, GLM, Kimi, Grok, GigaChat и YandexGPT. Методика включала как прямое использование открытых токенизаторов (например, tiktoken для OpenAI, SentencePiece для YandexGPT), так и косвенные замеры через API для закрытых моделей — по разнице в поле usage.prompt_tokens между запросами с текстом и без него. Это позволило исключить служебные токены, такие как шаблоны чата и системные промпты. Результаты показали, что для английского текста почти все модели дают примерно одинаковую эффективность — около 5 символов на токен, тогда как для русского разброс огромен: от 1 символа на токен у Claude Opus 5 до 5 символов у YandexGPT и GigaChat. У GPT-5.x, Gemini, Grok и GLM русский текст «весит» на 18–23% больше английского, у DeepSeek — на 38%, у Qwen — на 52%, у Kimi — на 86%. У Claude Opus 5 русский текст почти втрое длиннее английского в токенах. Напротив, GigaChat и YandexGPT специально оптимизированы под русский язык, и у них русский текст занимает даже меньше токенов, чем его английский перевод.

Техническая причина кроется в устройстве токенизаторов — алгоритмов, которые разбивают входной текст на подwords-единицы перед подачей в модель. Словари токенизаторов обучаются на больших корпусах текстов, и если в них преобладает английский язык, то для русского текста модель вынуждена использовать более мелкие фрагменты, вплоть до отдельных букв. Это увеличивает количество токенов и, соответственно, стоимость обработки. Например, переход с токенизатора cl100k_base (GPT-4) на o200k_base (GPT-4o и новее) сократил число токенов для русского почти вдвое — с 2,29 до 4,01 символа на токен, при этом для английского изменений не произошло. Это означает, что если вы оценивали бюджет на русском языке исходя из опыта с GPT-4, вы могли сильно переоценить будущие затраты. Однако для Claude Opus 5 ситуация обратная: даже в английском тексте у него всего 3,25 символа на токен против пяти у большинства других моделей, а на русском — около одного символа на токен. На коде разница меньше — примерно в два раза, так как латиница и ключевые слова Python токенизируются стандартно, а дорожают только русские комментарии и докстринги.

Контекст проблемы выходит за рамки одного эксперимента. На рынке больших языковых моделей давно существует практика указывать цену за миллион токенов, что создаёт иллюзию прямого сравнения. Однако токен — это не универсальная единица, а внутренняя единица конкретной модели. Для мультиязычных продуктов, особенно ориентированных на русскоязычную аудиторию, такая метрика может вводить в заблуждение. Например, китайские модели DeepSeek, Qwen и Kimi, имеющие меньшую долю кириллицы в обучающих данных, показывают значительное увеличение числа токенов для русского текста. В то же время российские разработки GigaChat и YandexGPT изначально создавались с учётом русского языка и демонстрируют лучшую эффективность. Это ставит перед разработчиками вопрос: стоит ли ориентироваться на цену за токен или пересчитывать стоимость на основе реальных текстов, которые будет обрабатывать система.

Для российского рынка выводы особенно актуальны. Многие компании используют зарубежные API через посредников или напрямую, и при планировании бюджета на русскоязычные проекты они могут столкнуться с неожиданным ростом расходов. Например, при одинаковой цене за миллион токенов использование Claude Opus 5 для обработки русского текста обойдётся почти в четыре раза дороже, чем GPT-5.5. Это может стать решающим фактором при выборе модели для чат-ботов, систем анализа документов или генерации контента на русском языке. Кроме того, некоторые агрегаторы API возвращают некорректные значения usage, включающие служебные токены, что ещё больше запутывает картину. В одном из проверенных шлюзов на вопрос из пяти слов засчитывалось 1356 входных токенов, в другом — 3346. Поэтому для точных расчётов рекомендуется использовать собственные замеры или открытые токенизаторы, если они доступны.

Сравнение с альтернативами показывает, что выбор модели — это компромисс между ценой, качеством и языковой поддержкой. Если для английского языка все основные модели примерно равны по эффективности токенизации, то для русского разрыв огромен. Разработчикам, ориентированным на русскоязычную аудиторию, возможно, стоит рассмотреть GigaChat или YandexGPT, которые не только лучше токенизируют русский текст, но и могут быть дешевле в пересчёте на символ. Однако эти модели могут уступать в универсальности и качестве генерации на других языках. Также важно учитывать, что цена за токен у разных поставщиков может различаться в десятки раз: например, для Opus 5 минимальная цена за миллион входных токенов составляла 28,5 рубля, а медианная — 549 рублей. Поэтому при выборе стоит смотреть не только на модель, но и на конкретное предложение рынка.

В перспективе проблема токенизации может стать менее острой, если разработчики начнут уделять больше внимания мультиязычным словарям. Уже сейчас переход на новые токенизаторы в семействе GPT значительно улучшил ситуацию для русского языка. Однако закрытые модели, такие как Claude, Gemini и Grok, не всегда раскрывают детали своих токенизаторов, что затрудняет прогнозирование затрат. Открытым остаётся вопрос: будут ли производители оптимизировать токенизацию под конкретные языки или же рынок движется к универсальным решениям с поддержкой множества языков на равных? Пока же разработчикам рекомендуется самостоятельно измерять стоимость обработки на своих текстах, используя доступные инструменты, и не полагаться слепо на цену за миллион токенов. Это позволит избежать неприятных сюрпризов при масштабировании русскоязычных проектов.

Читайте также