Сравнение новых ИИ-моделей: как считать реальную стоимость задачи, а не токена
Осенью 2026 года сразу несколько компаний выпустили обновлённые флагманские модели, что породило волну сравнений. Однако производители и независимые аналитики приводят разные цифры, и чтобы понять реальные затраты, нужно учитывать не прейскурант, а стоимость решения конкретной задачи.
В начале сентября 2026 года Anthropic представила Claude Fable 5.1, а через два дня OpenAI анонсировала GPT-6 Astra. За ними последовали релизы от других игроков, включая обновления от DeepSeek и xAI. В результате рынок больших языковых моделей пополнился сразу несколькими мощными решениями, и у специалистов возникла потребность в объективном сравнении их производительности и стоимости. Однако, как показывает анализ, цифры, публикуемые компаниями-разработчиками, и независимые замеры могут существенно расходиться, что требует осторожного подхода к оценке.
Первая сложность заключается в том, что производители часто используют собственные методики тестирования, которые могут быть оптимизированы под сильные стороны их моделей. Например, в тесте Terminal-Bench 4.0 для Grok 4.7 компания xAI сообщила о результате 37,6%, тогда как независимая организация Artificial Analysis получила только 33%. Такие расхождения объясняются разными настройками уровня рассуждений, форматами подачи задач и критериями оценки. Поэтому для корректного сравнения необходимо опираться на независимые бенчмарки, которые обеспечивают единые условия для всех моделей. Artificial Analysis предлагает сводный индекс, основанный на десяти тестах, а также отдельные метрики скорости вывода и времени до первого токена. Однако и этот индекс не лишён недостатков: он усредняет результаты, и модель, сильная в узкой области, может проигрывать в общем зачёте.
Второй важный аспект — это пересчёт стоимости токенов в цену решения задачи. Прейскурант обычно указывает цену за токен, но реальные затраты зависят от того, сколько токенов модель расходует на выполнение задания. Например, Claude Sonnet 5.5 на максимальном уровне рассуждений стоит $7,67 за задачу, в то время как Opus 5.5 — $5,98, хотя за токен Sonnet дешевле. Причина в том, что Sonnet генерирует значительно больше выходных токенов: 420 миллионов на прогон против 260 миллионов у Opus. Аналогично, GPT-6 Astra при более высокой цене за токен обеспечивает стоимость задачи всего $3,26, что вдвое дешевле Opus. Таким образом, выбор модели должен основываться на цене решённой задачи, а не на цене за токен.
Третий шаг — сверка сводного индекса с отраслевыми тестами. На 3 октября 2026 года лидером индекса Artificial Analysis является Claude Opus 5.5 с 58 баллами, за ним следуют Sonnet 5.5 (56), Fable 5.1 (53), GPT-6 Astra (53) и GPT-6.1 Sol (52). Разрыв между первыми пятью моделями составляет всего шесть баллов, что меньше разницы между уровнями рассуждений low и medium у одной и той же модели. Это означает, что настройка уровня рассуждений может влиять на результат не меньше, чем смена поставщика. В специализированных тестах, таких как Terminal-Bench 4.0, лидирует Sonnet 5.5 с 70,6%, за ним Opus 5.5 (66,4%) и GPT-6 Astra (57,9%). В OSWorld лучшие результаты у Opus 5.5 (81,8%) и Sonnet 5.5 (80,1%). В AutomationBench GPT-6.1 Sol обходит Opus 5.5 на 2,2 пункта. В научной версии Terminal-Bench лидирует Astra, а в Harvey — Grok 4.7 с 19,6% против 6,7% у Fable 5.1. Таким образом, у каждой модели есть свои сильные стороны: Claude традиционно силён в длинных агентных задачах, GPT-6.1 Sol демонстрирует лучшее соотношение качества и цены, а DeepSeek остаётся лучшим среди открытых моделей.
Для российского рынка эти новости имеют особое значение, поскольку доступ к зарубежным ИИ-сервисам может быть ограничен. Компании и разработчики вынуждены искать альтернативы, в том числе среди открытых моделей, таких как DeepSeek. Однако, как показывают независимые замеры, реальные показатели DeepSeek могут быть ниже, чем заявлено производителем. Это важно учитывать при выборе решения для бизнеса. Кроме того, стоимость задачи в долларах может быть существенной, и при пересчёте в рубли разница между моделями становится ещё заметнее. Российские разработчики также активно следят за появлением новых моделей и их характеристиками, чтобы интегрировать лучшие решения в свои продукты.
Сравнение с альтернативами показывает, что на рынке существует несколько ценовых сегментов. В верхнем сегменте доминируют Anthropic и OpenAI, предлагая модели с высокой стоимостью, но и высоким качеством. В среднем сегменте можно выделить GPT-6.1 Sol с ценой $0,72 за задачу при 52 баллах индекса, что является отличным соотношением. В нижнем сегменте находятся GPT-6 Luna (38 баллов за $0,07) и DeepSeek V4.1 Flash (39 баллов за $0,27). Однако стоит отметить, что старшая модель DeepSeek V4 Pro стоит $0,67 за задачу при 36 баллах, что делает её менее привлекательной после летнего подорожания. Таким образом, при выборе модели важно учитывать не только абсолютные показатели, но и стоимость решения типовых задач.
В перспективе можно ожидать дальнейшего роста конкуренции и появления новых моделей. Уже сейчас некоторые результаты остаются неопубликованными, например, для GPT-6.1 Sol, Luna и DeepSeek в тесте Terminal-Bench 4.0. Это затрудняет объективное сравнение. Кроме того, методология оценки продолжает развиваться: Artificial Analysis планирует добавить замеры скорости печати и времени до первого слова, а также тесты на работу с большими документами. Для российских пользователей остаётся открытым вопрос доступности этих моделей и возможности их использования в условиях санкций. Тем не менее, понимание реальной стоимости задачи и учёт уровня рассуждений помогут сделать осознанный выбор даже в условиях неполной информации.