Gemini 3.7 Flash: быстрее, умнее и дешевле, но вопросы к честности бенчмарков остаются
Google выпустила Gemini 3.7 Flash — модель для кода и агентных задач, которая, по заявлению компании, вдвое дешевле предшественницы и заметно прогрессировала в ключевых бенчмарках. Однако независимые эксперты уже обнаружили нестыковки в сравнительных тестах, а пользователи сомневаются в объективности некоторых замеров.
Компания Google официально представила Gemini 3.7 Flash — модель, которую сама корпорация позиционирует как «самую умную рабочую лошадку» для софтверной инженерии и агентных воркфлоу. Релиз состоялся всего через три недели после выхода Gemini 3.6 Flash, что само по себе необычно для индустрии, где крупные обновления обычно выходят раз в несколько месяцев. В Google объясняют такую скорость обратной связью от разработчиков и алгоритмическими находками, которые обещают применять и к будущим моделям. Глава DeepMind Демис Хассабис в своём анонсе ограничился лаконичным заявлением о «мажорных апгрейдах» для инженерии и knowledge work, а также подчеркнул, что вводная цена вдвое ниже прежней. Модель уже получила статус General Availability в Google AI Studio и официально готова к продакшену, что подтверждается гайдом для разработчиков.
По собственным замерам компании, прогресс относительно 3.6 Flash выглядит впечатляюще: DeepSWE v1.1 вырос с 49% до 65,3%, FrontierCode 1.1 Main — с 34,4% до 43,6%, WebDev Arena Elo — с 1538 до 1588 очков. Отдельная гордость Google — работа с документами и автоматизацией бизнес-процессов: на бенчмарке GDP.pdf, тестирующем понимание сложных документов, показатель вырос с 22 до 34%, а на AutomationBench, измеряющем выполнение реальных бизнес-воркфлоу — с 17% до 30,4%. Эти цифры особенно важны для российского рынка ИИ, где автоматизация документооборота и бизнес-процессов остаётся одной из самых востребованных задач, а западные модели часто критикуют за слабую работу с русскоязычными документами.
Независимые аналитики из Artificial Analysis разложили релиз по полочкам. По их замерам, Gemini 3.7 Flash (high) достигает 56 баллов по Artificial Analysis Intelligence Index — это на 4 пункта выше предшественника, и модель оказывается «прямо позади» GPT-5.6 Terra (max, 57 баллов) и Muse Spark* 1.2 (xhigh, 57 баллов) (* компания Meta является запрещённой в России). Главный вклад в этот скачок дали агентные бенчмарки: Tau3 Banking (+3 балла), Terminal-Bench v2.1 (+8 баллов) и GDPval-AA v2 (+103 очка Elo). Отдельная деталь, ради которой Artificial Analysis вообще запустили серию твитов — «граница Парето» между интеллектом и скоростью выполнения задачи. Модель выдаёт около 340 токенов в секунду — это почти втрое быстрее GPT-5.6 Terra и GLM-5.2, и при этом на высоком уровне рассуждений среднее время на задачу составляет всего 1,7 минуты. То есть модель не просто быстрая — она попадает в редкую зону, где нет компромисса между умностью и быстротой.
При вводной скидочной цене Gemini 3.7 Flash (high) обходится в $0,40 за задачу по Intelligence Index — это на 30% дешевле, чем у 3.6 Flash, и на одном уровне с Muse Spark 1.2 (* компания Meta является запрещённой в России). На среднем уровне рассуждений цена падает до $0,26 за задачу. Ещё одна метрика — рост токен-бюджета: модель на высоком уровне рассуждений использует примерно на 40% больше токенов, чем 3.6 Flash, в среднем около 37 тысяч выходных токенов на задачу — что сопоставимо с Claude Fable 5 и Qwen3.8 Max. По агентным бенчмаркам картина тоже впечатляющая: в AA-Briefcase (проприетарный бенчмарк агентной работы со знаниями) модель набирает 1132 очка Elo — это на 169 очков выше предшественника, и она обходит Minimax-M3. На GDPval-AA v2 прирост составил 103 очка, до 1525 — почти на уровне с GLM 5.2 и DeepSeek V4 Flash. Для тех, кто работает с большими объёмами данных и офисных документов, на AA-AnalystAgent, бенчмарке, измеряющем способность отвечать на сложные вопросы по таблицам и документам, Gemini 3.7 Flash (high) достигает pass^5 в 60%, обходя Claude Opus 5 (max, 54%) и даже Fable 5 (49%). На AutomationBench-AA модель также лидирует с результатом 62,7%, опережая Kimi K3 (53%) и GPT-5.6 Sol (51,2%). Flash-модель, формально самая дешёвая и младшая, обходит топовую модель Anthropic в задачах анализа документов. Понятно, что один бенчмарк не делает погоды, но сам факт того, что подобное вообще возможно, хороший повод присмотреться к модели повнимательнее.
Однако при переходе на независимые площадки начинается цирк с конями. Пользователи подвергли сомнению бенчмарк CursorBench, утверждающий, что 3.7 Flash лучше 5.6 Sol и K3. Справедливости ради: на графике сравнивали GPT-5.6 Sol на среднем уровне усилий с Gemini 3.7 Flash на максимальном — и это, мягко говоря, не совсем честно. При сопоставимых настройках GPT-5.6 Sol max — 67,2%, Gemini 3.7 Flash high — 61,6%, то есть разрыв не в пользу Flash. Мораль простая: любой бенчмарк стоит проверять на честность настроек сравнения. Инвертированные оси, разные уровни усилий модели, некорректная нормализация — всё это встречается сплошь и рядом. Arena (бывшая LMArena) даёт более взвешенную картину. В Agent Arena модель Gemini 3.7 Flash high вылезла сразу с чистым приростом +3,4% и заняла #20 место в общем зачёте — заметный скачок по сравнению с #35 у Gemini 3.6 Flash high, и теперь модель оказывается в одном диапазоне с Claude Sonnet 4.6 и GPT-5.6 Terra (xhigh).
Остаётся открытым вопрос: где Gemini 3.5 Pro? Топовая модель задерживается уже который раз подряд, и это вызывает беспокойство у части сообщества. Забавно, но параллельно с этим Google продолжает вкладываться в Gemma, свою открытую линейку. Для российского рынка ИИ появление Gemini 3.7 Flash может стать значимым событием: модель предлагает сочетание высокой производительности и низкой цены, что критически важно для стартапов и среднего бизнеса, которые ищут альтернативы дорогим решениям OpenAI или Anthropic. Однако осторожность в оценках необходима — история с CursorBench показывает, что маркетинговые заявления не всегда соответствуют действительности, и любые цифры стоит перепроверять. В ближайшие недели мы, вероятно, увидим независимые тесты на русскоязычных данных, которые дадут более точную картину. Пока же Gemini 3.7 Flash выглядит как многообещающий инструмент, но с оговорками о честности бенчмарков и необходимости собственного тестирования под конкретные задачи.