Перейти к содержанию
пятница, 24 июля 2026 г.

ИИ Вестник

Главные новости о развитии искусственного интеллекта в России

Запущен MERA Reason: новый лидерборд для оценки рассуждений ИИ на русском языке

A leaderboard for AI reasoning models in Russian.
Generated by Sourceful Riverflow (RouterAI)

Команда разработчиков платформы MERA представила публичный лидерборд MERA Reason, предназначенный для объективной оценки способности больших языковых моделей к рассуждению на русском языке. Проект включает четыре специализированных набора задач, призванных восполнить дефицит русскоязычных бенчмарков в этой области.

За последний год в индустрии больших языковых моделей произошёл значительный сдвиг: если раньше основным предметом соревнования были знания модели — насколько хорошо она отвечает на вопросы, знает факты или пишет код, — то теперь фокус сместился на способность рассуждать. Практически каждый крупный релиз последних месяцев позиционируется как reasoning-модель, и производители говорят уже не столько о знаниях, сколько о способности строить длинные цепочки рассуждений, решать сложные задачи и принимать решения в условиях неопределённости. Однако вместе с этим возникает закономерный вопрос: как объективно измерять reasoning? Для английского языка уже существует множество математических лидербордов и специализированных наборов данных, таких как AIME, OlymMATH, Math, GSM8K и MiniF2F, но для русского языка подобных открытых площадок пока значительно меньше. Чтобы закрыть этот пробел, команда MERA запускает публичный лидерборд MERA Reason, посвящённый оценке reasoning-моделей на русском языке, который стал первой частью большого обновления текстовой MERA и своего рода превью следующего релиза платформы, запланированного на лето.

На первый взгляд кажется, что рассуждения можно проверять практически в любой задаче, однако на практике большинство открытых лидербордов используют именно математические бенчмарки. Причина довольно проста: хороший тест на reasoning должен обладать сразу несколькими свойствами — требовать последовательных рассуждений, а не воспроизведения информации, иметь объективно проверяемый правильный ответ, позволять сравнивать модели между собой воспроизводимым способом и содержать задачи разного уровня сложности. Именно поэтому математические задачи сегодня стали одним из наиболее надёжных прокси для оценки reasoning-моделей, хотя важно понимать, что reasoning — это не только математика. Но именно математические задачи традиционно позволяют наиболее объективно измерять способность модели строить цепочку рассуждений без необходимости привлекать человека-эксперта для проверки каждого ответа. Оценить способность к рассуждению одним датасетом невозможно, поэтому лидерборд объединяет сразу четыре различных набора задач, каждый из которых проверяет разные аспекты логического мышления.

Первый набор, Luzitania, представляет собой коллекцию математических задач повышенной сложности, выросшую из регламента Kaggle-соревнования AIMO3, где участникам нужно было решить 50 задач уровня международных математических олимпиад за 5 часов, используя одну GPU H100. Лучший результат в соревновании показала модель GPT-OSS-120B в агентском режиме, и именно её прогоны использовались для оценки сложности задач. В датасет вошли 251 задача, прошедшая фильтрацию по трудности: задача должна решаться GPT-OSS-120B не чаще чем в половине случаев при определённых настройках, при этом правильное решение должно занимать не менее 10 тысяч токенов. Основу набора составляют задачи с олимпиад высокого уровня — примерно между Всероссийской олимпиадой и IMO, причём предпочтение отдавалось задачам, изначально опубликованным не на английском языке, например, из Румынской олимпиады, Китайской олимпиады для девочек и Турнира городов. Также были добавлены задачи из датасетов MathArena и MathArxiv по продвинутой абстрактной математике, выходящей за рамки школьной олимпиадной программы, чтобы проверить, переносится ли навык математического рассуждения за пределы привычного формата.

Второй набор, OlymMATH, ориентирован на задачи из международных математических олимпиад, переведённые на русский язык, и проверяет способность модели к глубокому анализу и нестандартным решениям. Третий набор, GSM8K, включает задачи на арифметику и базовые рассуждения, адаптированные для русскоязычной аудитории, что позволяет оценить устойчивость модели к простым, но многошаговым вычислениям. Четвёртый набор, MathQA, содержит задачи из различных математических дисциплин, требующие как точных вычислений, так и логических выводов. Все задачи были переведены на русский язык и частично переформулированы, чтобы снизить вероятность воспроизведения решений, заученных на этапе предобучения. Такое разнообразие позволяет проверить, как модель справляется с длинными цепочками рассуждений, выбором стратегии решения, устойчивостью при большом количестве промежуточных шагов и способностью использовать инструменты там, где они действительно помогают.

Запуск MERA Reason имеет важное значение для российского рынка ИИ, так как до сих пор разработчики и исследователи были вынуждены полагаться на англоязычные бенчмарки, которые не всегда адекватно отражают способности моделей в русскоязычной среде. Создатели лидерборда подчёркивают, что их цель — не просто предоставить набор тестов, а создать воспроизводимую и объективную систему оценки, которая позволит сравнивать современные reasoning-модели между собой в едином окружении. Реакция профессионального сообщества на анонс была положительной: многие эксперты отмечают, что такой инструмент давно требовался, особенно в свете растущего числа русскоязычных моделей, заявляющих о способности к рассуждению. Кроме того, лидерборд может стать стимулом для разработчиков улучшать свои модели, ориентируясь на конкретные метрики, а не на маркетинговые заявления.

В перспективе команда MERA планирует расширять лидерборд, добавляя новые наборы задач и сценарии, включая задачи на логику, планирование и принятие решений в условиях неопределённости. Пока остаётся открытым вопрос о том, насколько точно математические задачи отражают общую способность модели к рассуждению в реальных приложениях, таких как юридический анализ, медицинская диагностика или бизнес-планирование. Тем не менее, MERA Reason представляет собой важный шаг вперёд в стандартизации оценки ИИ на русском языке и может стать основой для будущих исследований в этой области. Следующий релиз платформы, запланированный на лето, обещает ещё более широкий набор инструментов для тестирования, что позволит разработчикам глубже понять сильные и слабые стороны своих моделей.

Читайте также