В России создали RUMBA — первый бенчмарк для оценки долгосрочной памяти диалоговых систем на русском языке
Группа российских разработчиков представила RUMBA — новый бенчмарк, предназначенный для тестирования способности диалоговых ИИ-систем запоминать и использовать информацию из долгосрочного общения с пользователем. Инструмент заполняет пробел в русскоязычном ландшафте оценки ИИ, предлагая многослойную таксономию и реалистичные сценарии взаимодействия.
Разработчики из российского сообщества анонсировали RUMBA (Russian User Memory Benchmark) — первый специализированный бенчмарк для оценки долгосрочной памяти диалоговых систем на русском языке. Проект стал ответом на растущий спрос со стороны пользователей, которые ожидают от ассистентов не просто генерации ответов, но и учета предыдущих взаимодействий: запоминания личных фактов, контекста бесед, временных рамок и изменений в информации. В отличие от стандартных тестов, RUMBA фокусируется не на изолированных качествах языковой модели, а на комплексной работе системы в многосессионных диалогах, где ключевую роль играют механизмы извлечения, обновления и согласования данных. Бенчмарк состоит из длинных, оригинально написанных диалогов между пользователем и ассистентом, созданных с нуля при участии 26 контрибьюторов за 20 рабочих дней, причем пользовательские реплики писали люди, а ответы ассистента генерировались с помощью GigaChat Max.
Структура RUMBA включает три основные группы задач, охватывающие различные аспекты работы с памятью. Первая группа — Information Extraction — проверяет способность системы находить в истории общения нужные факты о пользователе, его планах, привычках или рекомендациях, а также корректно определять их актуальность и временную привязку. Вторая группа — Reasoning — требует от системы построения ответа через логическое рассуждение: сопоставление нескольких фактов, восстановление связей между событиями, выполнение вычислений или определение причинно-следственных связей, причем многие задачи зависят от временного контекста. Третья группа — Abstention — оценивает умение системы признавать отсутствие информации в диалоге и избегать галлюцинаций, что особенно важно при работе с большими и запутанными контекстами. Каждый вопрос в датасете снабжен временной меткой, что позволяет проверять не только объем памяти, но и способность системы ориентироваться во временной шкале взаимодействия, которая в среднем охватывает около 191 дня общения.
Ключевой особенностью RUMBA является многослойная таксономия, которая выходит за рамки простых «плоских» типов вопросов, используемых в англоязычных аналогах, таких как LoCoMo, LongMemEval или Mem-Gallery. Каждый вопрос описывается композиционным набором тегов: семантический тип, охват сессий (одна или несколько) и темпоральность — необходимость учета временного каркаса диалога. Для темпоральных вопросов добавляется дополнительный тег, указывающий, как именно время выражено в репликах пользователя: явно, неявно или не выражено напрямую. Такая детализация позволяет анализировать результаты через множество «срезов», выявляя, на каких именно аспектах памяти система ошибается — будь то обновление устаревших данных, сбор информации из разных сессий или рассуждение с учетом дат. Бенчмарк существует в двух версиях: русская является основной, а английская получена автоматическим переводом через LLM с ручной выверкой для кросс-лингвального сравнения.
Создание RUMBA обусловлено практической необходимостью: память в современных диалоговых системах редко является встроенным свойством самой языковой модели, а чаще реализуется как отдельный слой через RAG с долговременными хранилищами фактов, векторными или графовыми базами, профилями пользователей и журналами событий. Качество такой памяти напрямую зависит от архитектуры в целом: как система извлекает факты, разрешает противоречия, обрабатывает запросы на удаление данных и использует временной контекст. До появления RUMBA для русского языка не существовало инструмента, который бы комплексно проверял именно эти аспекты в реалистичных разговорных сценариях, что тормозило развитие локальных продуктов и усложняло сравнение различных подходов к реализации памяти. В то время как западные бенчмарки активно развиваются, российский рынок ИИ-ассистентов и агентных систем испытывал дефицит специализированных средств оценки, особенно учитывая лингвистические и культурные особенности русскоязычного общения.
Для российского рынка появление RUMBA имеет стратегическое значение, поскольку открывает возможности для объективного сравнения отечественных диалоговых систем, включая решения на базе GigaChat, YandexGPT и других моделей, с зарубежными аналогами. Бенчмарк позволяет разработчикам не только получить общую метрику, но и детально проанализировать слабые места своих продуктов: например, выявить, что система хорошо запоминает факты, но плохо справляется с обновлением устаревшей информации или теряет контекст при переходе между сессиями. Это особенно важно для приложений в сфере образования, здравоохранения, клиентской поддержки и личных ассистентов, где долгосрочная память является критическим фактором пользовательского опыта. В отличие от англоязычных бенчмарков, RUMBA учитывает специфику русского языка, включая сложные временные конструкции, падежные формы и контекстуальные нюансы, что делает его более релевантным для локальных разработок.
Перспективы развития RUMBA связаны с его интеграцией в стандартные пайплайны тестирования диалоговых систем, а также с возможностью расширения датасета новыми сценариями и типами задач. Открытыми остаются вопросы о том, как бенчмарк будет адаптироваться под быстро меняющиеся архитектуры ИИ-агентов, особенно с появлением гибридных подходов, сочетающих RAG, графовые базы и инструментальные вызовы. Кроме того, сообщество ожидает публикации первых результатов тестирования популярных моделей, что позволит увидеть реальную картину их возможностей в работе с долгосрочной памятью. В ближайшее время разработчики планируют представить детальный анализ ошибок систем на различных супергруппах задач, что должно стимулировать улучшение архитектур памяти и появление новых решений, ориентированных на русскоязычных пользователей.