FRIDA Decisions: открытая модель быстрого принятия решений на русском языке
Российские разработчики представили FRIDA Decisions — открытую модель для быстрого принятия решений на русском языке. Она выбирает вариант из списка, ставит оценку, отвечает «да» или «нет» и ранжирует кандидатов за один проход энкодера, без генерации текста. Модель работает за десятки миллисекунд и показывает качество на уровне коммерческих API.
FRIDA Decisions — это открытая модель быстрого мышления, созданная для русского языка. Она предназначена для задач, где не требуется генерация текста, а нужно лишь выбрать один из вариантов, поставить оценку по шкале, ответить «да» или «нет» или ранжировать кандидатов. В отличие от больших языковых моделей, которые генерируют ответ токен за токеном, FRIDA Decisions делает всё за один проход энкодера, что обеспечивает скорость в десятки миллисекунд на видеокарте RTX 5060 Ti. Модель уже доступна с открытым исходным кодом и весами под лицензией MIT.
Ключевые характеристики модели впечатляют. На бенчмарке razvilka, специально собранном для оценки таких задач на русском языке, FRIDA Decisions набирает 0,893, что статистически неотличимо от результата коммерческого API TypeSafe Jev (0,897). При этом модель в 40 раз меньше, чем Qwen3.5-35B-A3B, которая показывает схожие результаты. Скорость ответа на RTX 5060 Ti составляет 28-34 миллисекунды на запрос, тогда как коммерческий API с учётом сетевой задержки отвечает примерно за 430 миллисекунд. Стоимость обработки одного запроса на арендованной видеокарте почти в 20 раз ниже, чем при использовании внешнего API. Модель требует всего около 2 ГБ видеопамяти, а на CPU с int8-квантованием в ONNX отвечает примерно за 0,9 секунды на шести потоках.
Технически FRIDA Decisions основана на эмбеддинг-модели FRIDA, которая, в свою очередь, является энкодером от FRED-T5 с 24 слоями и 823 миллионами параметров. Для новой задачи разработчики дообучили её из эмбеддера в кросс-энкодер: модель читает каждого кандидата в контексте текста и вопроса и выдаёт одно число — оценку релевантности. Это похоже на работу реранкеров, но с важным отличием: список меток и их описания передаются прямо в запросе в виде текста, поэтому новая таксономия — это просто новый JSON, а не новое обучение. Декодера у модели нет, токенов на выходе ноль, поэтому ответ всегда один из объявленных вариантов, а вероятности всех вариантов видны сразу. Поддерживаются четыре типа вопросов: выбор из списка (choice), оценка по шкале (score), «да/нет» (noul) и ранжирование (rank). Названия типов взяты из протокола Jev, поэтому запросы в его формате подходят и для FRIDA Decisions.
Контекст появления таких моделей связан с ростом числа задач в LLM-продуктах, где не нужна генерация текста. Это маршрутизация запросов между моделями или агентами, guardrails для проверки токсичности или мошенничества, выбор инструмента в tool calling, разбор тикетов по теме и срочности, а также реранкинг для RAG. Обычно для этих целей используют большие языковые модели, что дорого и медленно. Появился отдельный класс моделей быстрого рассуждения (decision models), которые на входе получают текст и закрытый список вариантов, а на выходе выдают лучший вариант и вероятности всех вариантов. Коммерческий API TypeSafe Jev, по оценкам самой TypeSafe, в таких задачах в 40-200 раз быстрее и примерно в 400 раз дешевле фронтирных LLM. TypeSafe называет такие модели «Системой 1» по Канеману — быстрый ответ без рассуждений, в отличие от медленной «Системы 2» у LLM. Однако подобные сервисы — это внешние API с сетевой задержкой, оплатой за токены, лимитами и передачей данных наружу. FRIDA Decisions решает эти проблемы, предоставляя открытую модель для русского языка, которую можно запустить локально.
Для российского рынка появление FRIDA Decisions имеет большое значение. Во-первых, это первая открытая модель такого класса, специально оптимизированная для русского языка. Во-вторых, она позволяет компаниям развернуть решение на собственных серверах, не отправляя данные внешним провайдерам, что критично для финансового, медицинского и государственного секторов. В-третьих, стоимость владения значительно ниже: не нужно платить за каждый запрос, достаточно арендовать или иметь одну видеокарту. Модель уже поддерживает ONNX для CPU, MLX для запуска на Mac, а также vLLM-сервер для масштабирования. Разработчики опубликовали бенчмарк razvilka, состоящий из 735 примеров в 15 задачах, с человеческой разметкой из открытых русских корпусов, которую дополнительно проверили две фронтирные модели. Лексический бейзлайн на этом бенчмарке набирает 0,333, случайный ответ — 0,257, что показывает высокое качество FRIDA Decisions. По сравнению с открытой репродукцией Jev — моделью decider-2b размером 1,9B — FRIDA Decisions выигрывает 44 примера (p < 0,001). Энкодеры и реранкеры до 1 млрд параметров отстают на 32-40 процентных пунктов.
В сравнении с альтернативами FRIDA Decisions выглядит конкурентоспособно. Коммерческий API TypeSafe Jev показывает почти такое же качество (0,897 против 0,893), но требует передачи данных и оплаты за каждый запрос. Открытая модель decider-2b вдвое больше по размеру, но уступает в точности. Большие языковые модели, такие как Qwen3.5-35B-A3B, показывают схожий результат, но в 40 раз больше и требуют генерации текста, что медленнее и дороже. FRIDA Decisions не генерирует текст, поэтому не может использоваться для творческих задач, но для классификации, маршрутизации и ранжирования она оптимальна. Модель поддерживает сотни вариантов в одном запросе: все варианты ответа идут в одну последовательность, текст кодируется один раз. При типичном запросе с тремя вопросами это в 6 раз меньше токенов, чем при наивной раскладке, а каталог из 243 интентов разбирается за 0,44 с вместо 4,65 с. Это достигается за счёт того, что модель обрабатывает всех кандидатов параллельно в рамках одного прохода энкодера.
Перспективы FRIDA Decisions связаны с дальнейшим развитием экосистемы. Уже сейчас доступны веса и код инференса под MIT, бенчмарк razvilka с отдельными лицензиями для каждой задачи, ONNX-версия для CPU, запуск на Маке через MLX и vLLM-сервер. Разработчики обещают рассказать, как модель устроена под капотом, и показать, как запустить её у себя. Открытые вопросы касаются масштабирования на другие языки, поддержки более сложных типов вопросов и интеграции с существующими фреймворками. Также интересно, как модель поведёт себя на доменах, отличных от обучающей выборки. Но уже сейчас ясно, что FRIDA Decisions может стать стандартом для задач быстрого принятия решений на русском языке, особенно в условиях импортозамещения и требований к локализации данных. Конкуренция с коммерческими API будет усиливаться, но открытость и низкая стоимость дают российской разработке преимущество.