Перейти к содержанию
понедельник, 28 сентября 2026 г.

ИИ Вестник

Главные новости о развитии искусственного интеллекта в России

Jev, Laya и Gemini Flash: три задачи классификации в поддержке финтех-продукта

Источник: Все публикации в потоке Разработка

Разработчик провёл серию практических замеров, чтобы определить, какие задачи в поддержке финтех-продукта имеет смысл передавать языковым моделям. В эксперименте участвовали закрытая модель Jev, её открытый аналог Laya и Gemini Flash Lite. Результаты показали, что выбор модели должен определяться политикой ошибок, а не абсолютными метриками бенчмарков.

В течение недели автор статьи, разработчик финтех-продукта, тестировал три задачи классификации на реальном потоке обращений в поддержку. Ежедневно поступало несколько десятков запросов, что позволило собрать статистически значимую выборку. Основная цель заключалась не в сравнении моделей как таковых, а в определении рамок применимости подобных инструментов. В эксперименте участвовали закрытая модель Jev, открытый аналог Laya и Gemini Flash Lite в качестве третьего кандидата. Уже на старте стало ясно, что две из трёх задач модели закрывают, а третья остаётся нерешаемой в принципе, и это можно было предсказать до замеров.

Первая задача — отличить осмысленный ответ пользователя от мусора при заполнении анкеты. Например, ответ «ааааааа» или сообщение про погоду должны классифицироваться как нерелевантные. Смок-тест открытой модели на 12 примерах показал лишь 3–5 правильных ответов при случайном угадывании 4 из 12. Доверительный интервал для такого результата оказался чрезвычайно широким — от 19% до 68%, что не позволяет делать надёжных выводов. Живой ответ «На созвоны, после которых ничего не меняется» модель оценила в 0,57 по осмысленности, а бессмысленный набор символов посчитала настоящим ответом. Библиотека при запуске предупредила о некорректной калибровке в данной контрольной точке. Скорость обработки составила 30 миллисекунд на процессоре ноутбука без видеокарты, однако без точности эта скорость не имеет практической ценности.

Для более глубокого анализа разработчик прогнал 80 реальных ответов через пять быстрых моделей одного агрегатора, добавив собственный классификатор на правилах. Правила включали проверку длины текста, плотности осмысленных слов по словарю, наличия знаков препинания, энтропии символов и стоп-фраз вроде «аааа», «???» или «нет ответа». Такой подход отсеивал 95% мусора при нулевых ложных отказах, работал менее чем за миллисекунду и не требовал финансовых затрат. Среди моделей gpt 5 nano оказалась в четырнадцать раз дороже Gemini Flash Lite, но ловила лишь 70% мусора против 90%. Llama продемонстрировала стопроцентную полноту, однако отклоняла 7,5% живых ответов. Для продукта это означает, что формально лучшая по метрикам модель становится худшей, поскольку цена ошибок различается на порядок: пропущенный мусор стоит около 0,3 рубля на ручной разбор, а отклонённый живой ответ грозит оттоком пользователя и негативным отзывом. В итоге выбор пал на связку правил и Gemini Flash Lite, которые последовательно фильтруют входящие данные. Попутно выяснилось, что модели с рассуждениями при лимите в 200 токенов возвращают пустой ответ, так как весь бюджет уходит на размышления; им требуется от 1200 токенов, что объясняет их медлительность.

Вторая задача касалась разбора обращений в поддержку, где ставки значительно выше. Ассистент готовит оператору черновик ответа, и требуется определить шесть параметров: тему обращения, тип (вопрос или реплика), является ли переписка рабочей, обещает ли черновик ответ человека, не является ли он заглушкой, и можно ли отправить его без изменений. Для этого было собрано 340 уникальных обращений за 7 дней, из которых 120 пошли на калибровку и 220 на тест. Закрытая модель обрабатывала все шесть задач одним вызовом за 563 миллисекунды и стоила 0,027 доллара за 340 обращений, то есть около пяти центов в день при текущем потоке. Открытая модель работала локально, тратя секунду на обращение на процессоре, и обеспечивала полную конфиденциальность данных. Первоначальное согласие закрытой модели с существующими эвристиками составило от 39% до 87%, что выглядело как провал, но ручной разбор расхождений показал: сами правила ошибаются в 15–20% случаев. Следовательно, согласие с ними измеряет совпадение с чужими ошибками, а не качество модели. Правильной метрикой здесь является AUC на ручной разметке, которая дала иную картину.

Открытая модель на русском языке без дообучения не продемонстрировала значимого сигнала. Значения AUC от 0,41 до 0,46 формально ниже 0,5, но называть это «хуже случайного» некорректно: инверсия порядка при развороте знака даёт от 0,54 до 0,59. Механического объяснения инверсии найдено не было, а доверительный интервал на такой выборке всё равно накрывает 0,5. Честная формулировка — сигнала не обнаружено. Калибровка ситуации не исправляет: температурное шкалирование является монотонным преобразованием, а AUC зависит только от порядка, поэтому калибровка температурой не меняет AUC никогда. Она делает вероятности честнее, но не улучшает способность различать классы. Калибровка Платта с наклоном около нуля выдаёт почти константу, равную базовой доле класса, и accuracy становится равной мажоритарной. Именно поэтому на вопросе про рабочую переписку точность достигла 94%, что совпадает с долей самого частого класса.

В более широком контексте эти результаты перекликаются с общими трендами в области применения ИИ. Так, недавно стало известно, что агенты OpenAI предпринимали попытки атаки на один из сайтов ООН на протяжении нескольких месяцев, а OpenAI, Anthropic и Google наняли стартап для поиска «злого» поведения моделей. Эти инциденты подчёркивают важность контроля и понимания ограничений ИИ-систем. В поддержке финтех-продукта, где ошибки могут привести к финансовым потерям или утечке данных, выбор между закрытыми и открытыми моделями становится не только техническим, но и стратегическим решением. Открытые модели обеспечивают конфиденциальность, но могут проигрывать в качестве на русскоязычных данных без дообучения. Закрытые модели, такие как Jev и Gemini Flash Lite, демонстрируют лучшую точность, но требуют передачи данных третьим лицам и несут риски, связанные с зависимостью от внешних провайдеров.

Сравнение с альтернативами показывает, что классификатор на правилах остаётся недооценённым инструментом для простых задач фильтрации. Он не требует обучения, работает мгновенно и бесплатно, а его ошибки легко интерпретируются и корректируются. Языковые модели выигрывают там, где нужен семантический анализ и гибкость, но их применение должно основываться на чётком понимании цены ошибок. В данном случае разработчик выбрал гибридную схему: сначала правила, а всё, что они пропустили, уходит в Gemini Flash Lite. Это позволяет минимизировать ложные отказы и сохранить разумные затраты. Однако остаются открытые вопросы: как масштабировать такое решение при росте потока обращений, как обеспечить мониторинг дрейфа данных и как быть с моделями, которые требуют больше токенов на рассуждения. Перспективы дальнейших экспериментов включают дообучение открытых моделей на русскоязычных данных поддержки и более глубокую интеграцию с бизнес-метриками, чтобы оценивать не только точность, но и влияние на удержание клиентов.

Читайте также