ML-пайплайн для поиска подозрительных транзакций: почему ранжирование эффективнее классификации
Специалист по данным Максим Коцюба представил сквозной ML/MLOps-пайплайн для финмониторинга, который ранжирует операции по риску, а не просто классифицирует их. Проект показал, что при сильном дисбалансе классов бинарная классификация уступает риск-ориентированному подходу.
В условиях стремительного роста объёма финансовых операций аналитикам становится всё сложнее вручную обрабатывать срабатывания систем финмониторинга. Большинство таких сигналов оказываются ложными, что отнимает значительную часть рабочего времени. Максим Коцюба, старший инженер по данным с опытом работы в ВТБ и Сбере, в рамках выпускной работы в онлайн-магистратуре «Инженерия данных» НИУ ВШЭ и Нетологии разработал сквозной ML/MLOps-пайплайн, который не просто классифицирует операции, а ранжирует их по степени риска. Проект успешно прошёл экспериментальную проверку, а исходный код и MVP опубликованы на GitHub.
Актуальность задачи обусловлена масштабом проблемы. С 2010 по 2025 год объём операций по картам вырос в 23 раза — с 3,1 до 72,7 млрд, при этом число действующих кредитных организаций сократилось почти на 67% — с 1058 до 353. В пересчёте на одну организацию нагрузка увеличилась примерно в 70 раз — с 2,9 до 206 млн операций на субъект. Действующие rule-based системы, на которых обычно строится комплаенс-мониторинг, работают крайне неточно: более 90% их срабатываний оказываются ложными, и разбор этого потока пустых сигналов съедает большую часть рабочего времени аналитиков.
На этапе постановки задачи рассматривались различные варианты: существующие rule-based механизмы, готовые коммерческие AML-платформы (SAS AML, NICE Actimize) и разработка силами самого банка. У каждого подхода были свои ограничения. Rule-based системы требуют времени для адаптации к новым мошенническим схемам, коммерческие платформы остаются закрытыми системами, где сложно исследовать и изменять внутреннюю логику, а внутренняя разработка может упираться в ручной и неавтоматизированный процесс обучения моделей. Как отметил научный руководитель проекта, доцент ФКН НИУ ВШЭ Салех Хади Мухаммед, речь не о том, чтобы просто заменить rule-based систему ML-моделью, а о том, как организовать работу с ML-моделью после её появления — обучение, сравнение версий, развёртывание, мониторинг и повторное обучение. Кроме того, санкционные ограничения усиливают потребность в локально разворачиваемых решениях.
Изначально рассматривались два подхода: бинарная классификация и риск-ориентированное ранжирование. Систему с самого начала проектировали для риск-скоринга и предварительной приоритизации операций, поэтому в требования к результату сразу заложили интерпретируемость и список значимых признаков. Однако эксперименты показали, что при сильном дисбалансе классов (доля подозрительных операций в выборке датасета SAML-D составила всего 0,119%) метрики ранжирования, такие как Precision@k и Lift@k, оказались куда показательнее метрик классификации. Порог классификации 0,5 просто непригоден для эксплуатации: в реальности его должны определять допустимая нагрузка на аналитиков и требуемая полнота выявления. Ключевой вывод: модель полезнее всего не как инструмент окончательного решения, а как механизм риск-ориентированного ранжирования. Она формирует риск-скор, на основе которого операции упорядочиваются по степени потенциального риска, что позволяет формировать приоритетную очередь для дальнейшего анализа. Вместо бинарного ответа на выходе получается риск-очередь для аналитика, позволяющая в первую очередь работать с операциями, имеющими наиболее высокий оценочный риск. Особенно заметно это на датасете SAML-D. Если для топ-100 обе модели показали Precision@100 = 1,00, то для топ-500 показатели закономерно снижаются: Precision@500 у LightGBM составил 0,322, у XGBoost — 0,310. Чем шире очередь, которую разбирает аналитик, тем ниже в среднем концентрация реального риска в ней, что логично и ожидаемо.
Контур решения вписывается в процесс финансового мониторинга следующим образом. Аналитик смотрит на риск-скор и объяснение, почему модель посчитала операцию подозрительной. Дата-сайентист ставит эксперименты и обучает модели. MLOps-инженер разворачивает контур и следит за непрерывностью работы системы. В систему поступают данные из внутренних источников организации. Все они завязаны на самом контуре, который тянется через весь цикл: от загрузки данных до обновления и дообучения модели. Контур расставляет приоритеты и следит, чтобы модели можно было воспроизводимо поддерживать, а не обучить один раз и забыть, — что в банковской среде критично, учитывая, как быстро меняется картина мошенничества. Целью проекта было не исчерпывающее сравнение промышленных архитектур или выбор «лучшего» технологического стека, а проверка гипотезы о том, что можно построить воспроизводимый пайплайн, который повышает эффективность работы аналитиков.
Для российского рынка подобные разработки имеют особое значение. В условиях санкционных ограничений и ухода зарубежных поставщиков ПО возрастает потребность в локальных решениях, которые можно разворачивать внутри инфраструктуры банка и адаптировать под меняющиеся схемы мошенничества. Открытый исходный код проекта позволяет другим специалистам использовать наработки и развивать их. Реакция отрасли пока не выражена публично, но можно предположить интерес со стороны финансовых организаций, стремящихся снизить нагрузку на аналитиков и повысить точность выявления подозрительных операций. Альтернативные подходы, такие как коммерческие AML-платформы, остаются закрытыми и дорогостоящими, а rule-based системы требуют постоянной ручной настройки. Предложенный пайплайн предлагает баланс между гибкостью, прозрачностью и автоматизацией.
В перспективе развитие проекта может идти в направлении интеграции с существующими банковскими системами, расширения набора данных и улучшения интерпретируемости моделей. Открытыми остаются вопросы о том, как масштабировать решение на весь объём транзакций в реальном времени, как обеспечить соответствие регуляторным требованиям и как оценивать экономический эффект от внедрения. Тем не менее уже сейчас ясно, что переход от бинарной классификации к ранжированию по риску является важным шагом в совершенствовании финансового мониторинга. Проект демонстрирует, что даже при сильном дисбалансе классов можно построить эффективную систему поддержки принятия решений, которая помогает аналитикам сосредоточиться на наиболее подозрительных операциях.