Перейти к содержанию
вторник, 28 июля 2026 г.

ИИ Вестник

Главные новости о развитии искусственного интеллекта в России

Точность 99,2% без единой находки: почему метрики в медицинском ИИ обманчивы

Frustrated radiologist examining a normal mammogram, confused by misleading AI metrics.
Generated by Sourceful Riverflow (RouterAI)

Разговор о компьютерном зрении в медицине часто начинается с требования «точность 98–99%». Однако простая модель, всегда выдающая «норму», достигает 99,2% accuracy, не находя ни одной опухоли. Статья разбирает, почему традиционные метрики неприменимы к скринингу и как правильно оценивать эффективность ИИ-систем.

Собеседник, предлагающий внедрить компьютерное зрение для поиска рака, обычно исходит из логики промышленной дефектоскопии: «там деталь и дефект, тут снимок и опухоль — разница лишь в датасете». Архитектурно разница действительно невелика, обе задачи решаются семейством детекторов аномалий. Проблема начинается, когда звучит слово «точность». В шведском исследовании MASAI, опубликованном The Lancet в январе 2026 года, участвовали 105 934 женщины. В группе с ИИ-поддержкой (53 043 участницы) рак молочной железы выявлен у 420, то есть распространённость составила 0,79%. Модель, которая на любой вход возвращает «норма», покажет на этой выборке точность 99,21%, что формально удовлетворяет требованию «98–99%», но не обнаружит ни одной опухоли. Этот парадокс иллюстрирует, почему accuracy на несбалансированных данных — метрика-ловушка, а настоящий разговор о медицинском ИИ начинается с другого набора показателей.

Правильные метрики для скрининга — чувствительность (доля выявленных больных) и специфичность (доля здоровых, не получивших ложный вызов). Промах по чувствительности означает, что пациент уходит домой с нормальным заключением, возвращаясь через два года с четвёртой стадией. Ложный вызов (низкая специфичность) влечёт дообследование, биопсию, три недели ожидания гистологии — не дешёвый, но менее критичный исход. Результаты MASAI: специфичность группы с ИИ составила 98,5% — ровно та цифра, которую часто просят заказчики. Однако за этим скрывается, что из примерно 52 600 здоровых женщин 790 (1,5%) были вызваны зря. Раков на скрининге нашли 338. Таким образом, из 1130 вызовов оправданными оказались только 338, то есть положительная прогностическая ценность (PPV) — 30%. Другими словами, на каждую найденную опухоль приходится более двух здоровых, направленных на инвазивную диагностику. Немецкое исследование PRAIM (463 094 женщины, Nature Medicine) показало PPV 17,9% в группе с ИИ против 14,9% в контроле. PRAIM также продемонстрировал рост выявляемости с 5,7 до 6,7 случая на 1000 без роста числа отзывов — для реальной программы это отличный результат.

Самое неинтуитивное свойство PPV — его сильная зависимость от распространённости болезни, а не только от модели. Перенесите одну и ту же сеть со скрининга здоровых на поток симптомных пациентов — PPV изменится в разы без изменения весов. Цена улучшения PPV высока: чтобы поднять его с 30% до 86%, специфичность должна вырасти с 98,5% до 99,9%. В абсолютных числах это падение ложных срабатываний с 790 до полусотни, то есть в 15 раз. Подкрутить порогом не выйдет: увеличение порога снижает чувствительность, и модель начинает пропускать опухоли. В MASAI это проявляется ростом интервальных раков (выявленных между скринингами): 1,55 против 1,76 на 1000. Поэтому формулировка целевых метрик должна звучать как «специфичность не ниже X при чувствительности не ниже Y на потоке с распространённостью Z». Если в техзадании написано «точность 99%», метрики не считал никто. В промышленном компьютерном зрении распространённость дефекта на потоке достигает 5–20%, там PPV ведёт себя мирно, но медицина ломает эту привычку на первом же расчёте.

Несмотря на когнитивные ловушки метрик, медицинское компьютерное зрение активно развивается. По данным FDA, к концу марта 2026 года в публичном списке медизделий с ИИ числится 1524 записи, из них 1164 радиологические (76%). В первом квартале 2026 года из 92 новых авторизаций 69 пришлись на радиологию. Картинка остаётся самой массовой ИИ-задачей в медицине с огромным отрывом от других направлений. В России на июнь 2026 года зарегистрировано 57 медизделий с ИИ, как прозвучало на форуме НОВАМЕД-2026: 41 изделие из реестра отечественного ПО, 11 вне его, 5 иностранных. Разница с американским списком в 25 раз объясняется размером рынка, стоимостью регистрации и тем, кто в итоге платит, а вовсе не уровнем российских инженеров.

Отдельного внимания заслуживает московский эксперимент по компьютерному зрению в лучевой диагностике, запущенный в 2020 году. По словам мэра Собянина от 18 мая 2026 года, за шесть лет через него прошло порядка 200 ИИ-сервисов. Однако разрыв между обещанием «найти всё» и реальностью 30% PPV остаётся значительным. Конкуренты на мировом рынке уже учитывают эту статистику: в протоколы скрининговых исследований всё чаще включают не только чувствительность и специфичность, но и PPV в зависимости от популяции. Для российских разработчиков это означает необходимость перехода от маркетинга «точность 99%» к прозрачному указанию метрик на реальных потоках, что повысит доверие врачей и регуляторов.

Перспективы медицинского компьютерного зрения связаны с осознанием того, что главная сложность — не в архитектуре нейросети, а в корректной постановке задачи и измерении результатов. Открытые вопросы включают стандартизацию метрик для разного типа скринингов (молочная железа, лёгкие, шейка матки), а также методы уменьшения ложных вызовов без потери чувствительности. Вероятно, будущее за комбинированными подходами, где ИИ работает в паре с человеком, а пороги пересматриваются по мере накопления данных. Пока же любой проект по медицинскому CV начинается с того, что заказчику показывают: модель-константа с accuracy 99,2% — худший возможный вариант, а настоящая польза требует жертв в виде пересмотра метрик и стоимости внедрения.

Читайте также