Медицинский ИИ против врачей: новый фреймворк для честного сравнения
Исследователи из AIRI и Центра Алмазова разработали фреймворк для объективной оценки диагностических способностей языковых моделей. Они опубликовали статью в Scientific Reports, где сравнили ответы ИИ и живых терапевтов в условиях, приближенных к реальной практике.
Команда лаборатории «Сильный ИИ в медицине» AIRI под руководством Ильи Копаничука совместно с коллегами из ФГБУ «НМИЦ им. В. А. Алмазова» Минздрава России представила фреймворк для оценки качества медицинской диагностики, выполняемой большими языковыми моделями (LLM). Результаты исследования опубликованы в журнале Scientific Reports. Основная цель работы — ответить на вопрос, действительно ли ИИ способен ставить диагнозы точнее врачей, и предложить методологию, которая позволяет проводить такие сравнения корректно.
Авторы отмечают, что большинство существующих тестов для медицинских ИИ-моделей далеки от реальной клинической практики. Часто модели проверяют на задачах с выбором одного из готовых вариантов ответа, тогда как в настоящем приёме врач формулирует диагноз в свободной форме. Кроме того, для оценки точности ИИ обычно используют голосование экспертов, что создаёт иллюзию «усреднённого врача» и не позволяет измерить согласованность внутри группы специалистов. Чтобы устранить эти недостатки, исследователи создали собственный датасет из 360 текстовых диалогов: 180 записей взаимодействия «живой врач — пациент» и 180 — «ИИ-врач — пациент». Каждый диалог имитирует терапевтический приём, в ходе которого собирается анамнез. Семь врачей-терапевтов из Центра Алмазова независимо друг от друга выписали до трёх диагнозов для каждого случая, и те же диалоги были предложены нескольким современным языковым моделям, включая DeepSeek-V3, GigaChat-Max, GPT-4o, Mistral-Large, Llama-405B и Qwen-72B. Модели также должны были сформулировать до трёх диагнозов в свободной форме.
Ключевая техническая проблема заключалась в сравнении свободных текстовых диагнозов. Формулировки вроде «острый панкреатит» и «хронический панкреатит, обострение» могут обозначать одно и то же состояние, но различаться лексически. Чтобы решить эту задачу, исследователи обучили специальную мета-модель на 6500 парах диагнозов, размеченных тремя экспертами на предмет совпадения или несовпадения. В мета-модель вошли прямые запросы к LLM с инструкцией сравнить диагнозы, RAG-система с индексом из 10 000 записей МКБ-10, векторные эмбеддинги от трёх разных моделей и набор лингвистических метрик, включая нормализованное расстояние Левенштейна. На тестовой выборке из почти 1500 пар точность достигла 98%, а коэффициент каппа Коэна составил 0,91. Затем пайплайн был дистиллирован с помощью ModernBert, что снизило точность всего на 3 процентных пункта — до 0,88, чего достаточно для практических целей. Более того, вероятность, выдаваемая классификатором, хорошо описывает степень сходства между диагнозами, что уже используется в новом проекте.
Контекст исследования связан с растущим числом громких заявлений о превосходстве ИИ в медицине. В новостях часто появляются заголовки вроде «ChatGPT поставил диагноз с точностью 90%», однако, как отмечает Копаничук, такие результаты получаются в упрощённых условиях, далёких от реального приёма. Например, модель может выбирать из небольшого списка готовых диагнозов, а не формулировать собственное заключение. Кроме того, мнения врачей-экспертов часто сильно расходятся, и итоговый диагноз принимается голосованием, что не позволяет оценить согласованность внутри консилиума. Предложенный фреймворк устраняет эти недостатки, приближая оценку к реальной практике. Ранее группа Воронцова уже предлагала методы оценки моделей по несогласованным разметкам, и новая работа развивает эту идею применительно к медицине.
Для российского рынка здравоохранения и ИИ-разработок данное исследование имеет особое значение. Оно предлагает отечественным разработчикам медицинских ассистентов инструмент для объективного тестирования своих моделей, что может ускорить внедрение качественных ИИ-решений в клиническую практику. Кроме того, в работе участвовали российские модели, такие как GigaChat-Max, что демонстрирует их конкурентоспособность наряду с зарубежными аналогами. Реакция отрасли пока сдержанная, но публикация в Scientific Reports привлекает внимание международного научного сообщества. В условиях, когда регуляторы всё внимательнее относятся к медицинскому ИИ, наличие прозрачных и воспроизводимых методик оценки становится критически важным. Фреймворк может стать основой для будущих стандартов сертификации ИИ-диагностики в России и за рубежом.
По сравнению с альтернативными подходами, предлагаемый метод имеет ряд преимуществ. Традиционные бенчмарки, такие как MedQA или PubMedQA, основаны на вопросах с множественным выбором и не учитывают свободные формулировки. Другие исследователи пытались использовать голосование экспертов, но это не даёт количественной оценки согласия. Фреймворк AIRI и Центра Алмазова позволяет сравнивать ответы модели с ответами каждого конкретного врача, а не с неким усреднённым эталоном. Это даёт более тонкую картину: можно увидеть, насколько модель близка к мнению отдельных специалистов, и в каких случаях она ошибается. Кроме того, мета-модель для сравнения диагнозов может быть адаптирована для других языков и медицинских специальностей, что делает подход универсальным.
В перспективе авторы планируют развивать фреймворк и применять его для оценки новых моделей, а также для анализа клинических случаев. Открытым остаётся вопрос, насколько результаты, полученные на текстовых диалогах, переносятся на реальные условия с учётом мультимодальных данных (анализы, изображения). Также предстоит выяснить, как влияет на качество диагностики использование разных языков и культурных контекстов. Тем не менее уже сейчас ясно, что предложенный подход задаёт новую планку для тестирования медицинского ИИ. Ответ на вопрос, точнее ли ИИ врачей, не может быть однозначным: в одних случаях модель демонстрирует высокую точность, в других — уступает специалистам. Но главное — теперь есть инструмент, позволяющий получать достоверные ответы.