ГЛАВНАЯ / ВНЕДРЕНИЕ ИИ / МЕТРИКИ

Почему высокой AUC недостаточно для клинического внедрения

«AUC модели составляет 0,91». Звучит как аргумент в пользу внедрения. Однако это ответ лишь на один вопрос: насколько хорошо алгоритм различает случаи с целевым исходом и без него. [1]

0,91AUC-ROC

Сама по себе AUC не позволяет сказать, сколько пациентов система пропустит при выбранном пороге, сколько произойдёт ложных срабатываний, соответствуют ли прогнозируемые риски наблюдаемым частотам и сохранится ли качество в другой клинике. Тем более AUC не показывает, как модель повлияет на решения врача, исходы лечения или работу отделения. [2][3][4]

Поэтому высокая AUC — важное, но только начальное свидетельство применимости модели. Между хорошей метрикой на тестовой выборке и полезным клиническим инструментом остаётся несколько вопросов.

Какие характеристики модели нужно проверить помимо AUC?

Короткий ответ для тех, кто читает отчёт о валидации:

  • Чувствительность и специфичность при рабочем пороге — сколько случаев модель пропустит и сколько ложных тревог создаст именно в том режиме, в котором её будут использовать.
  • PPV и NPV при ожидаемой распространённости — что означает конкретный сигнал для пациента в этом отделении, а не на сбалансированной выборке.
  • Калибровка — соответствуют ли прогнозируемые вероятности наблюдаемым частотам исхода.
  • Переносимость — результаты внешней валидации, проверка во времени и по клинически значимым подгруппам.
  • Клиническая польза — меняются ли решения, исходы и нагрузка по сравнению с текущей практикой.
  • План мониторинга после запуска — условия пересмотра порога, повторной валидации, обновления или остановки системы.

01Что именно измеряет AUC?

ROC-кривая показывает, как при изменении порога решения меняются чувствительность и доля ложноположительных результатов. Площадь под этой кривой — AUC-ROC — характеризует способность модели ранжировать пациентов. Её можно интерпретировать как вероятность того, что случай с исходом получит более высокий модельный балл, чем случай без исхода. [1]

В этом заключается отличительная черта метрики: она не привязана к одному порогу. Можно сравнить общую различающую способность моделей до того, как выбран рабочий режим.

Но это же является её ограничением. В клинической среде модель должна работать при конкретном пороге. Именно он превращает непрерывный риск в действие — например, показать предупреждение, назначить дополнительное обследование или ничего не делать. Две системы с одинаковой AUC могут давать разное число пропусков патологии и ложных срабатываний при выбранном рабочем пороге. [1][2]

AUC отвечает на вопрос: «Насколько хорошо модель различает случаи с исходом и без него?» Клиническое внедрение требует другого ответа: «Что произойдёт, когда прогноз модели начнут учитывать врачи при принятии решений?»
ROC-кривая с площадью AUCПо горизонтали показана доля ложноположительных результатов, по вертикали — чувствительность. Кривая проходит выше диагонали случайного классификатора; рабочий порог отмечен точкой. случайное ранжирование · AUC 0,50 Рабочий порогодна конкретная точка AUC = 0,91 0101 Доля ложноположительных результатов (1 − специфичность) →Чувствительность →
ROC-кривая суммирует работу модели при всех порогах. В клиническом процессе используется одна рабочая точка, и именно для неё нужно отдельно оценивать пропуски и ложные срабатывания.

02Первый вопрос: цена ошибок при рабочем пороге

После выбора порога можно рассчитать четыре результата: истинно положительные, истинно отрицательные, ложноположительные и ложноотрицательные. Из них рассчитывают метрики, связанные с реальными последствиями решения.

Матрица ошибок: истинно положительные, ложноотрицательные, ложноположительные и истинно отрицательные результаты
Каждая точка — результат для пациента. Соотношение показано условно: это схема, а не данные исследования.
ЧувствительностьTP / (TP + FN)Доля случаев с исходом, которые модель обнаружила. Она показывает риск пропустить пациента, которому требовалось внимание.
СпецифичностьTN / (TN + FP)Доля случаев без исхода, на которые модель не отреагировала. Она помогает оценить нагрузку при ложных срабатываниях.

Универсально «лучшего» соотношения нет. Требования зависят от назначения системы и последствий каждого типа ошибки. Для скрининга критичным может быть пропуск патологии; для решения, ведущего к рискованному вмешательству, особенно важны ложноположительные результаты. Поэтому порог следует обосновывать клиническим сценарием, а не выбирать только ради красивой метрики.

У рабочего режима есть свои риски: если система выдаёт слишком много предупреждений, врачам приходится тратить больше времени на проверку, а нагрузка от тревог возрастает. При внешней валидации широко внедрённой Epic Sepsis Model на 38 455 госпитализациях AUC составила 0,63, чувствительность — 33%, специфичность — 83%, а PPV — 12%. Система формировала предупреждения для 18% госпитализаций, но не выявляла 67% случаев сепсиса. [5] Этот пример показывает, почему общая метрика не заменяет оценку рабочего порога и последствий сигналов.

03Второй вопрос: что означает положительный сигнал?

Чувствительность и специфичность не дают врачу прямого ответа на вопрос: «Какова вероятность того или иного исхода у пациента?» Для этого нужны метрики прогностической ценности.

PPV, положительная прогностическая ценностьTP / (TP + FP)Доля истинных случаев среди всех положительных сигналов.
NPV, отрицательная прогностическая ценностьTN / (TN + FN)Доля пациентов без исхода среди всех отрицательных результатов.

PPV и NPV зависят от исходной вероятности события, в том числе от его распространённости в популяции применения. [6] Поэтому результат на искусственно сбалансированной выборке нельзя без проверки переносить в отделение, где целевое событие встречается редко. Даже модель с хорошей дискриминацией в таких условиях может выдавать много ложноположительных сигналов; для несбалансированных данных полезно дополнительно смотреть precision–recall-кривую. [7]

Практический вопрос к отчёту об AUC: каковы PPV и NPV при ожидаемой распространённости и при пороге, который планируется использовать?

Третий вопрос: можно ли верить прогнозируемой вероятности какого-то события?

Модель может правильно оценить, кому хуже, а кому лучше, но сильно ошибаться в самих цифрах. Она может всем поголовно завышать или занижать процент риска. Популярная метрика AUC эту ошибку не заметит.

Калибровочный график По горизонтали — прогнозируемый моделью риск, по вертикали — наблюдаемая частота исхода. Белые точки лежат на диагонали: прогнозы 10, 40 и 80 процентов совпадают с наблюдаемыми частотами. Зелёные точки смещены вправо от диагонали: при тех же наблюдаемых частотах 10, 40 и 80 процентов модель прогнозирует 40, 70 и 95 процентов. идеальная калибровка прогноз 40% — а исход только у 10% пациентов прогноз совпадает с наблюдением тот же порядок групп, но риск завышен 0% 50% 100% 0% 100% Прогнозируемый моделью риск → Наблюдаемая частота исхода →
Дискриминация в обоих случаях одинакова: порядок групп сохранён. Но зелёные точки лежат ниже диагонали — модель называет риск выше, чем он есть на самом деле.
  • Представьте три группы пациентов с возрастающим риском. В первом варианте модель прогнозирует 10%, 40% и 80%, и эти значения соответствуют наблюдаемым частотам. Во втором — 40%, 70% и 95%: порядок групп сохраняется, но риск систематически завышен. Дискриминация может остаться той же, хотя конкретным вероятностям во втором варианте доверять нельзя. [3]
  • За соответствие прогнозов наблюдаемым частотам отвечает калибровка. Если среди пациентов с прогнозом 10% исход происходит заметно чаще или реже, число нельзя буквально интерпретировать как риск — даже при высокой AUC. Это особенно важно, когда от вероятности зависит действие: направление, обследования или экстренная помощь.
  • Калибровку оценивают отдельно — прежде всего графически, а также с помощью калибровочного наклона и свободного члена; Brier score может использоваться как общая мера точности вероятностного прогноза, но не заменяет разбор калибровки. Для оценок нужны интервалы неопределённости. [3]

04Полезно держать в голове различие

ВопросМетрика
Кто выше по риску?Дискриминация, в том числе AUC-ROC
Сколько случаев пропущено при выбранном пороге?Чувствительность
У скольки пациентов без исхода модель не выдаст ложное срабатывание?Специфичность
Какова доля истинных случаев среди сигналов?PPV
Соответствует ли прогнозируемый риск наблюдаемой частоте?Калибровка

05Четвёртый вопрос: применимы ли настройки везде?

Внутренняя тестовая выборка показывает качество в условиях, близких к разработке. Она не доказывает переносимость на другую организацию, оборудование, период или популяцию.

Внешняя валидация проверяет зафиксированную модель на независимых данных, соответствующих предполагаемому применению. [8] Дополнительно нужна проверка во времени: меняются протоколы, способы регистрации данных, распространённость исходов и характеристики пациентов. Из-за такого сдвига может ухудшиться калибровка, дискриминация или обе характеристики. [4]

Среднее качество также способно скрыть неравномерность. Поэтому чувствительность, специфичность и калибровку оценивают по заранее обоснованным подгруппам — например, по возрасту, полу, сопутствующим состояниям и другим характеристикам, значимым для конкретного назначения. В исследовании алгоритмов для рентгенограмм грудной клетки, например, была выявлена более высокая частота недодиагностики в отдельных недостаточно обслуживаемых и пересекающихся подгруппах пациентов. [9] Высокая общая AUC не компенсирует систематически худшую работу для части целевой популяции.

Таким образом, перед внедрением стоит спросить:

  1. Независима ли тестовая выборка от разработки?
  2. Представляет ли она популяцию в данной клинике?
  3. Приведены ли метрики с интервалами неопределённости?
  4. Показаны ли ошибки и калибровка в клинически значимых подгруппах?
  5. Проверена ли модель на потоке данных, хотя бы в «тихом» режиме без влияния на решения?

06Пятый вопрос: приносит ли модель пользу врачу?

Даже технически сильный прогноз может ничего не менять. Если сигнал не ведёт к доступному и обоснованному действию, приходит слишком поздно или дублирует более простой процесс, высокая AUC сама по себе не создаёт ценности.

Клиническая польза требует сравнения не только с отсутствием инструмента, но и с текущей практикой. Нужно выяснить:

  • меняется ли решение специалиста;
  • есть ли чистая польза с учётом последствий истинных и ложных сигналов;
  • как система влияет на нагрузку, сроки и маршрут пациента;
  • превосходит ли её применение стратегии «действовать для всех» и «не действовать ни для кого» в релевантном диапазоне порогов;
  • улучшаются ли заявленные клинические или организационные исходы.

Для сопоставления пользы и вреда решений при разных порогах может использоваться анализ кривых решений — decision curve analysis. Он оценивает чистую пользу модели в диапазоне пороговых вероятностей и сравнивает её со стратегиями «действовать для всех» и «не действовать ни для кого». [10] Проспективная оценка помогает проверить поток данных, своевременность, взаимодействие с пользователем и сбои. Если заявляется влияние на решения, исходы или использование ресурсов, нужны сравнительные исследования, соответствующие именно этому утверждению. [4][11]

07Внедрение — ещё не финал оценки

После запуска меняются входные данные, частота исходов, клиническая практика и поведение пользователей. Поэтому план мониторинга нужен до внедрения, а не после первого инцидента. Международный консенсус FUTURE-AI рекомендует предусматривать контроль качества входов и выходов, постоянный мониторинг, периодические аудиты и механизмы выявления сдвига данных. [12]

Следить необходимо не только за AUC, но и за калибровкой, чувствительностью и специфичностью при рабочем пороге, PPV, частотой предупреждений, качеством по подгруппам, пропусками данных, задержками, отменами рекомендаций и нежелательными последствиями. При этом важно заранее определить условия пересмотра порога, повторной валидации, обновления или остановки системы.

Итоговая логика проста — каждый шаг цепочки относится к модели:

Модель различает случаи с исходом и без него → даёт интерпретируемую вероятность риска → работает при выбранном пороге → переносится в целевую среду → помогает в реальном клиническом процессе → остаётся надёжной со временем.

Высокая AUC закрывает только первый пункт этой цепочки.

Интерактив

Готовы ли метрики к клиническому решению?

Выберите по одному ответу в каждом вопросе. После проверки вы увидите не только балл, но и свой профиль оценки: на какой части доказательств вы обычно фокусируетесь и что рискуете упустить.

1. Модель имеет AUC 0,94. Что можно утверждать без дополнительных данных?
2. В вашем отделении такое заболевание встречается редко. Какой показатель особенно поможет понять, какая доля положительного срабатывания модели окажется правильной?
3. Среди пациентов с прогнозом риска 10% модель детектирует исход примерно в 40% случаев. Какое свойство требует внимания?
4. Общая AUC высока, но чувствительность заметно различается между значимыми группами пациентов. Какой следующий шаг обоснован?
5. Что лучше всего проверяет, создаёт ли модель ценность в конкретном клиническом процессе?


Источники

  1. Mandrekar JN. Receiver operating characteristic curve in diagnostic test assessment. Journal of Thoracic Oncology. 2010;5(9):1315–1316. doi:10.1097/JTO.0b013e3181ec173d.
  2. Foroutan F, Weiss J, Mayer M, et al. Discriminating clinical prediction models: how outcome incidence and decision thresholds shape clinical utility and apt AUROC values. Journal of Clinical Epidemiology. 2026;195:112293. doi:10.1016/j.jclinepi.2026.112293.
  3. Van Calster B, McLernon DJ, van Smeden M, Wynants L, Steyerberg EW. Calibration: the Achilles heel of predictive analytics. BMC Medicine. 2019;17:230. doi:10.1186/s12916-019-1466-7.
  4. Vasey B, Nagendran M, Campbell B, et al. Reporting guideline for the early-stage clinical evaluation of decision support systems driven by artificial intelligence: DECIDE-AI. Nature Medicine. 2022;28:924–933. doi:10.1038/s41591-022-01772-9.
  5. Wong A, Otles E, Donnelly JP, et al. External validation of a widely implemented proprietary sepsis prediction model in hospitalized patients. JAMA Internal Medicine. 2021;181(8):1065–1070. doi:10.1001/jamainternmed.2021.2626.
  6. Monaghan TF, Rahman SN, Agudelo CW, et al. Foundational statistical principles in medical research: sensitivity, specificity, positive predictive value, and negative predictive value. Medicina. 2021;57(5):503. doi:10.3390/medicina57050503.
  7. Saito T, Rehmsmeier M. The precision-recall plot is more informative than the ROC plot when evaluating binary classifiers on imbalanced datasets. PLOS ONE. 2015;10(3):e0118432. doi:10.1371/journal.pone.0118432.
  8. Steyerberg EW, Harrell FE Jr. Prediction models need appropriate internal, internal-external, and external validation. Journal of Clinical Epidemiology. 2016;69:245–247. doi:10.1016/j.jclinepi.2015.04.005.
  9. Seyyed-Kalantari L, Zhang H, McDermott MBA, Chen IY, Ghassemi M. Underdiagnosis bias of artificial intelligence algorithms applied to chest radiographs in under-served patient populations. Nature Medicine. 2021;27:2176–2182. doi:10.1038/s41591-021-01595-0.
  10. Vickers AJ, Elkin EB. Decision curve analysis: a novel method for evaluating prediction models. Medical Decision Making. 2006;26(6):565–574. doi:10.1177/0272989X06295361.
  11. Nagendran M, Chen Y, Lovejoy CA, et al. Artificial intelligence versus clinicians: systematic review of design, reporting standards, and claims of deep learning studies. BMJ. 2020;368:m689. doi:10.1136/bmj.m689.
  12. Lekadir K, Frangi AF, Porras AR, et al.; FUTURE-AI Consortium. FUTURE-AI: international consensus guideline for trustworthy and deployable artificial intelligence in healthcare. BMJ. 2025;388:e081554. doi:10.1136/bmj-2024-081554.