Медицинский ИИ дал огромный массив опубликованных результатов, показывающих эффективность на уровне врачей или выше в конкретных задачах. Многие из этих результатов реальны.
Практика внедрения выглядит куда неоднороднее, и причины этому устойчивы и предсказуемы заранее. Кадры, которые их понимают, ловят проблемы до того, как система доходит до пациента.
Разрыв между статьёй и палатой
Заявленная цифра точности описывает эффективность на конкретном датасете, собранном определённым образом, оценённом относительно конкретного эталонного стандарта.
Клиническая эффективность — это то, что происходит, когда система встречает неотобранную популяцию, другое оборудование, другую практику и врачей, которые реагируют на её результат так, как оценка не предусматривала.
Модель не ошибалась в статье. Она отвечала на вопрос о датасете, а больница задаёт совсем другой вопрос.
Давление спроса реально: согласно Future of Jobs Report 2025 Всемирного экономического форума, 92% работодателей в сфере медицинских и здравоохранительных услуг считают, что значимость навыков в ИИ и больших данных для их кадров растёт. Риск в том, что нанимают компетенцию в построении моделей, а не в их оценке.
Что входит в направление
Охват: ИИ в радиологии и патоморфологии, поддержка клинических решений, анализ изображений и валидация.
Слово «валидация» в этом списке несёт самую большую нагрузку, и это та часть, которую чаще всего недофинансируют.
Четыре компетенции.
Медицинская визуализация и её физика. Что такое изображение на самом деле, как параметры получения снимка на него влияют и почему изображения с разного оборудования различаются так, что человек этого не видит, а модель — прекрасно видит.
Разработка моделей для клинических данных. Включая специфические проблемы: качество разметки, дисбаланс классов, утечка данных особыми для клинических датасетов способами.
Клиническая валидация. Дизайн исследования для оценки клинической системы ИИ — это эпидемиология, а не машинное обучение.
Внедрение и мониторинг. Интеграция в рабочий процесс, непрерывный мониторинг эффективности и понимание того, что делать, когда эффективность начинает «уплывать».
Сдвиг распределения простыми словами
Центральная техническая проблема без жаргона.
Модель учится на данных, на которых её обучали. Эти данные пришли из конкретных больниц, с конкретного оборудования, от конкретных популяций и в рамках конкретной клинической практики.
При развёртывании в другом месте сразу несколько вещей оказываются другими.
Другая популяция. Другое возрастное распределение, другая распространённость заболевания, другие сопутствующие болезни. Одна только распространённость меняет прогностическую ценность любого результата — это тот самый вопрос базовой частоты из направления эпидемиологии, и здесь он проявляется в полную силу.
Другое оборудование. Разные сканеры, протоколы и настройки систематически дают разные изображения. Известно, что модели цепляются за характеристики оборудования, а не за саму патологию, — такая модель может выглядеть отлично на валидации и полностью провалиться на другом аппарате.
Другая практика. Кого обследуют, когда и как устанавливали эталонный стандарт — всё это различается между учреждениями.
Проходит время. Практика меняется, оборудование заменяют, популяция сдвигается. Модель, которая была точной на момент развёртывания, может деградировать без того, чтобы кто-то что-то менял, — поэтому мониторинг это постоянное кадровое требование, а не разовая проектная задача.
Кадровый вывод: и локальная валидация до внедрения, и непрерывный мониторинг после него необходимы, и оба требуют людей. Организация, которая покупает систему, не закладывая бюджет ни на то, ни на другое, купила клиническое вмешательство без контроля.
Место направления в домене
«Медицинский ИИ, визуализация и диагностика» — восьмое из десяти направлений в домене Medicine and Healthtech Astra Trainer. Оно опирается на общественное здравоохранение и эпидемиологию — за методологией валидации, на медицинскую информатику — за слоем данных, на патофизиологию — за клинической правдоподобностью, и на медицинские изделия — за регуляторной рамкой, поскольку клинический ИИ часто регулируют как медицинское изделие.
Для партнёров, комплектующих это направление с технической стороны, домен AI, Data and Computing покрывает искусственный интеллект и машинное обучение, науку о данных и аналитику, а также кибербезопасность. Реально работающая комбинация — это техническая компетенция плюс компетенция в клинической валидации, а у компаний обычно уже есть только первая. Посмотреть все десять направлений можно здесь.
Ретроспективное — не то же самое, что проспективное
Различие, которое решает, значат ли что-то вообще доказательства, — и его регулярно смазывают в маркетинговых заявлениях.
Ретроспективная оценка прогоняет модель на исторических данных, где исходы уже известны. Она дешёвая, быстрая и необходимая, и она систематически завышает реальную эффективность. Датасет отобран вручную, случаи низкого качества часто исключены, и модель может эксплуатировать закономерности, которые существуют только из-за того, как собирали данные.
Проспективная оценка прогоняет модель на пациентах по мере их поступления, а эффективность оценивают по тому, что реально произошло потом. Медленнее, дороже и гораздо информативнее.
Оценка клинического эффекта задаёт по-настоящему важный вопрос: меняет ли использование этой системы то, что происходит с пациентами. Модель может быть точной и ничего не менять — потому что врачи и так уже это знали, или потому что находка не меняет тактику лечения, или потому что рабочий процесс на неё не реагирует.
Каждый следующий шаг — более высокая планка, и каждый встречается значительно реже предыдущего. Команда, которая не может сформулировать, на каком из этих уровней стоит то или иное доказательство, не может оценить решение о закупке.
Что означает разрешение регулятора — и чего не означает
Регуляторное разрешение или одобрение означает, что устройство выполнило требования определённого пути одобрения в конкретной юрисдикции, на основании представленных доказательств, для заявленного назначения.
Оно автоматически не означает, что система улучшает исходы у пациентов, что она будет работать так, как заявлено, в вашей популяции, или что её сравнивали с текущей практикой.
Это не критика регуляторов. Регуляторные пути созданы для того, чтобы установить определённые стандарты, и разные пути требуют разного уровня доказательств. Это предупреждение о том, как разрешение используют в продажах, — где его часто подают так, будто оно закрыло клинический вопрос.
Компании нужен человек, способный прочитать, что реально покрывает разрешение, включая заявленное назначение, и сопоставить это с предлагаемым применением. Это отдельная и дефицитная компетенция.
Человек в контуре, который сам по себе не решение
Стандартное заверение звучит так: результат проверяет врач, поэтому ошибки будут пойманы.
На практике это слабее, чем звучит, — по причинам, хорошо задокументированным в исследованиях человеческого фактора.
Автоматизационное искажение. Люди склонны доверять уверенным автоматическим рекомендациям — даже когда те ошибаются, и даже когда человек сам, без помощи, принял бы правильное решение.
Деквалификация. Навык, который не используют, слабеет. Врач, который долго не оценивал случаи самостоятельно, — более слабая проверка, чем был раньше.
Объём побеждает проверку. Там, где ценность системы именно в обработке большего объёма, чем способен человек, настоящая независимая проверка каждого результата невозможна по самой конструкции процесса.
Ответственность становится размытой. Если система обычно права, а отвечает врач, то врач несёт риск за систему, которую не может проинспектировать. Это управленческая проблема, которую нужно решить до внедрения, а не после инцидента.
Контроль со стороны человека необходим, но недостаточен, а чтобы спроектировать его так, чтобы он реально работал, нужна компетенция в человеческом факторе — прямая связь с темой удобства использования в направлении медицинских изделий.
Роли по именам
Учёные по валидации клинического ИИ. Самая дефицитная и самая важная роль здесь, и её почти не существует как названия должности.
Специалисты и физики медицинской визуализации. Понимают процесс получения снимка и то, из-за чего изображения различаются.
Специалисты по клиническим данным со специфичной для медицины методологической подготовкой.
Ответственные за клиническую безопасность систем ИИ.
Специалисты по регуляторике программного обеспечения и изделий на основе ИИ.
Специалисты по внедрению и рабочим процессам, потому что именно интеграция решает, изменится ли хоть что-то.
Аналитики мониторинга и эффективности после внедрения — постоянная функция.
Кого можно обучить для этих ролей
Рентгенолаборанты и технологи визуализации. Недооценённый и хорошо подготовленный резерв. Они понимают получение снимков, артефакты и практическую реальность визуализации, и добавление методологии валидации даёт ровно ту компетенцию, которой не хватает.
Медицинские физики. Уже обладают количественной экспертизой и экспертизой в визуализации.
Специалисты по данным в здравоохранении. Им нужна эпидемиологическая методология и клиническая база, а не ещё больше техник моделирования.
Врачи с интересом к аналитике. Уже обладают чутьём на правдоподобность, которое ловит проблемы, невидимые ни одной метрике.
Клинические специалисты в патоморфологии и лабораторной медицине — по мере роста цифровой патоморфологии.
Специалисты по качеству и регуляторике, расширяющие компетенцию на программное обеспечение и изделия на основе ИИ.
Регулирование и ответственность. Клинические системы ИИ часто регулируют как медицинские изделия — с обязательствами, описанными в направлении медицинских изделий, а в ряде юрисдикций их клиническое внедрение требует формальной оценки клинической безопасности. Клиническая ответственность за решения остаётся за зарегистрированными специалистами. Обучение формирует компетенцию в валидации и оценке. Оно не даёт регуляторного одобрения, квалификации по клинической безопасности или права внедрять систему, и ни один результат модели не следует воспринимать как клиническую рекомендацию.
Что важно вынести
Заявленная точность и клиническая эффективность — разные величины, и этот разрыв предсказуем, а не загадочен.
Сдвиг распределения по популяции, оборудованию, практике и времени — центральная проблема, из-за которой локальная валидация и непрерывный мониторинг становятся постоянными кадровыми требованиями.
Ретроспективные, проспективные доказательства и доказательства клинического эффекта — три разные планки, и большинство заявлений опираются только на первую.
Разрешение означает, что выполнен определённый путь одобрения для заявленного назначения. Это не доказательство пользы для пациента, хотя его часто подают именно так.
А контроль со стороны человека необходим, но недостаточен, потому что автоматизационное искажение и объём подрывают его самой конструкцией процесса.
Почему системы медицинского ИИ теряют эффективность после внедрения?
Сдвиг распределения. Модель выучивает популяцию, оборудование, практику и эталонные стандарты, на которых её обучали, — а в другом месте все четыре фактора отличаются. Одна только распространённость меняет прогностическую ценность любого результата.
Означает ли регуляторное разрешение, что система работает?
Оно означает, что выполнен определённый путь одобрения на основании представленных доказательств для заявленного назначения. Это не равносильно доказательствам улучшения исходов у пациентов в вашей популяции.
Достаточно ли проверки человеком в качестве гарантии?
Нет. Автоматизационное искажение заставляет людей доверять уверенным системам, неиспользуемые навыки деградируют, а там, где ценность системы именно в объёме, настоящая независимая проверка каждого результата невозможна по самой конструкции процесса.
Кого стоит этому обучать?
Рентгенолаборантов и технологов визуализации — они недооценённый и хорошо подготовленный резерв, понимающий получение снимков и артефакты. Специалистов по данным в здравоохранении — им нужна эпидемиологическая методология, а не ещё больше техник моделирования.
Какое место это направление занимает в домене?
Восьмое из десяти направлений в домене Medicine and Healthtech Astra Trainer, опирающееся на эпидемиологию — за методом валидации — и медицинские изделия — за регуляторной рамкой. Посмотреть все направления можно здесь.
