Astra Trainer
Indústrias do futuro

IA Médica Não Falha na Acurácia. Falha na Validação

Aleksandr Mikhailov
Founder, Astra Trainer
Atualizado em
10 min de leitura

A IA médica produziu um grande volume de resultados publicados mostrando desempenho comparável ou superior ao de clínicos em tarefas específicas. Muitos desses resultados são reais.

O histórico de implantação é mais misto, e os motivos são consistentes e previsíveis. Uma equipe que os entende pega problemas antes de um sistema chegar a um paciente.

A lacuna entre o artigo e a enfermaria

Um número de acurácia relatado descreve o desempenho em um conjunto de dados específico, montado de um jeito específico, avaliado contra um padrão de referência específico.

Desempenho clínico é o que acontece quando o sistema encontra uma população não selecionada, equipamentos diferentes, prática diferente, e clínicos que reagem à saída dele de formas que a avaliação não modelou.

O modelo não estava errado no artigo. Ele estava respondendo a uma pergunta sobre um conjunto de dados, e o hospital está fazendo uma pergunta diferente.

A pressão de demanda é real: o relatório Future of Jobs Report 2025 do Fórum Econômico Mundial mostrou que 92% dos empregadores em serviços médicos e de saúde dizem que habilidades em IA e big data estão ganhando importância para a força de trabalho deles. O risco é que a capacidade contratada seja construção de modelo, não avaliação de modelo.

O que a trilha cobre

O escopo: IA em radiologia e patologia, apoio à decisão clínica, análise de imagem e validação.

A palavra validação é a que faz mais trabalho nessa lista, e é a parte mais frequentemente subdimensionada.

Quatro capacidades.

Imagem médica e sua física. O que uma imagem de fato é, como os parâmetros de aquisição a afetam, e por que imagens de equipamentos diferentes diferem de formas invisíveis para um leitor humano e altamente visíveis para um modelo.

Desenvolvimento de modelo para dados clínicos. Incluindo os problemas específicos: qualidade dos rótulos, desbalanceamento de classes, vazamento de dados de formas particulares aos conjuntos de dados clínicos.

Validação clínica. Design de estudo para avaliar um sistema clínico de IA, que é epidemiologia, não aprendizado de máquina.

Implantação e monitoramento. Integração ao fluxo de trabalho, monitoramento contínuo de desempenho, e saber o que fazer quando o desempenho se desvia.

Mudança de distribuição, em termos simples

O problema técnico central, dito sem jargão.

Um modelo aprende com os dados em que foi treinado. Esses dados vieram de hospitais específicos, equipamentos específicos, populações específicas e práticas clínicas específicas.

Implantado em outro lugar, várias coisas diferem ao mesmo tempo.

A população difere. Distribuição etária diferente, prevalência de doença diferente, comorbidade diferente. Só a prevalência já muda o valor preditivo de qualquer saída, o ponto sobre prevalência da trilha de epidemiologia, e se aplica aqui com força total.

O equipamento difere. Aparelhos, protocolos e configurações diferentes produzem imagens sistematicamente diferentes. Sabe-se que modelos captam características do equipamento em vez da patologia, e um modelo assim pode parecer excelente na validação e falhar completamente em outra máquina.

A prática difere. Quem é testado, quando, e como o padrão de referência foi estabelecido variam entre instituições.

O tempo passa. A prática muda, o equipamento é trocado, as populações mudam. Um modelo que era preciso na implantação pode degradar sem que ninguém mude nada, e é por isso que o monitoramento é uma exigência permanente de equipe, não uma tarefa de projeto.

A implicação para a força de trabalho: validação local antes da implantação e monitoramento contínuo depois dela são ambos necessários, e ambos precisam de gente. Empresas que compram um sistema sem orçar nenhum dos dois compraram uma intervenção clínica sem monitoramento.

Onde isso se encaixa no domínio

IA médica, imagem e diagnóstico é a oitava de dez trilhas no domínio de medicina e healthtech da Astra Trainer. Depende de saúde pública e epidemiologia para a metodologia de validação, de informática em saúde para a camada de dados, de fisiopatologia para a plausibilidade clínica, e de dispositivos médicos para a estrutura regulatória, já que a IA clínica costuma ser regulada como dispositivo.

Para parceiros que preenchem isso pelo lado técnico, o domínio de IA, dados e computação cobre inteligência artificial e aprendizado de máquina, ciência de dados e analytics, e cibersegurança. A combinação que de fato funciona é capacidade técnica somada a capacidade de validação clínica, e as empresas costumam já ter a primeira. Você pode ver as dez trilhas aqui.

Retrospectivo não é prospectivo

Uma distinção que decide se a evidência significa alguma coisa, e é rotineiramente borrada em afirmações comerciais.

A avaliação retrospectiva roda um modelo em dados históricos cujos desfechos já são conhecidos. É barata, rápida e necessária, e superestima sistematicamente o desempenho no mundo real. O conjunto de dados foi selecionado, casos de baixa qualidade muitas vezes foram excluídos, e o modelo pode explorar padrões que só existem por causa de como os dados foram montados.

A avaliação prospectiva roda o modelo em pacientes conforme eles se apresentam, com o desempenho avaliado contra o que de fato aconteceu depois. Mais lenta, mais cara e muito mais informativa.

A avaliação de impacto clínico faz a pergunta que importa: usar esse sistema muda o que acontece com os pacientes. Um modelo pode ser preciso e não mudar nada, porque os clínicos já sabiam, ou porque o achado não altera a conduta, ou porque o fluxo de trabalho não age sobre ele.

Cada etapa é uma barra mais alta, e cada uma é consideravelmente menos comum do que a anterior. Uma equipe que não consegue dizer em qual delas uma afirmação de evidência se apoia não consegue avaliar uma decisão de compra.

O que a aprovação significa e o que não significa

A aprovação regulatória significa que um dispositivo atendeu às exigências de uma via definida em uma jurisdição específica, com base na evidência submetida, para um propósito declarado.

Não significa automaticamente que o sistema melhora desfechos de pacientes, que vai performar como descrito na sua população, ou que foi comparado contra a prática atual.

Isto não é uma crítica aos reguladores. As vias regulatórias são projetadas para estabelecer padrões definidos, e vias diferentes exigem níveis diferentes de evidência. É um alerta sobre como a aprovação é usada em conversas de venda, onde é frequentemente apresentada como se tivesse resolvido a questão clínica.

Uma empresa precisa de alguém capaz de ler o que uma aprovação de fato cobre, incluindo o propósito declarado, e comparar isso com o uso que está sendo proposto. Essa é uma capacidade específica e escassa.

O humano no loop, que não é solução sozinho

A garantia padrão é que um clínico revisa a saída, então os erros são pegos.

Isso é mais fraco do que parece, por motivos bem documentados na pesquisa de fatores humanos.

Viés de automação. As pessoas tendem a confiar em recomendações automatizadas seguras, inclusive quando estão erradas, e inclusive quando a pessoa teria decidido corretamente sem ajuda.

Perda de habilidade. Capacidade não exercitada se degrada. Um revisor que não avalia casos de forma independente há muito tempo é uma checagem mais fraca do que costumava ser.

O volume vence a revisão. Onde o valor de um sistema é processar mais do que um humano conseguiria, a revisão independente genuína de toda saída não é possível por construção.

A responsabilidade fica pouco clara. Se o sistema geralmente está certo e o clínico é o responsável, o clínico carrega o risco de um sistema que não consegue inspecionar. É um problema de governança que precisa ser resolvido antes da implantação, não depois de um incidente.

A supervisão humana é necessária e não é suficiente, e projetá-la para de fato funcionar exige capacidade em fatores humanos, o que se conecta ao ponto sobre usabilidade na trilha de dispositivos médicos.

As funções, nomeadas

Cientistas de validação de IA clínica. A função mais escassa e mais importante aqui, e que praticamente não existe como cargo.

Cientistas e físicos de imagem médica. Entendem de aquisição e do que faz as imagens diferirem.

Cientistas de dados clínicos com base metodológica específica de saúde.

Oficiais de segurança clínica para sistemas de IA.

Especialistas regulatórios para software e dispositivos de IA.

Especialistas em implementação e fluxo de trabalho, porque a integração decide se algo de fato muda.

Analistas de monitoramento e desempenho, pós-implantação, uma função permanente.

Quem pode ser capacitado para essas funções

Radiologistas técnicos e tecnólogos de imagem. Subaproveitados e bem posicionados. Entendem de aquisição, artefatos e a realidade prática de imagem, e somar metodologia de validação produz exatamente a capacidade que falta.

Físicos médicos. Já têm expertise quantitativa e de imagem.

Cientistas de dados em saúde. Precisam de metodologia epidemiológica e base clínica, não de mais técnica de modelagem.

Clínicos com interesse analítico. Têm o julgamento de plausibilidade que pega problemas que nenhuma métrica mostra.

Cientistas clínicos em patologia e medicina laboratorial, conforme a patologia digital cresce.

Equipe de qualidade e regulatório se expandindo para software e dispositivos de IA.

Regulação e responsabilidade. Sistemas de IA clínica são frequentemente regulados como dispositivos médicos, com as obrigações descritas na trilha de dispositivos médicos, e em diversas jurisdições sua implantação clínica exige avaliação formal de segurança clínica. A responsabilidade clínica pelas decisões permanece com profissionais registrados. O treinamento constrói capacidade de validação e avaliação. Ele não confere aprovação regulatória, qualificação em segurança clínica, nem autoridade para implantar um sistema, e nenhuma saída de modelo deve ser tratada como orientação clínica.

O que levar disso

Acurácia relatada e desempenho clínico são grandezas diferentes, e a lacuna é previsível, não misteriosa.

A mudança de distribuição entre população, equipamento, prática e tempo é o problema central, o que torna validação local e monitoramento contínuo exigências permanentes de equipe.

Evidência retrospectiva, prospectiva e de impacto clínico são três barras diferentes, e a maioria das afirmações se apoia na primeira.

Aprovação significa que uma via definida foi satisfeita para um propósito declarado. Não é evidência de benefício ao paciente, e é frequentemente apresentada como se fosse.

E a supervisão humana é necessária e insuficiente, porque o viés de automação e o volume minam essa supervisão por design.

Perguntas frequentes
Por que sistemas de IA médica têm desempenho pior após a implantação?

Mudança de distribuição. Um modelo aprende a população, o equipamento, os padrões de prática e os padrões de referência em que foi treinado, e os quatro diferem em outro lugar. Só a prevalência já muda o valor preditivo de qualquer saída.

A aprovação regulatória significa que um sistema funciona?

Significa que uma via definida foi satisfeita com base na evidência submetida para um propósito declarado. Não equivale a evidência de melhores desfechos de pacientes na sua população.

A revisão humana é uma salvaguarda suficiente?

Não. O viés de automação faz as pessoas confiarem em sistemas seguros, habilidades não exercitadas se degradam, e onde o valor do sistema é o volume, a revisão independente genuína de toda saída é impossível por construção.

Quem deveria ser treinado para isso?

Radiologistas técnicos e tecnólogos de imagem estão subaproveitados e bem posicionados, já que entendem de aquisição e artefatos. Cientistas de dados em saúde precisam de metodologia epidemiológica, não de mais técnica de modelagem.

Onde isso se encaixa no domínio?

Oitava de dez trilhas no domínio de medicina e healthtech da Astra Trainer, dependendo de epidemiologia para o método de validação e de dispositivos médicos para a estrutura regulatória. Você pode ver aqui.

A capacidade é a validação, não o modelo
Dez trilhas em medicina e healthtech, incluindo IA médica, imagem e diagnóstico ao lado de epidemiologia, informática em saúde e dispositivos médicos. Combinado com seus próprios clínicos e cientistas, em aulas de cinco minutos.