Astra Trainer
Industrias del futuro

La brecha en bioestadística detrás de la mayoría de errores con datos de salud

Aleksandr Mikhailov
Founder, Astra Trainer
Actualizado
8 min de lectura

La epidemiología suena a materia especializada de salud pública. Se entiende mejor como el conocimiento acumulado sobre cómo engañan los datos de salud poblacional, puesto por escrito por un campo que se ha equivocado repetidamente y ha aprendido de ello.

Eso la hace directamente relevante para cualquiera que trabaje con datos de salud, un grupo hoy mucho más grande que quienes se llaman a sí mismos epidemiólogos.

La disciplina que existe para evitar que te engañes a ti mismo

Los datos de salud tienen propiedades que rompen la intuición analítica ordinaria.

Las personas no se asignan al azar a las exposiciones. Las personas enfermas buscan atención, así que aparecer en un conjunto de datos no es independiente de estar enfermo. La medición ocurre porque alguien decidió medir, y esa decisión lleva información. Los resultados tardan años. Y la población que generó los datos no es la población a la que se aplicará la conclusión.

Los métodos existen porque el análisis obvio se equivoca con la frecuencia suficiente como para haber causado daño real, repetidamente, durante un siglo.

El Future of Jobs Report 2025 del World Economic Forum encontró que el 92 % de los empleadores en servicios médicos y sanitarios dice que las habilidades de IA y big data ganan importancia. Esa demanda la está cubriendo, en gran parte, gente formada con datos que no se comportan en nada como los datos de salud.

Qué abarca esta dirección

El alcance: cómo se propagan las enfermedades, la prevención, la salud poblacional, la bioestadística, la política sanitaria y la desigualdad.

Cuatro capacidades.

Diseño de estudios. De cohortes, de casos y controles, transversal, aleatorizado. Qué pregunta puede responder cada diseño y cuál no. La mayoría de las disputas analíticas se resuelven en este nivel, no en la estadística.

Medidas de asociación e impacto. Riesgo relativo y absoluto, odds ratios, número necesario a tratar. Entender por qué un cambio relativo grande puede ser un cambio absoluto trivial, la brecha que más se explota en la comunicación sobre salud.

Sesgo y confusión. Las formas sistemáticas en que un estudio puede estar equivocado, y qué se puede hacer con cada una.

Salud poblacional y prevención. Cribado, vacunación, vigilancia, y el razonamiento detrás de la intervención a nivel poblacional.

Cuatro errores que se repiten sin parar

Confusión leída como causalidad. Dos cosas se mueven juntas porque una tercera impulsa a ambas. En datos de salud, esa tercera cosa suele ser la edad, la privación o la gravedad inicial, y las tres se asocian con fuerza a casi todos los resultados.

Efectos de selección en datos rutinarios. Los registros electrónicos contienen a personas que buscaron atención y fueron evaluadas. Un modelo entrenado con esos datos aprende sobre la población evaluada, no sobre la general. No se corrige añadiendo más datos, porque más datos de la misma fuente arrastran la misma selección.

Ignorar la tasa base en el rendimiento de los tests. El error más consecuente de esta lista. Un test con excelente sensibilidad y especificidad produce sobre todo falsos positivos cuando la condición es rara, porque el número de personas sin la condición es mucho mayor. Cualquiera que evalúe un diagnóstico, un programa de cribado o una alerta predictiva necesita esto, y suele faltar en las afirmaciones de producto.

Riesgos competitivos y tiempo inmortal. Problemas más sutiles sobre cómo se maneja el tiempo, ambos capaces de producir efectos aparentemente impresionantes de la nada. Aparecen con frecuencia en análisis de datos rutinarios hechos por personas que nunca se los han encontrado.

Dónde encaja esto en el dominio

Salud pública y epidemiología es la cuarta de las diez direcciones del dominio de medicina y tecnología sanitaria de Astra Trainer, y es la columna metodológica de las que están por encima: investigación clínica y ensayos clínicos, IA médica e imagen, y medicina de precisión dependen todas de ella.

Para los socios cuyo personal llega desde la ciencia de datos y no desde la salud, suele combinarse con el dominio de IA, datos y computación, donde ciencia de datos y analítica cubre la maquinaria estadística. La combinación importa porque la maquinaria sin la epidemiología produce errores con aparente seguridad. Puedes ver las diez direcciones aquí.

La desigualdad en salud como contenido técnico

La propia descripción del sitio para esta dirección incluye la desigualdad, y pertenece ahí como método, no como comentario.

Tres razones por las que es técnica.

Es un factor de confusión casi en todas partes. La posición socioeconómica se asocia con la exposición, con el acceso a la atención, con cuán completos son los registros y con el resultado. Un análisis que la omite atribuirá sus efectos a cualquier otra cosa que haya en el modelo.

Determina quién está en los datos. Los grupos con peor acceso a la atención están infrarrepresentados en los conjuntos de datos clínicos. Los modelos entrenados con esos conjuntos de datos rinden peor precisamente para los grupos que ya reciben menos, y el fallo es invisible en las métricas de rendimiento agregado.

El rendimiento agregado oculta el fallo por subgrupo. Un modelo puede rendir bien en conjunto y mal en un subgrupo, y una métrica principal no lo mostrará. La evaluación estratificada es un requisito metodológico, no un extra ético.

Así que un programa de plantilla que enseña esto correctamente forma a personas que evalúan los sistemas de una forma que detecta problemas antes del despliegue. Uno que lo trata como una declaración de valores forma a personas que están de acuerdo en que importa y no saben cómo comprobarlo.

Los puestos, uno a uno

Epidemiólogos y analistas de salud pública en agencias y sistemas de salud.

Bioestadísticos, en ensayos, investigación y sistemas de salud.

Científicos de datos de salud que trabajan con datos poblacionales y rutinarios.

Personal de vigilancia y respuesta a brotes.

Economistas de la salud e investigadores de resultados, donde los mismos métodos sustentan argumentos de reembolso y de valor.

Analistas regulatorios y de evaluación de tecnologías sanitarias que evalúan la evidencia presentada por los fabricantes.

Estadísticos y metodólogos de ensayos clínicos, conectados con la dirección de investigación clínica.

Analistas de política en gobiernos y aseguradoras, que toman decisiones que descansan en estos métodos entiendan o no de ellos.

A quién se puede formar para esto

Científicos de datos y estadísticos que pasan a la salud. El grupo más grande y el que tiene la mayor brecha en relación con las consecuencias. Tienen la maquinaria técnica y les faltan los modos de fallo específicos del dominio, que es exactamente esta dirección.

Personal clínico que pasa a puestos analíticos. Tienen la comprensión clínica y necesitan los métodos. La reconversión complementaria, y en general la más fiable, porque la intuición clínica detecta resultados implausibles.

Analistas de política y de gobierno. A menudo interpretan evidencia epidemiológica sin ninguna formación formal en ella.

Gestores de servicios sanitarios que trabajan con datos de rendimiento y de resultados que arrastran todos los problemas anteriores.

Periodistas y personal de comunicación en organizaciones sanitarias, donde solo la distinción entre riesgo relativo y absoluto cambia la calidad del resultado.

Analistas de seguros y pagadores que trabajan con datos de reclamaciones.

Qué es esto y qué no es. Esta dirección construye capacidad metodológica para analizar datos de salud poblacional. No es formación clínica y no sustenta decisiones sobre pacientes individuales, y la distinción entre inferencia a nivel poblacional e individual es precisamente una de las cosas que esta disciplina existe para hacer respetar. La práctica de salud pública en puestos oficiales también conlleva sus propios requisitos de colegiación y cualificación profesional en muchas jurisdicciones.

Qué llevarte de todo esto

La epidemiología es el registro histórico de cómo engañan los datos de salud, lo que la hace útil para muchas más personas que la salud pública.

La confusión, los efectos de selección, las tasas base y el manejo del tiempo causan más conclusiones erróneas que cualquier elección de modelo, y ninguno se corrige con más datos.

Ignorar la tasa base es el error individual más consecuente, porque hace que un buen test parezca inútil o útil según un dato sobre la población que las afirmaciones de producto suelen omitir.

La desigualdad en salud es un factor de confusión, un problema de disponibilidad de datos y un problema de rendimiento por subgrupo, lo que la convierte en método, no en comentario.

Y los científicos de datos que entran en salud son el grupo cuya brecha de formación es mayor en relación con lo que decide su trabajo.

Preguntas frecuentes
¿Por qué necesitan epidemiología los científicos de datos?

Porque los datos de salud rompen la intuición analítica ordinaria. Las personas no se asignan al azar a las exposiciones, aparecer en un conjunto de datos depende de haber buscado atención, y la propia medición lleva información. Los métodos existen porque el análisis obvio suele estar equivocado.

¿Cuál es el error más consecuente?

Ignorar la tasa base. Un test con excelente sensibilidad y especificidad produce sobre todo falsos positivos cuando la condición es rara, y las afirmaciones de producto suelen omitir la prevalencia que determina esto.

¿La desigualdad en salud es un tema técnico?

Sí. Confunde casi cualquier análisis, determina quién aparece en los conjuntos de datos clínicos, y produce fallos por subgrupo que las métricas de rendimiento agregado ocultan. La evaluación estratificada es un requisito metodológico.

¿Quién se reconvierte mejor hacia estos puestos?

El personal clínico que pasa a análisis, porque la intuición clínica detecta resultados implausibles, y los científicos de datos que pasan a salud, que tienen la maquinaria y necesitan los modos de fallo del dominio.

¿Dónde encaja esto dentro del dominio?

Es la cuarta de las diez direcciones del dominio de medicina y tecnología sanitaria de Astra Trainer, y la columna metodológica bajo investigación clínica, IA médica y medicina de precisión. Puedes verlas aquí.

Los métodos existen porque la respuesta obvia está equivocada
Diez direcciones en medicina y tecnología sanitaria, incluidas salud pública y epidemiología junto a investigación clínica, IA médica y medicina de precisión. Diseñadas con tus propios especialistas, en lecciones de cinco minutos.