Astra Trainer
Industrias del futuro

El bioinformático que todos buscan y nadie encuentra

Aleksandr Mikhailov
Founder, Astra Trainer
Actualizado
9 min de lectura

Abre cualquier vacante de bioinformática y encuentras la misma lista. Programación sólida, estadística, desarrollo de pipelines, infraestructura en la nube y comprensión profunda de la biología relevante, idealmente con experiencia de dominio en lo que trabaje la empresa.

Esa persona existe. No hay muchas, son caras, y ya tienen trabajo.

La descripción de puesto que no describe a nadie

La razón por la que la vacante sigue abierta es que son dos carreras en una sola oferta.

Un científico computacional competente tarda años en formarse. Un biólogo competente tarda años en formarse. Las organizaciones escriben una descripción de puesto que exige ambas cosas y luego tratan la dificultad resultante como una escasez de mercado.

Un puesto que exige dos carreras completas no es un problema de contratación. Es un problema de diseño de puestos, y normalmente se resuelve en el organigrama, no en el mercado.

Este es el caso más claro en el dominio de biotecnología del diagnóstico que se aplica a toda la sección de Future Industries: antes de concluir que el mercado laboral está escaso, comprueba si el requisito es cubrible tal como está escrito.

Qué cubre la dirección

El alcance: leer genomas, secuencias y proteínas a escala, datos biológicos y modelado computacional.

En concreto, cuatro capas.

Análisis de secuencias. Alineamiento, ensamblaje, llamado de variantes, anotación. En gran parte estandarizado, muy dotado de herramientas, y donde está la mayor parte del trabajo rutinario.

Estadística para datos biológicos. Que es un problema propio. Los conjuntos de datos biológicos son anchos y poco profundos, con muchas más características medidas que muestras, lo que rompe la intuición de quien se formó con datos convencionales. Las pruebas múltiples, los efectos de lote y la confusión son las trampas habituales.

Computación estructural y de proteínas. Modelar estructura e interacción, un área que ha cambiado sustancialmente en los últimos años y sigue moviéndose.

Pipelines e infraestructura. Hacer que un análisis se ejecute de forma repetible, a escala, con las versiones registradas. Menos glamuroso y más decisivo que cualquier cosa de arriba.

Las dos rutas de entrada, y qué se le escapa a cada una

De la computación a la biología. Llega capaz de escribir código fiable, manejar escala, usar control de versiones correctamente y construir un pipeline que funciona. El modo de fallo es producir un resultado técnicamente correcto y biológicamente sin sentido, sin ninguna alarma interna de que eso haya pasado. Los efectos de lote interpretados como señal biológica es el ejemplo clásico, y no es un error de código.

De la biología a la computación. Llega capaz de saber si un resultado tiene sentido, que es lo que no se puede automatizar. El modo de fallo es un análisis que existe como una carpeta de scripts que nadie más puede ejecutar, con pasos manuales sin documentar, que funciona una vez y no se puede reproducir.

Ambas son reales y ambas son formables. La segunda ruta suele ser más corta, por una razón que vale la pena decir con claridad: el criterio biológico tarda más en construirse que la disciplina de ingeniería, así que empezar por la persona que ya tiene lo primero significa formar la mitad más rápida.

Esto va en contra del instinto de contratar a un ingeniero de software y enseñarle algo de biología, que es el enfoque más habitual y el más lento.

Dónde encaja en el dominio

Bioinformática y biología computacional es la quinta de diez direcciones en el dominio de biotecnología de Astra Trainer, y es la que se diseña con más frecuencia en combinación con otras, normalmente genética y genómica del lado biológico.

Para socios que forman a biólogos en trabajo computacional, el dominio de IA, datos y computación recorre ocho direcciones que cubren ciencias de la computación, ingeniería de software, ciencia de datos y analítica, y computación en la nube y DevOps, que es de donde viene la mitad de ingeniería. Ese emparejamiento entre dominios es una de las formas de programa más habituales. Puedes ver las direcciones de biotecnología aquí.

La capa que nadie presupuesta

Reproducibilidad e ingeniería de datos. Es aburrida, es adonde va el dinero en silencio, y casi nunca está en el plan de plantilla.

Los síntomas son consistentes entre organizaciones.

Un análisis no se puede volver a ejecutar. La persona que lo hizo se ha ido, el entorno ha cambiado, y el resultado que sustenta una decisión no se puede reproducir. En un contexto regulado esto es un problema serio, no un inconveniente.

No se encuentran los datos. Salida de secuenciación que se acumula sin metadatos consistentes, así que conjuntos de datos de hace dos años están efectivamente perdidos mientras siguen ocupando un almacenamiento que se factura mensualmente.

Los costes de cómputo crecen sin explicación. Gasto en la nube que nadie posee, impulsado por pipelines que nunca se optimizaron porque nadie era responsable de eso.

Cada proyecto reconstruye lo mismo. Sin herramientas compartidas, así que cada científico escribe su propia versión del mismo análisis, ligeramente distinta.

Todos estos son problemas de ingeniería de datos y los resuelve gente con perfiles de software e infraestructura en lugar de contratar a otro biólogo computacional. Las organizaciones que lo reconocen pronto gastan considerablemente menos en un horizonte de cinco años.

Los puestos, divididos correctamente

El movimiento práctico es dejar de intentar contratar a una persona y definir tres.

PuestoQué haceFormado desde
Analista de bioinformáticaEjecuta pipelines establecidos, interpreta resultados, trabaja con los científicos en preguntas concretasBiólogos, personal de laboratorio, técnicos de genómica
Ingeniero de bioinformáticaConstruye y mantiene pipelines, infraestructura, reproducibilidad y control de costesIngenieros de software, ingenieros de datos, infraestructura de TI
Biólogo computacionalDesarrollo de métodos novedosos, modelado, trabajo de nivel investigadorRuta larga, genuinamente escasa, contratar solo cuando sea imprescindible

La mayoría de las organizaciones necesitan mucho del primero, algo del segundo y muy poco del tercero. La mayoría de las descripciones de puesto describen al tercero y esperan que haga todo.

Dividir el puesto hace dos cosas a la vez. Hace que los puestos sean cubribles desde poblaciones que ya tienes, y evita que gente sénior cara pase su tiempo en mantenimiento de pipelines.

Dónde toca la regulación. La bioinformática que da soporte a diagnósticos clínicos, presentaciones regulatorias o entornos GxP conlleva requisitos de validación, control de versiones y auditoría que van mucho más allá de la buena práctica científica. Un pipeline que produce resultados clínicos es un sistema regulado. La formación construye tanto la capacidad computacional como la conciencia de que existe ese límite, y la validación y cualificación específicas del sitio siguen siendo obligaciones separadas.

Construirlo en lugar de comprarlo

Una secuencia práctica para organizaciones que han concluido que no pueden contratar para salir del problema.

Empieza por los biólogos que ya hacen análisis mal. La mayoría de los grupos de investigación tienen a alguien que se ha enseñado a sí mismo suficiente scripting para arreglárselas. Tienen el criterio de dominio y hábitos autodidactas que no van a escalar. La formación estructurada los convierte más rápido que a cualquier otra opción disponible, y ya conocen los datos de la organización.

Trae capacidad de ingeniería por separado. Desde tu propia función de software o TI si existe. No necesitan biología profunda para construir infraestructura fiable, y fingir lo contrario retrasa la contratación indefinidamente.

Trata la reproducibilidad como un requisito desde el inicio. Añadirla después es considerablemente más cara que construirla desde dentro, y el momento en que la gente lo nota suele ser el momento en que resulta más cara.

Mantenlo continuo. Las herramientas y métodos en este campo se mueven rápido, así que un curso puntual caduca rápido. Es una de las áreas donde el aprendizaje continuo breve supera de verdad a un evento, por las mismas razones que se discuten en el artículo central sobre microaprendizaje.

Qué llevarte de esto

La descripción de puesto estándar en bioinformática pide dos carreras y luego culpa al mercado.

Ambas rutas de entrada tienen un fallo característico, y la ruta de biología a computación suele ser más corta porque la mitad de criterio tarda más en construirse que la mitad de ingeniería.

La reproducibilidad y la ingeniería de datos son la capa sin presupuestar, y el coste de saltárselas llega como datos perdidos, análisis irreproducibles y facturas de nube que nadie posee.

Divide el puesto en analista, ingeniero y biólogo computacional. La mayoría de las organizaciones necesitan muchos del primero, algunos del segundo y casi ninguno del tercero.

Y empieza por el biólogo que ya se ha enseñado a programar. Es la conversión más rápida disponible dentro de la organización.

Preguntas frecuentes
¿Por qué es tan difícil contratar para bioinformática?

Porque la descripción de puesto típica exige un científico computacional sólido que además sea un biólogo en activo. Eso son dos carreras, y la escasez es en parte un problema de diseño de puestos y no solo del mercado laboral.

¿Es más fácil formar a un biólogo para que programe o a un programador para que haga biología?

Normalmente al biólogo, porque el criterio biológico tarda más en construirse que la disciplina de ingeniería. Formar a quien ya tiene la mitad lenta significa formar la mitad rápida.

¿Qué se le escapa a los planes de plantilla en bioinformática?

La ingeniería de datos y la reproducibilidad. Los costes llegan después, como análisis que no se pueden repetir, datos que no se encuentran y gasto de cómputo que nadie posee.

¿Cómo debería estructurarse el puesto?

Como tres puestos: analista, ingeniero y biólogo computacional. La mayoría de las organizaciones necesitan muchos analistas, algunos ingenieros y muy pocos del tercero, y contratar a una persona para que sea las tres es por lo que la vacante sigue abierta.

¿Dónde encaja esto en el dominio?

Quinta de diez direcciones en el dominio de biotecnología de Astra Trainer, emparejada con frecuencia con genética y genómica, o con direcciones del dominio de IA, datos y computación para la mitad de ingeniería. Puedes verlas aquí.

Deja de anunciar dos carreras en un solo puesto
Diez direcciones en biotecnología y la bioeconomía, incluida bioinformática y biología computacional, más ocho direcciones en IA, datos y computación para la mitad de ingeniería. Diseñado con tus propios científicos y mapeado sobre puestos que realmente puedes cubrir.