Astra Trainer
Industrie del futuro

L'assunzione bioinformatica che tutti cercano e nessuno trova

Aleksandr Mikhailov
Founder, Astra Trainer
Aggiornato
9 min di lettura

Apri un qualsiasi annuncio di lavoro in bioinformatica e trovi sempre la stessa lista. Programmazione solida, statistica, sviluppo di pipeline, infrastruttura cloud, e una comprensione profonda della biologia rilevante, idealmente con esperienza di dominio in ciò su cui lavora l'azienda.

Quella persona esiste. Non ce ne sono molte, sono costose, e hanno già un lavoro.

L'annuncio che non descrive nessuno

Il motivo per cui l'annuncio resta aperto è che sono due carriere in un solo posto.

Uno scienziato computazionale competente richiede anni per formarsi. Un biologo competente richiede anni per formarsi. Le organizzazioni scrivono un annuncio che richiede entrambi e poi trattano la difficoltà che ne risulta come una carenza di mercato.

Un ruolo che richiede due carriere intere non è un problema di assunzione. È un problema di progettazione del ruolo, e si risolve di solito sull'organigramma, non sul mercato.

È il caso più chiaro, nel dominio della biotecnologia, della diagnosi che vale per tutta la sezione Future Industries: prima di concludere che il mercato del lavoro è scarso, verifica se il requisito è copribile così come è scritto.

Cosa copre la direzione

L'ambito: leggere genomi, sequenze e proteine su larga scala, dati biologici e modellazione computazionale.

Concretamente, quattro strati.

Analisi di sequenza. Allineamento, assemblaggio, chiamata delle varianti, annotazione. In gran parte standardizzata, molto strumentata, e dove sta la maggior parte del lavoro di routine.

Statistica per dati biologici. Che è un problema a sé. I dataset biologici sono larghi e poco profondi, con molte più caratteristiche misurate che campioni, il che rompe le intuizioni di chi è formato su dati convenzionali. Test multipli, effetti batch e confondimento sono le trappole standard.

Calcolo strutturale e delle proteine. Modellare struttura e interazione, un'area che è cambiata sostanzialmente negli ultimi anni e continua a muoversi.

Pipeline e infrastruttura. Far girare un'analisi in modo ripetibile, su scala, con le versioni registrate. Meno affascinante e più decisivo di tutto ciò che sta sopra.

Le due vie d'ingresso, e cosa sbaglia ciascuna

Dal calcolo verso la biologia. Arriva sapendo scrivere codice affidabile, gestire la scala, usare correttamente il controllo di versione e costruire una pipeline funzionante. Il modo di fallire è produrre un risultato tecnicamente corretto ma privo di significato biologico, senza avere un allarme interno che segnali che è successo. Interpretare gli effetti batch come segnale biologico è l'esempio classico, e non è un errore di codice.

Dalla biologia verso il calcolo. Arriva sapendo dire se un risultato ha senso, la cosa che non si può automatizzare. Il modo di fallire è un'analisi che esiste come una cartella di script che nessun altro sa far girare, con passaggi manuali non documentati, che funziona una volta e non si può riprodurre.

Entrambi sono reali ed entrambi sono formabili. Il secondo percorso è di solito più breve, per un motivo che vale la pena dire chiaramente: il giudizio biologico richiede più tempo per formarsi della disciplina ingegneristica, quindi partire dalla persona che ha già quella metà significa formare la metà più veloce.

Questo va contro l'istinto di assumere un ingegnere software e insegnargli un po' di biologia, che è l'approccio più comune e quello più lento.

Dove si colloca nel dominio

Bioinformatica e biologia computazionale è la quinta di dieci direzioni nel dominio biotecnologia di Astra Trainer, ed è quella più spesso definita in combinazione con altre, di solito genetica e genomica sul lato biologico.

Per i partner che formano biologi verso il lavoro computazionale, il dominio IA, dati e computing copre otto direzioni tra cui informatica, ingegneria del software, data science e analytics, e cloud computing e DevOps, da cui viene la metà ingegneristica. Quell'abbinamento tra domini è una delle forme di programma più comuni. Puoi vedere qui le direzioni della biotecnologia.

Lo strato che nessuno mette a budget

Riproducibilità e data engineering. È noioso, è dove i soldi se ne vanno silenziosamente, e quasi non compare mai nel piano di sviluppo della forza lavoro.

I sintomi sono coerenti tra le organizzazioni.

Un'analisi non si può rieseguire. Chi l'ha fatta se n'è andato, l'ambiente è cambiato, e il risultato alla base di una decisione non può essere riprodotto. In un contesto regolamentato è un problema serio, non un fastidio.

I dati non si trovano. Output di sequenziamento che si accumula senza metadati coerenti, così dataset di due anni fa sono di fatto perduti pur occupando storage fatturato ogni mese.

I costi di calcolo crescono senza spiegazione. Spesa cloud che nessuno possiede, guidata da pipeline mai ottimizzate perché nessuno ne era responsabile.

Ogni progetto ricostruisce la stessa cosa. Nessuno strumento condiviso, così ogni scienziato scrive la propria versione della stessa analisi, leggermente diversa.

Sono tutti problemi di data engineering e si risolvono con persone di background software e infrastruttura invece che assumendo un altro biologo computazionale. Le organizzazioni che lo riconoscono presto spendono considerevolmente meno su un orizzonte di cinque anni.

I ruoli, divisi correttamente

La mossa pratica è smettere di provare ad assumere una persona e definirne tre.

RuoloCosa faFormato da
Analista bioinformaticoEsegue pipeline consolidate, interpreta l'output, lavora con gli scienziati su domande specificheBiologi, personale di laboratorio, tecnici di genomica
Ingegnere bioinformaticoCostruisce e mantiene pipeline, infrastruttura, riproducibilità e controllo dei costiIngegneri software, data engineer, infrastruttura IT
Biologo computazionaleSviluppo di metodi originali, modellazione, lavoro a livello di ricercaPercorso lungo, genuinamente scarso, assumere solo dove essenziale

La maggior parte delle organizzazioni ha bisogno di molti del primo tipo, alcuni del secondo e pochissimi del terzo. La maggior parte degli annunci descrive il terzo e si aspetta che faccia tutto.

Dividere il ruolo fa due cose insieme. Rende le posizioni copribili da popolazioni che già hai, e impedisce a persone senior costose di passare il tempo sulla manutenzione delle pipeline.

Dove la regolamentazione tocca questo. La bioinformatica a supporto di diagnostica clinica, sottomissioni regolatorie o ambienti GxP comporta requisiti di validazione, controllo di versione e audit che vanno ben oltre la buona pratica scientifica. Una pipeline che produce risultati clinici è un sistema regolamentato. La formazione costruisce sia la capacità computazionale sia la consapevolezza che questo confine esiste, e la validazione e qualificazione specifiche del sito restano obblighi separati.

Costruirla invece di comprarla

Una sequenza pratica per le organizzazioni che hanno concluso di non poter uscire dal problema assumendo.

Parti dai biologi che già fanno analisi male. La maggior parte dei gruppi di ricerca contiene qualcuno che si è insegnato abbastanza scripting per cavarsela. Hanno il giudizio di dominio e le abitudini autodidatte che non scalano. La formazione strutturata li converte più in fretta di chiunque altro disponibile, e conoscono già i dati dell'organizzazione.

Porta la capacità ingegneristica separatamente. Dalla tua funzione software o IT se ne esiste una. Non hanno bisogno di biologia profonda per costruire infrastruttura affidabile, e fingere il contrario ritarda l'assunzione indefinitamente.

Tratta la riproducibilità come un requisito fin dall'inizio. Aggiungerla dopo costa considerevolmente di più che costruirla dentro, e il punto in cui le persone se ne accorgono è di solito il punto in cui è più costosa.

Mantienila continua. Strumenti e metodi in questo campo si muovono in fretta, quindi un corso una tantum invecchia rapidamente. È una delle aree dove l'apprendimento breve e continuo supera davvero un evento, per le stesse ragioni discusse nell'articolo di riferimento sul microlearning.

Cosa portare a casa

L'annuncio bioinformatico standard chiede due carriere e poi incolpa il mercato.

Entrambe le vie d'ingresso hanno un fallimento caratteristico, e il percorso dalla biologia al calcolo è di solito più breve perché la metà del giudizio richiede più tempo per formarsi di quella ingegneristica.

Riproducibilità e data engineering sono lo strato non messo a budget, e il costo di saltarli arriva come dati perduti, analisi non riproducibili e bollette cloud che nessuno possiede.

Dividi il ruolo in analista, ingegnere e biologo computazionale. La maggior parte delle organizzazioni ha bisogno di molti del primo tipo, alcuni del secondo e quasi nessuno del terzo.

E parti dal biologo che si è già insegnato a scriptare. È la conversione più rapida che hai in casa.

Domande frequenti
Perché la bioinformatica è così difficile da coprire con le assunzioni?

Perché l'annuncio tipico richiede un forte scienziato computazionale che sia anche un biologo in attività. Sono due carriere, e la carenza è in parte un problema di progettazione del ruolo più che di mercato del lavoro.

È più facile formare un biologo a programmare o un programmatore a fare biologia?

Di solito il biologo, perché il giudizio biologico richiede più tempo per formarsi della disciplina ingegneristica. Formare chi ha già la metà lenta significa formare la metà più veloce.

Cosa viene trascurato nei piani di formazione per la bioinformatica?

Data engineering e riproducibilità. I costi arrivano dopo come analisi non rieseguibili, dati non trovabili e spesa di calcolo che nessuno possiede.

Come dovrebbe essere strutturato il ruolo?

Come tre ruoli: analista, ingegnere e biologo computazionale. La maggior parte delle organizzazioni ha bisogno di molti analisti, alcuni ingegneri e pochissimi del terzo tipo, e assumere una persona per fare tutti e tre è il motivo per cui l'annuncio resta aperto.

Dove si colloca nel dominio?

Quinta di dieci direzioni nel dominio biotecnologia di Astra Trainer, spesso abbinata a genetica e genomica, o a direzioni del dominio IA, dati e computing per la metà ingegneristica. Puoi vederle qui.

Smetti di cercare due carriere in un solo lavoro
Dieci direzioni tra biotecnologia e bioeconomia, tra cui bioinformatica e biologia computazionale, più altre otto tra IA, dati e computing per la metà ingegneristica. Definite con i tuoi scienziati e mappate su ruoli che puoi davvero coprire.