Astra Trainer
Индустрии будущего

Специалист по биоинформатике, которого все ищут и никто не может найти

Aleksandr Mikhailov
Founder, Astra Trainer
Обновлено
9 мин чтения

Откройте любую вакансию в биоинформатике — и увидите один и тот же список. Сильное программирование, статистика, разработка пайплайнов, облачная инфраструктура и глубокое понимание нужной биологии, в идеале с отраслевым опытом именно в том, чем занимается компания.

Такой человек существует. Их немного, они дороги, и у них уже есть работа.

Описание вакансии, которое не описывает никого

Причина, по которой вакансия остаётся открытой, в том, что это две карьеры в одном объявлении.

Компетентный вычислительный специалист формируется годами. Компетентный биолог формируется годами. Организации пишут описание вакансии, требующее и того, и другого, а затем воспринимают возникшую сложность как дефицит рынка.

Роль, требующая двух полноценных карьер, — это не проблема найма. Это проблема дизайна должности, и решается она обычно на оргструктуре, а не на рынке труда.

Это самый наглядный в домене биотехнологий случай диагностики, применимой ко всему разделу Future Industries: прежде чем делать вывод о дефиците на рынке труда, проверьте, закрываема ли позиция в том виде, в каком она написана.

Что охватывает направление

Область: чтение геномов, последовательностей и белков в масштабе, биологические данные и вычислительное моделирование.

Конкретно — четыре слоя.

Анализ последовательностей. Выравнивание, сборка, определение вариантов, аннотация. В основном стандартизировано, сильно оснащено инструментами, и здесь сосредоточена большая часть рутинной работы.

Статистика для биологических данных. Это отдельная проблема. Биологические наборы данных широкие и неглубокие — измеренных признаков намного больше, чем образцов, — а это ломает интуицию людей, обученных на обычных данных. Множественные сравнения, батч-эффекты и смешивание — типичные ловушки.

Структурные и белковые вычисления. Моделирование структуры и взаимодействия — область, существенно изменившаяся в последние годы и продолжающая двигаться.

Пайплайны и инфраструктура. Сделать так, чтобы анализ воспроизводимо запускался в масштабе, с зафиксированными версиями. Менее эффектно и намного важнее всего перечисленного выше.

Два пути входа, и что каждый из них упускает

Из вычислений в биологию. Приходит с умением писать надёжный код, работать с масштабом, правильно использовать контроль версий и строить рабочий пайплайн. Характерный провал — технически верный результат, который биологически бессмыслен, и отсутствие внутренней тревоги по этому поводу. Батч-эффекты, принятые за биологический сигнал, — классический пример, и это не ошибка в коде.

Из биологии в вычисления. Приходит с умением понять, разумен ли результат, — а это то, что нельзя автоматизировать. Характерный провал — анализ, существующий как папка скриптов, которые никто больше не может запустить, с недокументированными ручными шагами, который сработал один раз и не воспроизводится.

Оба реальны, и оба поддаются обучению. Второй путь обычно короче, и стоит сказать прямо почему: биологическое суждение формируется дольше, чем инженерная дисциплина, поэтому начинать с человека, у которого оно уже есть, — значит обучать более быстрой половине.

Это противоречит инстинкту нанять инженера-программиста и научить его немного биологии — более распространённому и более медленному подходу.

Где это находится в домене

Биоинформатика и вычислительная биология — пятое из десяти направлений в домене биотехнологий Astra Trainer, и его чаще всего планируют в сочетании с другими — обычно с генетикой и геномикой со стороны биологии.

Для партнёров, обучающих биологов вычислительной работе, домен ИИ, данных и вычислений охватывает восемь направлений, включая компьютерные науки, программную инженерию, науку о данных и аналитику и облачные вычисления и DevOps, — оттуда берётся инженерная половина. Эта междоменная связка — одна из самых частых форм программы. Направления биотехнологий можно посмотреть здесь.

Слой, на который никто не закладывает бюджет

Воспроизводимость и инженерия данных. Это незрелищно, именно сюда тихо утекают деньги, и это почти никогда не попадает в кадровый план.

Симптомы одинаковы в разных организациях.

Анализ нельзя перезапустить. Человек, который его делал, ушёл, среда изменилась, а результат, на котором основано решение, невозможно воспроизвести. В регулируемом контексте это серьёзная проблема, а не неудобство.

Данные не найти. Данные секвенирования накапливаются без согласованных метаданных, так что наборы данных двухлетней давности фактически потеряны, продолжая при этом занимать хранилище, за которое выставляют счёт каждый месяц.

Расходы на вычисления растут без объяснения. Облачные траты, которыми никто не владеет, из-за пайплайнов, которые никогда не оптимизировали, потому что никто за это не отвечал.

Каждый проект строит одно и то же заново. Нет общего инструментария, поэтому каждый учёный пишет собственную версию одного и того же анализа, чуть иначе.

Всё это проблемы инженерии данных, и их решают люди с бэкграундом в ПО и инфраструктуре, а не наймом ещё одного вычислительного биолога. Организации, которые понимают это заранее, тратят заметно меньше на горизонте в пять лет.

Роли, разделённые правильно

Практический шаг — перестать пытаться нанять одного человека и определить трёх.

РольЧем занимаетсяОткуда обучают
Аналитик биоинформатикиЗапускает готовые пайплайны, интерпретирует результат, работает с учёными над конкретными вопросамиБиологи, лабораторный персонал, техники геномики
Инженер биоинформатикиСтроит и поддерживает пайплайны, инфраструктуру, воспроизводимость и контроль затратИнженеры-программисты, инженеры данных, ИТ-инфраструктура
Вычислительный биологРазработка новых методов, моделирование, работа исследовательского уровняДолгий путь, по-настоящему дефицитен, нанимайте, только если необходимо

Большинству организаций нужно много первых, немного вторых и очень мало третьих. Большинство описаний вакансий описывают третьего и ожидают, что он сделает всё сразу.

Разделение роли делает сразу две вещи. Оно делает позиции закрываемыми из групп людей, которые у вас уже есть, и перестаёт тратить время дорогих старших специалистов на поддержку пайплайнов.

Где это касается регулирования. Биоинформатика, поддерживающая клиническую диагностику, регуляторные подачи или среду GxP, несёт требования по валидации, контролю версий и аудиту, выходящие далеко за рамки просто хорошей научной практики. Пайплайн, выдающий клинические результаты, — регулируемая система. Обучение формирует и вычислительную компетенцию, и понимание того, что эта граница существует, а специфичные для площадки валидация и квалификация остаются отдельными обязательствами.

Строить, а не покупать

Практическая последовательность для организаций, которые пришли к выводу, что нанять выход из ситуации не получится.

Начните с биологов, которые уже плохо делают анализ сами. В большинстве исследовательских групп есть человек, самостоятельно освоивший скриптинг настолько, чтобы справляться. У него есть отраслевое суждение и самостоятельно выработанные привычки, которые не масштабируются. Структурированное обучение конвертирует таких людей быстрее всех остальных, и они уже знакомы с данными организации.

Отдельно привлеките инженерную компетенцию. Из вашей собственной функции ПО или ИТ, если она есть. Им не нужна глубокая биология, чтобы строить надёжную инфраструктуру, и притворяться обратным бессрочно откладывает найм.

Относитесь к воспроизводимости как к требованию с самого начала. Доделывать её потом заметно дороже, чем закладывать сразу, а момент, когда люди это замечают, обычно и есть самый дорогой момент.

Держите это непрерывным. Инструменты и методы в этой области движутся быстро, поэтому разовый курс быстро устаревает. Это одна из областей, где короткое непрерывное обучение по-настоящему превосходит разовое событие, по тем же причинам, что описаны в обзорной статье про микрообучение.

Что важно вынести

Типовое описание вакансии в биоинформатике просит две карьеры сразу, а затем винит рынок.

У обоих путей входа есть характерный провал, и путь от биологии к вычислениям обычно короче, потому что половина, связанная с суждением, формируется дольше, чем инженерная половина.

Воспроизводимость и инженерия данных — незабюджетированный слой, и цена его пропуска приходит как потерянные данные, невоспроизводимый анализ и облачные счета, которыми никто не владеет.

Разделите роль на аналитика, инженера и вычислительного биолога. Большинству организаций нужно много первых, немного вторых и почти ни одного третьего.

И начните с биолога, который уже сам научился скриптингу. Это самая быстрая конверсия из всех доступных.

Часто задаваемые вопросы
Почему биоинформатику так трудно закрыть наймом?

Потому что типовое описание вакансии требует одновременно сильного вычислительного специалиста и действующего биолога. Это две карьеры, и дефицит отчасти — проблема дизайна должности, а не рынка труда.

Проще научить биолога программировать или программиста — биологии?

Обычно биолога, потому что биологическое суждение формируется дольше, чем инженерная дисциплина. Обучение человека, у которого уже есть медленная половина, означает обучение более быстрой половине.

Что упускают в кадровых планах по биоинформатике?

Инженерию данных и воспроизводимость. Издержки проявляются позже — как анализ, который нельзя перезапустить, данные, которые нельзя найти, и расходы на вычисления, которыми никто не владеет.

Как структурировать роль?

Как три роли: аналитик, инженер и вычислительный биолог. Большинству организаций нужно много аналитиков, немного инженеров и очень мало третьих, а найм одного человека на все три роли — причина, по которой вакансия остаётся открытой.

Где это находится в домене?

Пятое из десяти направлений в домене биотехнологий Astra Trainer, часто в паре с генетикой и геномикой или с направлениями из домена ИИ, данных и вычислений для инженерной половины. Их можно посмотреть здесь.

Перестаньте искать две карьеры в одной вакансии
Десять направлений в биотехнологиях и биоэкономике, включая биоинформатику и вычислительную биологию, и ещё восемь в ИИ, данных и вычислениях для инженерной половины. Спланировано вместе с вашими учёными и привязано к ролям, которые вы реально сможете закрыть.