Науку о данных описывают как моделирование, а на деле это в основном незрелищная работа, которая должна произойти прежде, чем какая-либо модель начнёт что-то значить.
Цифра и то, в чём на самом деле работа
Цифра роста реальна, и её стоит привести точно. US Bureau of Labor Statistics прогнозирует рост занятости дата-сайентистов на 33,5% с 2024 по 2034 год — это 82 500 новых мест. Это самый высокий прогнозируемый темп роста среди технологических профессий в его анализе, против 3,1% роста по всем профессиям.
Теперь — форма работы, которую не передаёт название должности.
Значительная доля времени уходит на поиск данных в системах, построенных для операционных целей, а не для анализа, на понимание того, как на самом деле и кем заполнялось каждое поле, на обработку пропущенных значений так, чтобы не исказить результат, на сведение одного и того же понятия, записанного по-разному в разных системах, и на определение того, способны ли данные вообще поддержать задаваемый вопрос.
Большая часть науки о данных — это установление того, что данные означают. Моделирование начинается, когда это уже решено.
Это не жалоба на область. Это и есть область. И это объясняет, почему дата-сайентисты со знанием отрасли настолько эффективнее тех, у кого его нет: почти каждое суждение из этого списка требует понимания того, как бизнес реально устроен.
Что охватывает направление
Область: статистика, базы данных, Python и R, визуализация и прогнозирование.
Четыре области.
Работа с данными. Запросы, объединение, чистка и преобразование — повседневная работа.
Статистика. Вывод, неопределённость, дизайн эксперимента и рассуждение, которое отличает находку от совпадения.
Моделирование и прогнозирование. Предиктивные методы, оценка и умение понять, когда более простой подход лучше.
Коммуникация. Визуализация и способность сделать так, чтобы технический результат изменил решение.
Никто не согласен, что такое клиент
Самое частое и самое дорогое открытие в корпоративной аналитике, и это проблема определений, а не техническая проблема.
Спросите несколько отделов, сколько у организации клиентов, и ответы разойдутся, часто существенно. Продажи считают аккаунты. Финансы считают юрлица, которым выставляют счета. Поддержка считает контакты. Маркетинг считает адреса электронной почты. Материнская компания с шестью дочерними — это один клиент или шесть, в зависимости от того, кого спросить. Человек, отменивший подписку в прошлом месяце, всё ещё есть в одной системе и уже исчез из другой.
То же самое относится почти к каждому важному показателю. Активный пользователь, заказ, отток, признанная выручка, численность сотрудников. Каждый зафиксирован системами, построенными в разное время для разных целей людьми, которые решали другую задачу.
Три следствия.
Отчёты, которые не сходятся, разрушают доверие быстрее, чем информируют. Как только две панели показывают разные цифры для одного и того же, совещания превращаются в споры о данных, а не в решения о бизнесе.
Решение — в управлении, а не в технологии. Договориться об определениях, зафиксировать их, назначить владельца и применять последовательно. Ни один инструмент этого не делает, и покупка инструмента вместо этого — самая частая напрасная трата в этой области.
Это работа, которая делает возможным всё остальное. Машинное обучение на непоследовательно определённых данных даёт уверенно неверные результаты, и эта непоследовательность невидима в самом результате.
Статистика, которую пропускают — и за это платят
Современные инструменты позволяют легко получить результат, не понимая, что он значит. Четыре понятия предотвращают большую часть возникающего ущерба.
Корреляция и причинность. Их постоянно упоминают и постоянно нарушают. Практическая формулировка такая: переменная, связанная с результатом, может быть причиной, может быть следствием, может иметь с ним общую причину, а может быть совпадением. Действовать на основе связи означает предполагать первый вариант, а обосновать это может только эксперимент или тщательное причинное рассуждение.
Эффекты отбора. То, как данные возникли, определяет, что они способны рассказать. Анализ клиентов, которые остались, расскажет о людях, которые не ушли. Опрос респондентов расскажет о людях, готовых отвечать. Изучение успешных проектов без неуспешных даёт советы, которые не работают.
Неопределённость. У любой оценки по выборке есть диапазон вокруг неё. Сообщать точечную оценку без этого диапазона — значит провоцировать решения, которые данные не поддерживают, особенно когда сегменты малы.
Множественные сравнения. Проверьте достаточно гипотез, и часть из них случайно окажется «значимой». Панели, которые режут данные по десяткам измерений, непрерывно порождают кажущиеся находки, и кто-то на их основе действует.
Это не продвинутые темы. Это разница между анализом, который улучшает решения, и анализом, который даёт авторитетно звучащее обоснование тому, чего кто-то уже хотел.
Где это находится в домене
Наука о данных и аналитика — четвёртое из восьми направлений в домене ИИ, данных и вычислений Astra Trainer, и это предпосылка для направления машинного обучения, а не его облегчённая версия. Модели ровно настолько хороши, насколько хороши определения и качество данных под ними.
Оно связано с программной инженерией — за слоем пайплайнов и продакшена, и с облачными вычислениями и DevOps — за платформами, на которых работает эта работа. Оно также связано почти со всеми остальными доменами, поскольку учёт выбросов, клинические данные, качество производства и прогнозирование энергосетей — всё это задачи о данных с отраслевыми требованиями. Восемь направлений можно посмотреть здесь.
Почему так много моделей никогда не используются
Паттерн, знакомый каждому, кто работал в этой области: модель построена, хорошо показывает себя на оценке, представлена — и ничего не меняется.
Причины редко технические.
Она ответила на вопрос, который никто не задавал. Анализ вёлся от доступных данных, а не от решения, которое кому-то нужно было принять.
Она пришла после решения. Анализ, занимающий три месяца, ради решения, принятого за три недели, — академическое упражнение.
Никто не мог действовать на основе результата. Прогноз бесполезен без соответствующего действия, владельца и полномочий его предпринять.
Ей не доверяли. Потому что определения расходились с теми, что использовала аудитория, или потому что метод был непрозрачен, или потому что предыдущий анализ оказался ошибочным.
Не было пути в продакшен. Модель жила в ноутбуке на машине одного человека, и инженерную работу для её надёжного запуска так и не спланировали.
Вывод для обучения в том, что технических навыков необходимо, но недостаточно. Компетенции, которые решают, изменит ли работа с данными хоть что-то, — это постановка задачи, понимание заинтересованных сторон, коммуникация и знание требований продакшена, и этому можно научить людей, у которых уже есть техническая половина.
Роли, поимённо
Аналитики данных. Самая большая группа и самая частая точка входа.
Дата-сайентисты. Статистическое моделирование и эксперименты.
Инженеры данных. Пайплайны и инфраструктура, стабильно в более коротком предложении, чем дата-сайентисты.
Аналитические инженеры (analytics engineers) — роль, возникшая специально для работы со слоем определений и трансформаций.
Разработчики бизнес-аналитики (BI).
Специалисты по управлению данными и качеству данных, выполняющие описанную выше работу с определениями.
Специалисты по экспериментам и каузальному выводу.
Аналитики по прогнозированию — в спросе, цепочках поставок, энергетике и финансах.
Инженеры машинного обучения, где наука о данных встречается с продакшен-разработкой.
Кого можно обучить этому
Отраслевые эксперты по всей компании. Самая сильная конверсия в этом направлении, и наименее используемая. Человек, который десять лет проработал в операциях, финансах, клинической практике или производстве, знает, какие вопросы важны и что данные, вероятно, скрывают. Научить его анализу быстрее и даёт лучший результат, чем научить аналитика отрасли.
Сотрудники финансов и бухгалтерии. Уже привычны к данным, сверке и точности определений, а это большая часть сложности.
Операционные аналитики и планировщики. В прогнозирование, обладая знанием процессов, которое делает прогноз убедительным.
Исследователи и учёные. Уже есть статистическая подготовка, нужны коммерческий контекст и инженерная практика.
Инженеры-программисты. В инженерию данных — более дефицитную роль и более близкую к их текущим навыкам, чем наука о данных.
Администраторы баз данных. В инженерию данных и управление данными.
Любой, кто строил серьёзную модель в Excel. Часто обладает реальными аналитическими способностями без формального способа их подтвердить.
Защита данных и ответственное использование. Анализ персональных данных регулируется в большинстве юрисдикций требованиями к правовому основанию, ограничению цели, минимизации, срокам хранения и правам субъекта, с особой защитой для медицинских, биометрических и других чувствительных категорий. Автоматизированные решения, затрагивающие людей, влекут дополнительные обязательства в ряде режимов регулирования. Анализ может также давать дискриминационные результаты без дискриминационного намерения — через прокси-признаки в данных. Astra Trainer формирует аналитическую компетенцию и понимание этих обязанностей. Это не юридическая консультация и не замена оценки защиты данных или консультации квалифицированного специалиста.
Что важно вынести
Наука о данных, по прогнозу, вырастет на 33,5% к 2034 году — быстрее всех технологических профессий, которые отслеживает BLS, а работа — это в основном качество данных и определения, а не моделирование.
Большинство организаций не могут договориться, что такое клиент, и это проблема управления, которую не решает ни один инструмент.
Четыре статистические идеи — причинность, отбор, неопределённость и множественные сравнения — предотвращают большую часть ущерба, который причиняет уверенный анализ.
Модели не используются по организационным причинам гораздо чаще, чем по техническим.
И лучшие кандидаты обычно — отраслевые эксперты, которые уже знают, какой вопрос важен, потому что именно этой половине нельзя быстро научить.
Насколько быстро растёт наука о данных?
BLS прогнозирует рост занятости дата-сайентистов на 33,5% с 2024 по 2034 год — это 82 500 новых мест и самый высокий темп среди технологических профессий, которые оно отслеживает, против 3,1% по всем профессиям.
Почему так много работы — это чистка данных?
Потому что данные фиксируют операционные системы, построенные для других целей, поля заполняются непоследовательно, значения пропущены, а одно и то же понятие по-разному определено в разных системах. Установить, что данные означают, — это и есть большая часть работы.
Почему отчёты противоречат друг другу?
Потому что отделы по-разному определяют ключевые сущности. Продажи считают аккаунты, финансы — юрлица для выставления счетов, поддержка — контакты. Решение — согласованные определения с зафиксированным владельцем, то есть управление, а не технология.
Какие статистические ошибки причиняют больше всего ущерба?
Восприятие корреляции как причинности, игнорирование того, как отобраны данные, сообщение точечных оценок без неопределённости и нахождение кажущейся значимости при проверке множества гипотез сразу.
Кто лучше всего конвертируется в роли, связанные с данными?
Отраслевые эксперты по всей компании, потому что знание того, какой вопрос важен, — дефицитная половина. Затем сотрудники финансов, операционные планировщики в прогнозирование, исследователи и инженеры-программисты в инженерию данных.
