Astra Trainer
Industrias del futuro

El empleo tecnológico que más rápido crece consiste, sobre todo, en limpiar datos

Aleksandr Mikhailov
Founder, Astra Trainer
Actualizado
10 min de lectura

La ciencia de datos se describe como modelado y consiste, sobre todo, en el trabajo poco glamuroso que tiene que pasar antes de que cualquier modelo signifique algo.

La cifra, y en qué consiste el trabajo

La cifra de crecimiento es real y vale la pena decirla con precisión. La Oficina de Estadísticas Laborales de EE. UU. proyecta que el empleo de científicos de datos aumente un 33,5 % entre 2024 y 2034, un incremento de 82.500 puestos. Es la tasa de crecimiento proyectada más alta entre las ocupaciones tecnológicas de su análisis, frente a un 3,1 % de crecimiento en todas las ocupaciones.

Ahora la forma del trabajo, que el nombre del puesto no transmite.

Una gran parte del tiempo se va en localizar datos entre sistemas construidos para fines operativos y no de análisis, entender cómo se rellenó realmente cada campo y por quién, gestionar valores ausentes sin distorsionar el resultado, reconciliar el mismo concepto registrado de forma distinta en sistemas distintos, y determinar si los datos pueden sostener la pregunta que se está haciendo.

La mayor parte de la ciencia de datos consiste en establecer qué significan los datos. El modelado es lo que pasa una vez que eso está resuelto.

Esto no es una queja sobre el campo. Es el campo. Y explica por qué los científicos de datos con conocimiento de dominio son mucho más eficaces que los que no lo tienen: casi todo juicio de esa lista exige saber cómo funciona realmente el negocio.

Qué cubre la dirección

El alcance: estadística, bases de datos, Python y R, visualización y pronóstico.

Cuatro áreas.

Manejo de datos. Consultar, unir, limpiar y reestructurar, que es el trabajo diario.

Estadística. Inferencia, incertidumbre, diseño experimental y el razonamiento que separa un hallazgo de una coincidencia.

Modelado y pronóstico. Métodos predictivos, evaluación y saber cuándo un enfoque más simple es mejor.

Comunicación. Visualización y la capacidad de hacer que un resultado técnico cambie una decisión.

Nadie se pone de acuerdo en qué es un cliente

El descubrimiento más habitual y más caro en la analítica corporativa, y es un problema de definición antes que técnico.

Pregunta a varios departamentos cuántos clientes tiene la organización y las respuestas difieren, a menudo de forma sustancial. Ventas cuenta cuentas. Finanzas cuenta entidades de facturación. Soporte cuenta contactos. Marketing cuenta direcciones de correo. Una empresa matriz con seis filiales es un cliente o seis según a quién le preguntes. Alguien que canceló el mes pasado sigue en un sistema y ha desaparecido de otro.

Lo mismo pasa con casi cualquier medida importante. Usuario activo, pedido, abandono, ingreso reconocido, número de empleados. Cada una la registran sistemas construidos en momentos distintos para fines distintos por gente que resolvía un problema diferente.

Tres consecuencias.

Los informes que no coinciden destruyen la confianza más rápido de lo que informan. En cuanto dos paneles muestran cifras distintas para lo mismo, las reuniones se convierten en discusiones sobre los datos en lugar de decisiones sobre el negocio.

La solución es gobernanza, no tecnología. Acordar definiciones, registrarlas, asignar propiedad y aplicarlas de forma consistente. Ninguna herramienta hace esto, y comprar una en su lugar es el gasto desperdiciado más común en esta área.

Es el trabajo que hace posible todo lo demás. El aprendizaje automático sobre datos definidos de forma inconsistente produce resultados equivocados con confianza, y la inconsistencia es invisible en el resultado.

La estadística que la gente se salta, y paga

Las herramientas modernas facilitan producir un resultado sin entender qué significa. Cuatro conceptos evitan la mayor parte del daño resultante.

Correlación y causalidad. Se repite constantemente y se viola constantemente. La forma práctica es que una variable asociada con un resultado puede ser una causa, puede ser un efecto, puede compartir una causa común, o puede ser coincidencia. Actuar sobre la asociación asume lo primero, y solo un experimento o un razonamiento causal cuidadoso lo justifica.

Efectos de selección. Cómo llegaron a existir los datos determina qué pueden decirte. Analizar a los clientes que se quedaron te habla de la gente que no se fue. Encuestar a quien responde te habla de quien está dispuesto a responder. Estudiar proyectos exitosos sin los fallidos produce consejos que no funcionan.

Incertidumbre. Toda estimación a partir de una muestra tiene un rango a su alrededor. Reportar un valor puntual sin ese rango invita a decisiones que los datos no respaldan, sobre todo cuando los segmentos se hacen pequeños.

Comparaciones múltiples. Prueba suficientes hipótesis y algunas parecerán significativas por azar. Los paneles que segmentan por decenas de dimensiones generan hallazgos aparentes de forma continua, y alguien actúa sobre ellos.

No son temas avanzados. Son la diferencia entre un análisis que mejora decisiones y un análisis que da una justificación de aspecto autorizado a lo que alguien ya quería.

Dónde encaja en el dominio

Ciencia de datos y analítica es la cuarta de ocho direcciones en el dominio de IA, datos y computación de Astra Trainer, y es el requisito previo de la dirección de aprendizaje automático en lugar de una versión menor de ella. Los modelos valen tanto como las definiciones y la calidad de los datos que hay debajo.

Conecta con ingeniería de software para la capa de pipeline y producción, y con computación en la nube y DevOps para las plataformas sobre las que corre este trabajo. También conecta hacia fuera con casi cualquier otro dominio, ya que la contabilidad de emisiones, los datos clínicos, la calidad de fabricación y el pronóstico de red eléctrica son todos problemas de datos con requisitos de dominio. Puedes ver las ocho direcciones aquí.

Por qué tantos modelos nunca se usan

Un patrón familiar para cualquiera que haya trabajado en esta área: se construye un modelo, funciona bien en evaluación, se presenta, y nada cambia.

Las razones raramente son técnicas.

Respondió a una pregunta que nadie hacía. El análisis lo impulsaron los datos disponibles en lugar de una decisión que alguien tenía que tomar.

Llegó después de la decisión. Un análisis que tarda tres meses para una decisión que se toma en tres semanas es un ejercicio académico.

Nadie podía actuar sobre el resultado. Una predicción es inútil sin una acción correspondiente, un responsable y la autoridad para tomarla.

No se confió en él. Porque las definiciones no coincidían con las que usaba la audiencia, o porque el método era opaco, o porque un análisis anterior había estado equivocado.

No había un camino a producción. El modelo vivía en un notebook en el ordenador de una persona, y nunca se dimensionó la ingeniería para ejecutarlo de forma fiable.

La implicación para la formación es que las habilidades técnicas son necesarias e insuficientes. Las capacidades que determinan si el trabajo con datos cambia algo son el enfoque del problema, la comprensión de los interesados, la comunicación y saber qué exige la producción, y todo eso se puede enseñar a gente que ya tiene la mitad técnica.

Los puestos, nombrados

Analistas de datos. El grupo más grande y el punto de entrada más común.

Científicos de datos. Modelado estadístico y experimentación.

Ingenieros de datos. Pipelines e infraestructura, y de forma consistente más escasos que los científicos de datos.

Ingenieros de analítica, un puesto que surgió específicamente para gestionar la capa de definición y transformación.

Desarrolladores de inteligencia de negocio.

Especialistas en gobernanza y calidad de datos, que hacen el trabajo definicional descrito arriba.

Especialistas en experimentación e inferencia causal.

Analistas de pronóstico, en demanda, cadena de suministro, energía y finanzas.

Ingenieros de aprendizaje automático, donde la ciencia de datos se encuentra con el software de producción.

Quién puede formarse para esto

Expertos de dominio de toda la empresa. La conversión más fuerte de esta dirección, y la más infrautilizada. Alguien que lleva una década en operaciones, finanzas, práctica clínica o fabricación sabe qué preguntas importan y qué es probable que estén ocultando los datos. Enseñarle análisis es más rápido y produce mejor trabajo que enseñarle el dominio a un analista.

Personal de finanzas y contabilidad. Ya cómodo con datos, reconciliación y precisión definicional, que es la mayor parte de la dificultad.

Analistas y planificadores de operaciones. Hacia pronóstico, con el conocimiento de proceso que hace creíble una previsión.

Investigadores y científicos. Con formación estadística ya presente, necesitando el contexto comercial y la práctica de ingeniería.

Ingenieros de software. Hacia ingeniería de datos, que es el puesto más escaso y más cercano a sus habilidades existentes que la ciencia de datos.

Administradores de bases de datos. Hacia ingeniería de datos y gobernanza.

Cualquiera que haya construido un modelo de hoja de cálculo sustancial. Con frecuencia tiene capacidad analítica real y ninguna vía formal para que se le reconozca.

Protección de datos y uso responsable. El análisis de datos personales está regulado en la mayoría de las jurisdicciones, con requisitos sobre base legal, limitación de la finalidad, minimización, conservación y derechos individuales, y con protecciones específicas para categorías sensibles como salud o datos biométricos. Las decisiones automatizadas que afectan a personas conllevan obligaciones adicionales en varios regímenes. El análisis también puede producir resultados discriminatorios sin intención discriminatoria, a través de variables sustitutas en los datos. Astra Trainer construye capacidad analítica y conciencia de estas obligaciones. No es asesoramiento legal y no sustituye una evaluación de protección de datos ni el consejo cualificado de un profesional.

Qué llevarte de esto

Se proyecta que la ciencia de datos crezca un 33,5 % hasta 2034, la más rápida de las ocupaciones tecnológicas que rastrea BLS, y el trabajo consiste sobre todo en calidad y definición de datos más que en modelado.

La mayoría de las organizaciones no pueden acordar qué es un cliente, y eso es un problema de gobernanza que ninguna herramienta resuelve.

Cuatro ideas estadísticas, causalidad, selección, incertidumbre y comparaciones múltiples, evitan la mayor parte del daño que causa un análisis confiado.

Los modelos no se usan por razones organizativas mucho más a menudo que técnicas.

Y los mejores candidatos suelen ser expertos de dominio que ya saben qué pregunta importa, porque esa es la mitad que no se puede enseñar rápido.

Preguntas frecuentes
¿Qué tan rápido crece la ciencia de datos?

BLS proyecta un 33,5 % de crecimiento en el empleo de científicos de datos entre 2024 y 2034, un aumento de 82.500 puestos y la tasa más alta entre las ocupaciones tecnológicas que rastrea, frente a un 3,1 % en todas las ocupaciones.

¿Por qué gran parte del trabajo es limpiar datos?

Porque los datos los registran sistemas operativos construidos para otros fines, los campos se rellenan de forma inconsistente, faltan valores, y el mismo concepto se define de forma distinta en cada sistema. Establecer qué significan los datos es la mayor parte del trabajo.

¿Por qué los informes no coinciden entre sí?

Porque los departamentos definen las entidades centrales de forma distinta. Ventas cuenta cuentas, finanzas cuenta entidades de facturación, soporte cuenta contactos. La solución son definiciones acordadas con propiedad registrada, que es gobernanza y no tecnología.

¿Qué errores estadísticos causan más daño?

Tratar la correlación como causa, ignorar cómo se seleccionaron los datos, reportar valores puntuales sin incertidumbre, y encontrar significación aparente probando muchas hipótesis a la vez.

¿Quién convierte mejor hacia puestos de datos?

Los expertos de dominio de toda la empresa, porque saber qué pregunta importa es la mitad escasa. Luego personal de finanzas, planificadores de operaciones hacia pronóstico, investigadores, e ingenieros de software hacia ingeniería de datos.

Empieza por la gente que conoce el negocio
Ocho direcciones en IA, datos y computación, incluida ciencia de datos y analítica junto a aprendizaje automático, ingeniería de software y ciberseguridad. Diseñado con tus propios equipos, en lecciones de cinco minutos.