Cada pocos meses falla un servicio importante de una forma que se lleva por delante una parte grande de internet, y la causa resulta estar en la capa que todo el mundo daba por abstraída.
La abstracción oculta la capa, no la elimina
La historia que se cuenta sobre infraestructura en los últimos quince años es que desapareció dentro de la nube. Los servidores se convirtieron en instancias, luego en contenedores, luego en funciones. Las redes se convirtieron en configuración. El almacenamiento se convirtió en una interfaz.
Cada uno de esos movimientos es real y útil, y ninguno eliminó nada. El paquete todavía tiene que llegar a un destino. El nombre todavía tiene que resolverse. El certificado todavía tiene que ser válido y estar vigente. El disco todavía tiene capacidad. El reloj todavía tiene que coincidir con otros relojes.
Lo que cambió es quién se da cuenta cuando algo de eso falla, y lo difícil que resulta verlo.
La abstracción aleja el fallo de quien lo experimenta, lo que hace más difícil encontrarlo y más valiosa a la persona que puede encontrarlo.
Este es el argumento de fondo para esta dirección. No nostalgia por montar servidores en rack, sino la observación de que el número de personas capaces de razonar sobre lo que realmente pasa por debajo ha caído más rápido que la necesidad de ellas.
Qué cubre la dirección
El alcance: sistemas operativos, hardware, redes, servidores, administración y resolución de problemas.
Cuatro áreas.
Redes. Direccionamiento, enrutamiento, resolución de nombres, balanceo de carga, cortafuegos y el camino que recorre realmente una solicitud.
Sistemas operativos. Procesos, permisos, sistemas de archivos, servicios y registros, en las plataformas que usa la organización.
Identidad y directorio. Autenticación, autorización, certificados y los sistemas que los emiten.
Operaciones. Monitorización, copia de seguridad y recuperación, capacidad, aplicación de parches y resolución de problemas estructurada.
Siempre es el DNS, y por qué ese chiste es verdad
La broma recurrente entre los ingenieros de infraestructura apunta a algo real sobre cómo fallan los sistemas.
La resolución de nombres está debajo de casi todo, es invisible cuando funciona, y produce síntomas que parecen problemas completamente distintos. Una aplicación parece lenta cuando la resolución está agotando el tiempo de espera. Un servicio parece caído cuando un registro apunta a una dirección retirada. Un cambio se propaga de forma desigual por el caché en varias capas, así que el sistema está roto para algunos usuarios y bien para otros, que es el patrón de fallo más difícil de diagnosticar.
Otros tres miembros de la misma familia causan una proporción similar de incidentes por la misma razón.
Certificados. Caducan. En una fecha que se conocía con años de antelación. Grandes caídas en organizaciones importantes han sido causadas exactamente por esto, repetidamente, porque la renovación era manual y la persona que lo sabía se fue.
Tiempo. El desfase del reloj rompe los protocolos de autenticación, invalida las comprobaciones de certificados, corrompe la correlación de registros y hace que los sistemas distribuidos se comporten de forma incoherente. Se presenta como un problema de autenticación, así que la gente investiga la autenticación.
Enrutamiento y camino. Rutas asimétricas, cambios de camino, reglas de cortafuegos añadidas para un propósito que afectan a otro. Los síntomas aparecen de forma intermitente y solo para algunas fuentes.
Lo que une a todos es que cada uno es infraestructura de la que todos dependen y que nadie posee, y cada uno produce síntomas en una capa muy alejada de la causa. Los ingenieros que saben revisar esto primero resuelven en minutos lo que de otro modo tarda un día.
Dónde encaja en el dominio
Sistemas de TI y redes informáticas es la séptima de ocho direcciones en el dominio de IA, datos y computación de Astra Trainer, y funciona como una línea de suministro para el resto de él. La computación en la nube y DevOps, la ciberseguridad y la ingeniería de plataforma reclutan todos de aquí, y todos descansan sobre la comprensión que construye esta dirección.
Conecta más directamente con ciencias de la computación para el modelo de sistema operativo y red, y con ciberseguridad, donde la capacidad de razonar sobre lo que realmente hace un sistema es el fundamento de la detección y la respuesta. Puedes ver las ocho direcciones aquí.
Resolver problemas es un método, no un talento
La capacidad más trasladable y menos enseñada de esta dirección. Se trata como algo que la gente tiene o no tiene, y es un procedimiento.
Establece qué cambió realmente. Los sistemas que funcionaban ayer y fallan hoy suelen haber cambiado, incluso cuando todos dicen que nada cambió. Despliegues, renovaciones de certificados, actualizaciones de reglas, credenciales caducadas, un disco lleno cruzando un umbral.
Define el alcance con precisión. Todos los usuarios o algunos. Todas las ubicaciones o una. Todo el tiempo o de forma intermitente. Cada respuesta elimina categorías enteras de causa, y la imprecisión aquí es por lo que las investigaciones divagan.
Trabaja a lo largo del camino. Una solicitud atraviesa una secuencia conocida de componentes. Prueba en puntos a lo largo de ella y determina dónde el comportamiento deja de coincidir con lo esperado. Esto convierte un problema abierto en una búsqueda con respuesta finita.
Cambia una cosa a la vez. Cambiar varias y ver que funciona te deja sin saber por qué, lo que significa que no puedes prevenirlo ni arreglarlo la próxima vez.
Lee los registros correctamente. No el último error, que con frecuencia es un efecto secundario, sino la primera anomalía y la secuencia a su alrededor, con las horas correlacionadas entre sistemas.
Sabe cuándo restaurar en lugar de diagnosticar. Durante una caída, restaurar el servicio e investigar después suele ser correcto. Confundir la recuperación con la causa raíz es como se repite el mismo incidente.
Enseñado de forma explícita, esto hace a los ingenieros ordinarios dramáticamente más eficaces. Dejado implícito, la gente lo desarrolla a lo largo de años o nunca.
El problema de carrera que realmente tiene esta dirección
Vale la pena nombrarlo con claridad, porque es la restricción real y no es técnica.
El trabajo de infraestructura se trata como gasto general. Aparece en los presupuestos como coste, se mide por la ausencia de problemas, y se nota casi exclusivamente cuando algo falla. Desarrollo construye cosas que se anuncian. Infraestructura mantiene las cosas funcionando, lo que no produce anuncios.
Cuatro consecuencias se derivan de esto.
El salario y el estatus van por detrás de puestos adyacentes con una dificultad comparable o menor, lo que empuja a la gente capaz fuera de la disciplina.
La inversión llega después de los incidentes y se retira después, así que la capacidad se construye de forma reactiva.
La externalización eliminó el terreno de formación. Los puestos junior donde se construía el conocimiento de infraestructura se han subcontratado en muchas organizaciones, que es el mismo bloqueo de cantera descrito en la dirección de ciberseguridad.
El conocimiento no está documentado y es personal. Qué sistemas importan, cómo es lo normal, dónde está la dependencia extraña. Se va con la persona, y quien la sustituye lo reconstruye despacio y con un coste elevado.
Una organización que quiere capacidad de nube, seguridad y plataforma debería reconocer que está infrainvirtiendo actualmente en la población de la que reclutan esas disciplinas, y que es una decisión que puede revertir de forma barata.
Los puestos, nombrados
Administradores de sistemas, en las principales plataformas.
Ingenieros y arquitectos de red.
Ingenieros de infraestructura.
Especialistas en identidad y directorio.
Ingenieros de almacenamiento y copias de seguridad, cuya importancia se vuelve obvia exactamente una vez.
Especialistas en virtualización.
Ingenieros de computación de usuario final y de endpoint.
Mesa de servicio y soporte técnico, el punto de entrada más común a todo el dominio.
Técnicos de centro de datos, una población que ha vuelto a crecer con la construcción de capacidad de cómputo.
Quién puede formarse para esto
Personal de mesa de servicio y soporte. La ruta clásica y todavía la mejor. Ya ven todo el parque, saben qué se rompe y tienen un instinto de resolución de problemas que la formación estructurada convierte en método.
Técnicos de telecomunicaciones. Hacia redes, con la capa física y de transmisión ya en la mano.
Personal militar de comunicaciones y sistemas de información. Con frecuencia excelentes, llegan con habilidad técnica y disciplina operativa a la vez.
Electricistas y técnicos de sistemas de edificios. Hacia el trabajo de centro de datos e infraestructura física.
Cualquiera que haya administrado sistemas de forma informal, en una pequeña empresa o como la persona a la que otros preguntan. Capacidad real sin reconocimiento formal.
Desarrolladores. Hacia puestos de infraestructura y plataforma, necesitando la mitad operativa que nunca se les dio.
Personas que cambian de carrera desde puestos operativos en logística, fabricación o servicios públicos, donde la disciplina de proceso y el trabajo por turnos se trasladan directamente.
Acceso, control de cambios y obligaciones de continuidad. El acceso administrativo a sistemas de producción es una posición de alto privilegio que se rige por requisitos de gestión del cambio, registro y separación de funciones, y en sectores regulados por marcos de control específicos. La capacidad de copia de seguridad y recuperación está sujeta a obligaciones legales y contractuales en muchos sectores, y las copias sin probar han fallado repetidamente cuando se necesitaban. Astra Trainer construye capacidad técnica y conciencia de dónde se aplican estas obligaciones. No confiere autorización para acceder a ningún sistema y no sustituye los requisitos de control de la organización.
Qué llevarte de esto
Las abstracciones de la nube movieron la infraestructura detrás de una interfaz sin eliminarla, lo que hizo los fallos más difíciles de localizar y a la gente capaz de localizarlos más valiosa.
La resolución de nombres, los certificados, el tiempo y el enrutamiento causan una proporción desproporcionada de caídas porque son invisibles hasta que fallan y presentan síntomas lejos de su causa.
Resolver problemas es un método enseñable en vez de un talento, y enseñarlo de forma explícita es una de las intervenciones técnicas de mayor retorno disponibles.
La restricción real aquí es el estatus y la cantera más que la demanda, y la externalización eliminó los puestos junior donde se construía este conocimiento.
Y todo equipo de nube, DevOps y seguridad recluta de esta población. Infrainvertir aquí es infrainvertir en todos ellos.
¿La nube volvió obsoletas las habilidades de infraestructura?
No. Movió la infraestructura detrás de una interfaz. Las redes, los sistemas operativos, la resolución de nombres y el almacenamiento siguen existiendo y siguen fallando, y la abstracción aleja el fallo del síntoma, lo que hace más difícil diagnosticarlo.
¿Por qué el DNS, los certificados y el tiempo causan tantas caídas?
Porque todo depende de ellos, nadie los posee, son invisibles mientras funcionan, y sus fallos producen síntomas en una capa completamente distinta. La caducidad de certificados en particular ha causado repetidas grandes caídas en fechas conocidas con años de antelación.
¿Se puede enseñar a resolver problemas?
Sí. Establece qué cambió, define el alcance con precisión, prueba a lo largo del camino de la solicitud, cambia una cosa a la vez, lee los registros desde la primera anomalía en lugar del último error, y distingue restaurar el servicio de encontrar la causa raíz.
¿Por qué se infravalora la infraestructura?
Porque se mide por la ausencia de problemas y solo se nota durante los fallos, así que aparece en los presupuestos como coste. El salario y el estatus van por detrás de puestos adyacentes, la inversión llega de forma reactiva tras los incidentes, y la externalización eliminó los puestos junior que formaban la habilidad.
¿Quién convierte bien hacia puestos de infraestructura?
El personal de mesa de servicio y soporte primero, luego técnicos de telecomunicaciones hacia redes, personal militar de comunicaciones, electricistas hacia trabajo de centro de datos, administradores informales, y desarrolladores que necesitan la mitad operativa.
