15:30–16:00
Salón Principal
Agentes de IA en el bucle de remediación: cómo bajar el MTTR sin perder el control del cluster
El MTTR (Mean Time To Recovery) sigue siendo el indicador que más duele en operaciones cloud native: la mayor parte del tiempo de un incidente no se va en arreglar, se va en entender qué está pasando. ¿Y si un agente de IA pudiera comprimir la fase de diagnóstico de minutos (u horas) a segundos, y en algunos casos ejecutar la remediación por sí mismo?
Esta charla disecciona el patrón de agentic incident remediation sobre Kubernetes en sus dos modos: asistido (human-in-the-loop, el agente propone y el humano aprueba) y autónomo (el agente detecta, decide y remedia bajo guardrails). No es una charla sobre “la IA lo resuelve todo”: es sobre la ingeniería que hace falta para que un agente toque tu cluster de producción sin empeorar el incidente.
Veremos la anatomía completa: árbol de diagnóstico determinista, confidence scoring, acciones reversibles, rollback automático y el límite real entre lo que conviene automatizar y lo que no. Cerramos con un demo en vivo de un incidente resuelto de forma autónoma en menos de 90 segundos, y una conversación honesta sobre dónde este patrón todavía falla.
¿Qué se lleva la audiencia (key takeaways)?
1.- Cómo descomponer el MTTR e identificar dónde un agente de IA aporta valor real (spoiler: en el diagnóstico, no solo en la acción).
2.- El patrón de remediación asistida vs. autónoma: cuándo usar cada uno, y por qué la autonomía total sin guardrails es una receta para el desastre.
3.- Los guardrails que hacen segura la autonomía: confidence scoring, acciones reversibles, rollback automático, y blast radius limitado.
4.- Una arquitectura de referencia transferible: árbol de diagnóstico determinista por capas, conexión outbound (cluster privado), y failover multi-proveedor de LLM.
5.- Los límites honestos: qué tipos de incidente NO se deben automatizar, y cómo el costo y la explicabilidad condicionan el diseño.
¿Por qué este tema, por qué ahora?
La conversación sobre IA en operaciones está saturada de promesas vagas. Lo que falta son charlas que muestren la ingeniería real: los guardrails, los modos de fallo, las decisiones de diseño. Esta sesión aporta a la comunidad un marco mental y una arquitectura de referencia que cualquier equipo puede adaptar, independientemente de las herramientas que use.