Ponte en Contacto

Temario del curso

El panorama de la observabilidad con IA

  • De los paneles a las conversaciones: el cambio hacia una observabilidad aumentada por IA.
  • Capacidades de LLM relevantes para la observabilidad: resumen, razonamiento y coincidencia de patrones.
  • Patrones de arquitectura: integrar IA en pilas de observabilidad existentes.

Consulta de telemetría con lenguaje natural

  • Texto a PromQL: traducir lenguaje natural a consultas de monitoreo.
  • Consultas NL para almacenes de registros de Elasticsearch, OpenSearch y Loki.
  • Generación de SQL a partir de lenguaje natural para telemetría estructurada.
  • Construcción de un agente asistente de consultas con uso de herramientas y conciencia contextual.

Análisis de registros potenciado por LLM

  • Análisis automático y estructuración de registros con LLMs.
  • Detección de anomalías en flujos de registros utilizando similitud de embeddings.
  • Agrupamiento de registros y descubrimiento de patrones a gran escala.
  • Generación de explicaciones legibles para humanos a partir de secuencias de registros crudos.

Alertas inteligentes y enriquecimiento de incidentes

  • Correlación y deduplicación de alertas con comprensión semántica.
  • Recolección automática de contexto del incidente a partir de runbooks, incidentes pasados y documentación.
  • Encaminamiento inteligente de alertas basado en la comprensión del contenido y la experiencia del equipo.
  • Reducción del cansancio por alertas mediante reducción de ruido impulsada por IA.

Análisis de la causa raíz asistido por IA

  • Generación de hipótesis a partir de la correlación de telemetría multifuente.
  • Cadena de evidencia: conectar síntomas entre métricas, registros y trazas.
  • Resolución de problemas guiada con sesiones interactivas de diagnóstico por IA.
  • Construcción de un agente de análisis de causa raíz con investigación progresiva.

Respuesta automatizada a incidentes y comunicación

  • Generación de resúmenes de incidentes y actualizaciones de estado a partir de telemetría.
  • Borrado automatizado de postmortem con reconstrucción de cronología.
  • Comunicación con partes interesadas adaptada a audiencias técnicas y ejecutivas.
  • Sugerencia de runbooks y recomendaciones de remediación automatizada.

ML para observabilidad

  • Pronóstico de series temporales para planificación de capacidad y predicción de anomalías.
  • Modelos base para detección de anomalías en métricas sin entrenamiento previo (zero-shot).
  • Mapeo de dependencias de servicios y descubrimiento de topología basado en embeddings.
  • Entrenamiento y despliegue de modelos ligeros de ML junto a pipelines de observabilidad.

Despliegue en producción y ética

  • Consideraciones de latencia y costo para la observabilidad en tiempo real con IA.
  • Privacidad de los datos: asegurarse de que los LLMs no filtren telemetría sensible.
  • Supervisión humana: cuándo el diagnóstico por IA necesita validación del operador.
  • Medición del impacto: MTTD, MTTR y métricas de la experiencia de guardia.

Requerimientos

  • Experiencia con herramientas de observabilidad como Prometheus, Grafana, Datadog u OpenTelemetry.
  • Familiaridad con conceptos de gestión de registros y métricas.
  • Programación básica en Python para procesamiento de datos.

Público objetivo

  • Ingenieros de SRE y observabilidad adoptando herramientas mejoradas con IA.
  • Ingenieros de plataforma construyendo pipelines de monitoreo de próxima generación.
  • Líderes de DevOps evaluando la integración de LLMs en flujos de trabajo de incidentes.
 14 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas