BookinglyTech News
Software

Atlassian lanza sistema de RCA automatizado que correlaciona métricas, logs y trazas

El nuevo enfoque de Atlassian utiliza OpenTelemetry y un modelo de anomalías para generar hipótesis de causa raíz en infraestructuras cloud‑native, reduciendo el tiempo de respuesta de los incidentes.

2 min de lecturaInfoQ0 vistas

Atlassian ha presentado un método para automatizar el análisis de causa raíz (RCA) en entornos cloud‑native. La solución combina métricas, logs, trazas distribuidas y topología de servicios para generar hipótesis ordenadas sobre el origen y la propagación de fallos.

El proceso comienza filtrando el espacio de búsqueda. Con los mapas de servicio derivados de OpenTelemetry, el sistema identifica únicamente los servicios que participan en la trayectoria afectada del usuario, evitando la inspección de cada microservicio en producción. El grafo de dependencias se construye a partir de relaciones padre‑hijo entre spans de trazas, reflejando la comunicación real en vez de depender de documentación estática.

Para cada tipo de señal, se aplican detectores de anomalías distintos: métricas se analizan por cambios en tasa, error o duración; trazas se revisan por excepciones, latencia y alteraciones estructurales; logs se agrupan para detectar patrones de error nuevos o inusuales. Los resultados se normalizan en un formato común de anomalía y se correlacionan en una línea de tiempo común.

Las anomalías que ocurren en proximidad temporal se agrupan en una posible secuencia de fallos, y el algoritmo utiliza huellas digitales de secuencia para eliminar duplicados de patrones recurrentes. La causalidad se refina considerando la topología de dependencias y el orden de aparición de las anomalías, trazando hacia arriba desde los servicios afectados para identificar fuentes potenciales.

El output es un conjunto de hipótesis ordenadas, con origen probable, ruta de propagación y evidencia de telemetría. El ingeniero puede revisar la evidencia y validar el diagnóstico antes de actuar. Atlassian planea la siguiente fase: orquestación basada en LLM que iterará la investigación solicitando telemetría adicional, probando hipótesis competidoras y adaptándose a la evidencia disponible. Se advierte que se requerirán controles de límites de tasa, entornos de ejecución y procedencia de evidencia.

Este enfoque se posiciona frente a soluciones comerciales como Grafana Cloud, que usa un grafo de conocimiento, o Dynatrace, que correlaciona eventos de múltiples fuentes. La diferencia radica en la arquitectura modular de Atlassian, donde detectores de anomalías independientes alimentan una capa de correlación que entiende las dependencias de servicio.

Con la proliferación de servicios y dependencias, la capacidad de transformar miles de señales desconectadas en un número reducido de hipótesis respaldadas por datos será una herramienta valiosa para la ingeniería de fiabilidad. El reto será mantener la explicabilidad y la confianza del ingeniero.

Enlaces de referencia

[Mapa de servicio OpenTelemetry] (https://opentelemetry.io/) [Documentación de Dynatrace sobre RCA] (https://docs.dynatrace.com/docs/dynatrace-intelligence/root-cause-analysis/event-analysis-and-correlation)