avance
Todavía estamos trabajando en esta característica, ¡pero nos encantaría que la probaras!
Esta característica se proporciona actualmente como parte de un programa de vista previa de conformidad con nuestras políticas de prelanzamiento.
Cuando se activa una alerta por un pico de latencia o un aumento de errores, su primer desafío es encontrar dónde reside el problema. En lugar de mantener su contexto de investigación, el flujo de trabajo estándar lo deja en una lista sin filtrar de miles de trazas — lo que lo obliga a reconstruir filtros manualmente y analizar los datos para encontrar la única traza que muestra el problema.
Intelligent Exemplar (IE) elimina esa búsqueda. Conserva el contexto exacto de su clic, muestra algorítmicamente las trazas que mejor representan la anomalía y lo dirige directamente al span que falla — para que pase del pico al span raíz en clics en lugar de horas.
Una vez que haya identificado el span que falla, use el Análisis de correlación de atributos para responder por qué está fallando — al comparar estadísticamente sus trazas anómalas con una línea de base saludable y mostrar los atributos específicos que causan el problema.
Cómo funciona Intelligent Exemplar
IE combina tres comportamientos para cerrar la brecha entre una métrica de alto nivel y la traza a nivel de código exacta que necesita:
Preservación del contexto Cuando hace clic en una ventana de tiempo en un gráfico de errores o latencia compatible, Intelligent Exemplar captura todo lo que está dentro del alcance en ese momento: la entidad, el rango de tiempo exacto, cualquier filtro activo como transaction.name o error.class y las facetas seleccionadas. Estos se pasan de forma nativa al backend. Nunca se le dirige a una lista de trazas genérica y sin filtrar.
Priorización algorítmica de trazas En lugar de mostrar una muestra aleatoria u ordenada cronológicamente, Intelligent Exemplar evalúa el conjunto de datos de trazas completo y muestra una lista seleccionada de hasta 500 trazas que mejor representan la anomalía. Las trazas fragmentadas se filtran automáticamente. Las trazas se ponderan hacia las ocurrencias que caen dentro de la ventana del pico. Si una sola variable —como un solo nombre de transacción, host o versión de despliegue— representa más del 60 % de las trazas anómalas, se muestra automáticamente como el punto de partida sugerido.
Navegación de span anómalo Cuando selecciona una traza de la lista, la UI navega directamente al span anómalo — no al span raíz, no al span más lento en general, sino al span que más se desvía del comportamiento de la línea de base para esa operación. En una cascada de 200 spans que cruza múltiples servicios descendentes, esto elimina el recorrido manual requerido para localizar dónde salieron mal las cosas.
Requisitos
Antes de usar Intelligent Exemplar:
- Rastreo distribuido debe estar habilitado para sus servicios.
- Cuantos más servicios en su ruta de traza estén instrumentados, más completo será el mapa de dependencias descendente. Los servicios no instrumentados crean brechas en la ruta causal.
Iniciar una investigación
Intelligent Exemplar está disponible en los gráficos de errores y latencia en tres ubicaciones:
- APM & Services > Summary: gráfico de tiempo de transacción web y el gráfico de tasa de errores
- Errors Inbox: gráficos de errores y latencia en la página de inicio de Errors Inbox
- Transactions: gráficos de errores y latencia en la página de inicio de Transactions
Los pasos son los mismos en las tres ubicaciones:
- Haga clic en el período de tiempo en el gráfico de errores o latencia que corresponde al pico que desea investigar.
- En la información sobre herramientas que aparece, seleccione Intelligent Traces.
Revisar la página de destino
Después de seleccionar la ventana del pico, la página de inicio de Intelligent Exemplar se abre con una imagen completa del comportamiento anómalo para ese servicio y rango de tiempo. No se requiere la creación de consultas ni la configuración manual de filtros —su contexto del clic ya se ha aplicado.
La página de destino tiene cuatro componentes:
Barra de resumen
Muestra el rango de tiempo, el tipo de anomalía (latencia o errores) y el número de trazas de valores atípicos identificadas para esa ventana.
Patrones que detectamos
Señales categorizadas que identifican dónde ocurre la anomalía y qué puede estar impulsándola. Puede seleccionar uno o más patrones para enfocar la lista de trazas de valores atípicos en una señal específica.
Patrón | Qué significa |
|---|---|
Latencia descendente | La latencia p95 o p99 de una dependencia se correlaciona con el pico de la entidad focal. La causa raíz probablemente se encuentre en un servicio descendente del que comenzó. |
Errores descendentes | Una tasa de errores en un servicio descendente aumentó durante el período del pico. La anomalía se está propagando desde una dependencia. |
Latencia de la entidad focal | El servicio desde el que comenzó es en sí mismo la fuente de latencia — el problema no está siendo causado por una dependencia descendente. |
Aumento de rendimiento | Un fuerte aumento en el volumen de solicitudes en la entidad focal o en una entidad descendente se correlaciona con el pico de latencia o errores. La anomalía puede ser inducida por la carga en lugar de una falla de código o infraestructura. |
Sugerencia
Si un solo patrón representa más del 60 % de las trazas anómalas, Intelligent Exemplar lo selecciona automáticamente como el punto de partida sugerido. Puede deseleccionarlo y elegir un patrón diferente para explorar hipótesis alternativas.
Trazas de valores atípicos
La lista clasificada de trazas que exhiben un comportamiento anómalo dentro de la ventana seleccionada. Las trazas se ordenan por su contribución al pico. Seleccione cualquier traza para abrirla y navegar directamente al span anómalo.
Gráfico de dispersión
Una comparación visual de las trazas de valores atípicos con todas las demás trazas en la ventana de tiempo.
- X-axis: tiempo dentro de la ventana seleccionada
- Y-axis: duración de la traza (para investigaciones de latencia) o recuento de errores
- Outlier traces se trazan de forma distinta a la serie de línea de base de All Traces
Utilice el gráfico de dispersión para confirmar que las trazas de valores atípicos se agrupan en un clúster alrededor de la ventana del pico en lugar de distribuirse aleatoriamente en todo el rango de tiempo. Un clúster estrecho confirma que la anomalía está limitada en el tiempo y que las trazas seleccionadas son genuinamente representativas del pico.
Inspeccionar el span anómalo
Al seleccionar una traza de la lista de valores atípicos, se abre el panel de detalles de la traza. Intelligent Exemplar no lo lleva al span raíz —navega directamente al span que más se desvía del comportamiento esperado de la línea de base para esa operación.
Esto es más importante en trazas profundas de múltiples servicios. En una cascada de 200 spans que cruza cinco servicios descendentes, el span anómalo puede estar oculto a varias capas de profundidad en una dependencia de la que no sospechaba inicialmente. Intelligent Exemplar lo dirige allí automáticamente.
Desde el span anómalo, puede:
- Revise los atributos del span para ver los valores que se desvían de la línea de base
- Navegue a la entidad propietaria del span para ver su resumen de APM
- Vea los spans circundantes en la cascada para obtener contexto adicional
- Ejecute el Análisis de correlación de atributos para identificar los pares atributo-valor específicos que causan la anomalía — como una versión de despliegue, un host o una clase de error
Para obtener una guía completa sobre cómo trabajar con los detalles de la traza y los atributos del span, consulte Comprender la página de la UI de detalles de la traza.
Comprender la correlación descendente
Cuando la anomalía se origina en una dependencia descendente, Intelligent Exemplar mapea la ruta de propagación causal a través de su gráfico de dependencia de servicios.
El sistema analiza automáticamente los patrones de latencia y errores correlacionados en las entidades descendentes y calcula la contribución de cada vía a la falla agregada.
Sugerencia
Una instrumentación más completa en toda la ruta de su traza produce una atribución descendente más precisa. Si un servicio descendente no está instrumentado, su contribución no aparecerá en el mapa de correlación.
Que sigue
- Identifique la causa raíz: ejecute el Análisis de correlación de atributos para identificar los pares atributo-valor específicos — como una versión de despliegue, un host, una región o una clase de error — responsables de la anomalía.
- Administrar el volumen de trazas: consulte Controlar la ingesta de datos de rastreo distribuido para administrar los costos de ingesta de trazas durante y después de un incidente.
- Ajustar el muestreo: consulte Configurar el muestreo para ajustar las tasas de muestreo para el servicio afectado.