Como proveedor líder de analítica de datos estratégicos y tecnología para el sector asegurador global, Verisk gestiona aplicaciones críticas para el negocio en las que el tiempo de actividad y el cumplimiento normativo son fundamentales. Sin embargo, mantener configuraciones de alertas coherentes y seguir el ritmo de las nuevas características amenazaba con saturar a los equipos de ingeniería con ruido operativo.
Al combinar AWS DevOps Agent con la plataforma de observabilidad inteligente de New Relic, Verisk creó un sistema de supervisión automatizado e inteligente. Con la sólida plataforma de datos de telemetría de New Relic como base, Verisk logró reducir considerablemente el ruido de las alertas y el tiempo medio de resolución (MTTR), e identificó importantes oportunidades de optimización de costos.
El desafío: hacer frente al ruido derivado del escalado de la infraestructura
A medida que Verisk ampliaba su entorno, las alertas de alta frecuencia y los errores intermitentes se activaban continuamente, lo que generaba fatiga por alertas y aumentaba el riesgo de que problemas críticos del sistema pasaran inadvertidos. Para escalar de forma eficaz sin tener que incorporar personal dedicado a gestionar la infraestructura de monitoreo, Verisk necesitaba una solución rápida y automatizada que permitiera subsanar las carencias de visibilidad y aislar las causas raíz.
La solución: una colaboración sinérgica basada en la telemetría de New Relic
Elliot Markowitz, vicepresidente de DevOps y control de calidad de Verisk, y su equipo hicieron frente a estos obstáculos mediante la implementación de AWS DevOps Agent como orquestador, perfectamente integrado con el servidor Model Context Protocol (MCP) de New Relic. Si bien AWS DevOps Agent actúa como el componente de primera línea para la resolución de problemas, depende en gran medida de los completos datos de telemetría de New Relic y de su infraestructura de monitoreo subyacente para funcionar. Cuando una métrica de la aplicación supera un umbral de producción, el motor de New Relic registra la anomalía y activa un incidente en PagerDuty. A continuación, PagerDuty realiza dos acciones a la vez: alerta al ingeniero de guardia y transfiere la ejecución a AWS DevOps Agent. Mientras se notifica al ingeniero, el agente utiliza el servidor MCP de New Relic para consultar la base de datos central de telemetría e identificar el momento exacto de la falla, a fin de determinar por qué se cumplieron las condiciones de alerta.
La integración establece un lenguaje semántico común entre ambos sistemas. Ahora, cuando una alerta de New Relic activa un incidente en PagerDuty, AWS DevOps Agent inicia automáticamente el análisis de la causa raíz antes de que intervenga un ingeniero. Los resultados se envían a PagerDuty y, en ocasiones, a Microsoft Teams, desde donde se envían actualizaciones a los dispositivos móviles de los ingenieros. Para reducir el ruido de alertas, Verisk también configuró el sistema para generar informes semanales de artefactos destinados a identificar el ruido generado por las alertas de alta frecuencia. Los gerentes de DevOps y Control de Calidad revisan estos informes semanalmente para silenciar las notificaciones redundantes, combinar condiciones relacionadas y optimizar los umbrales. Markowitz destacó la importancia fundamental del contexto y el mapeo de datos de New Relic para este flujo de trabajo automatizado.
"Seguimos confiando en New Relic para nuestras métricas y alertas, por lo que era fundamental que AWS DevOps Agent hablara el mismo idioma. Cuando se dispara una alerta de New Relic, AWS DevOps Agent comienza inmediatamente a diagnosticar el problema y, a menudo, antes de que intervenga un ingeniero. La información obtenida nos ayuda a resolver los problemas con mayor rapidez y menos esfuerzo. Esa integración fluida entre ambas plataformas ha agilizado nuestro proceso de investigación de incidentes y ha aportado un valor significativo a nuestro flujo de trabajo".
Impacto y resultados
Reducción considerable del ruido de las alertas y la fatiga por incidentes
Al implementar informes semanales de artefactos para filtrar el ruido, Verisk optimizó su arquitectura de alertas. El volumen total semanal de alertas se redujo aproximadamente un 59 % respecto de su máximo histórico.
Resolución más rápida de incidentes (MTTR)
Al pasar de la resolución manual de problemas al análisis automatizado de la causa raíz, Verisk mejoró considerablemente su velocidad de respuesta. El tiempo medio de resolución (MTTR) de Verisk se redujo casi un 50 %, excluidos los incidentes atípicos que requerían importantes cambios manuales de ingeniería.
Tasas de correlación de alertas sin precedentes
El motor de procesamiento de datos de telemetría agrupa con gran eficacia las alertas relacionadas derivadas de un único evento de falla. Durante un período de 12 semanas, el sistema investigó todos los incidentes de referencia y logró correlacionar un 45 % adicional de incidentes duplicados con sus causas raíz originales, lo que permitió ahorrar muchas horas de ingeniería que, de otro modo, se habrían dedicado a reconstruir manualmente la secuencia de eventos.
Optimización de la ingesta de datos y de los costos contractuales
Verisk también utilizó su integración de New Relic para auditar sus propios pipelines de datos y maximizar la eficiencia de la ingesta. El sistema detectó redundancias ocultas, como cuentas de AWS que ejecutaban simultáneamente flujos de sondeo y de métricas, un número excesivo de capturas de trazas exitosas, trazas innecesarias de comprobación del estado y otras oportunidades de optimización. A partir de esta información, Verisk pudo reducir de inmediato en un 17 % sus costos semanales de ingesta de datos de telemetría.
De cara al futuro
Con un monitoreo de infraestructura aún más estable y un equipo de ingeniería altamente productivo, Verisk se está preparando para la fase 2 de su integración. Más allá de la resolución de problemas, Markowitz y su equipo planean usar la integración de New Relic como un orquestador del ecosistema, conectándola directamente con los pipelines de CI/CD y las API internas. Para los líderes empresariales que buscan desenvolverse en una era de escalabilidad del software a niveles sobrehumanos, el éxito de Verisk demuestra que combinar un agente de automatización avanzado con la capa de telemetría inteligente de New Relic constituye una estrategia eficaz para alcanzar la excelencia operativa moderna.