Saludos amigos, hace tres años os conté cómo activar notificaciones en Microsoft Teams para nuestros Grafanas. Es un post con muchas visitas, pero sin duda necesitaba ya una actualización.
Desde Grafana v8, Grafana introdujo un sistema mucho más avanzado para lla gestión de alarmas. Mucho más avanzado, pero si cabe algo más complejo, es por ello que conozco casos que no han dado el salto a estas notificaciones todavía y siguen usando viejos scripts u otras maneras menos eficaces. Espero que después del post de hoy, tengáis ganas de darle otro vistazo, y otra oportunidad.
Grafana Alerting – Qué es
Las alertas de Grafana nos permiten conocer los problemas de nuestros sistemas momentos después de que se produzcan. Podemos crear, gestionar y actuar sobre nuestras alertas en una vista única y consolidada, y además mejorar la capacidad de nuestro equipo para identificar y resolver problemas rápidamente.
Grafana Alerting está disponible para Grafana OSS, Grafana Enterprise o Grafana Cloud. Con las reglas de alerta Mimir y Loki podemos ejecutar expresiones de alerta más cerca de nuestros datos y a escala masiva, todo ello gestionado por la interfaz de usuario de Grafana con la que ya estás familiarizado.
Yo en mi caso utilizo InfluxDB v2, con lo que los ejemplos que hoy os mostraré están más pensados para InfluxDB, pero la lógica es igual para Loki, Mimir, etc. Os dejo un interesante diagrama, que viene dentro del producto, para que comprendamos mejor el flujo de datos desde que una alarma se genera, hasta que se entrega:
Grafana Alerting – Data sources
Cuando hablamos de data sources, u orígenes de datos, esto es necesario para las consultas a información. Es algo primordial que sin ello no podríamos ni tener dashboards 🙂 Seguramente ya tengáis data sources configurados, pero por si acaso, os dejo la lista completa que soporta Grafana hoy en día:
- AWS CloudWatch
- Azure Monitor
- Elasticsearch
- Google Cloud Monitoring
- Graphite
- InfluxDB
- Loki
- Microsoft SQL Server MSSQL
- MySQL
- Open TSDB
- PostgreSQL
- Prometheus
- Jaeger
- Zipkin
- Tempo
- Testdata
Una lista realmente extensa, en nuestro caso, vamos a ver InfluxDB. En caso de que no tuvieráis instalado InfluxDB v2.0, os dejo el paso a paso para que lo tengáis funcionando realmente rápido:
Una vez tenemos data sources, tendremos ya nuestros paneles y dashboards favoritos, vamos a crear alertas sobre información que conocemos.
Grafana Alerting – Alert rules
Como el propio nombre indica, alert rules son las reglas que queremos crear para que se genera una alerta, los umbrales, resultados específicos, etc. Voy a coger como ejemplo un viejo conocido por todos vosotros, la temperatura de un servidor. En mi caso quiero monitorizar todo de un tirón, todas las métricas de temperatura de un servidor en concreto:
La consulta a InfluxDB v2.0 con Flux es la siguiente:
from(bucket: v.defaultBucket) |> range(start: v.timeRangeStart, stop: v.timeRangeStop) |> filter(fn: (r) => r["_measurement"] == "ipmi_sensor") |> filter(fn: (r) => r["server"] == "192.168.1.61") |> filter(fn: (r) => r["unit"] == "degrees_c") |> filter(fn: (r) => r["_field"] == "value") |> filter(fn: (r) => r["name"] == "cpu_temp" or r["name"] == "dimma2_temp" or r["name"] == "dimmb2_temp" or r["name"] == "peripheral_temp" or r["name"] == "system_temp" or r["name"] == "vrmab_temp" or r["name"] == "vrmcpu_temp") |> aggregateWindow(every: v.windowPeriod, fn: mean, createEmpty: false) |> yield(name: "mean")
Como podéis ver, podríamos ser algo más granulares con la consulta y solamente preocuparnos por la CPU, o por la temperatura de un módulo de RAM, etc. ¡Importante! Las alarmas solo pueden ser generadas para consultas sin variables, lo que una vez nos puede limitar un poco, pero claro es que hay que ir a tiro acertado cuando se genera una alarma, con lo cuál comprendo esta limitación.
Bueno que me enrollo, si hacemos click en el panel que nos gusta, y no tiene variables, podremos ver la pestaña de Alert, al hacer click veremos lo siguiente:
Paso 1 – Consulta al datasource y condiciones, o umbrales
Una vez más, podremos ver una consulta A, desde un datasource llamado InfluxDB (el mío que tengo por defecto). Pero además, veremos una consulta B que se llama expression, y en ella configuraremos el umbral exacto que queremos que valide contra la consulta.En mi caso, muy sencillo, cualquiera de esas temperaturas, cuando es más de 40 en su último resultado. A su vez, le diremos que la condición para la alerta está vinculado a la expression.
Paso 2 – Intervalo de evaluación de la alarma
Ahora podremos ser más granulares, o poner más tiempo. Yo quiero que compruebe cada minuto si el umbral ha sido alcanzado, y que al menos se haya superado durante 5 minutos para recibir una alarma. Como hablo de temperatura yo creo que es suficiente, pero podéis configurarlo a vuestro gusto.
Paso 3 – Detalles de la alarma en sí
En este paso, tendremos que introducir un nombre para la alarma, en mi caso he sidop muy genérico, pero seguramente os gustaría aquí añadir algo que identifique al servidor, etc. Además tendremos que seleccionar una carpeta donde se guardará esta alerta, y un grupo.
Es curioso, pero en esta sección no se genera ninguna notificación. En esta sección añadiremos una label/etiqueta que nos guste, en mi caso severity = error que posteriormente será usada en las políticas de notificación.
¡Ya hemos terminado de configurar nuestra alerta! Vamos al siguiente paso.
Grafana Alerting – Contact points
Aquí es donde definiremos los diferentes puntos de contacto, esto pueden ser direcciones de email, canales de telegram, slack, Microsoft Teams y mucho más.
Añadiendo un canal de Microsoft Teams como contact point
Vamos a hacer click en “New contact point” para crear un nuevo registro:
Añadiremos un nombre a nuestro contact point, que sea descriptivo para vosotros. Además de ello, seleccionaremos que el tipo es Microsoft Teams, e introduciremos la URL del WebHook. Pero Jorge, nose cómo crear un WebHook en mis canales. Una vez terminamos, os recomiendo hacer click en Test:
Si todo ha ido bien, podremos ver un nuevo mensaje en nuestro canal de Microsoft Teams:
Grafana Alerting – Notification policies
Pues hemos llegado a la última parte, ya tenemos alertas que queremos, en mi caso temperatura de un servidor en todos sus componentes, tenemos también a donde queremos mandar las alarmas (recordar a un canal de Teams), y nos queda crear el flujo, o políticas, que lanze las alarmas. Para ello, usaremos esas labels, etiquetas, que definimos en nuestras alarmas, por ejemplo:
- Usar las labels que sean severity = error, y mandame las alarmas que usen este label al contact point Microsoft Teams.
Grafana Alerting – Comprobando que todo ha ido bien
La alarma se ha producido durante un espacio en tiempo superior a los cinco minutos y se ha generado una alerta, ya que ha pasado de estado processing a firing, el flujo de notificaciones ha comprobado que el label que tenía esta alarma tiene un contact point y ha lanzado una notificación:
Si nos fueramos a nuestro panel de Alarmas de Grafana, también podríamos ver todas las alarmas que estan en estado Firing, Normal o Pending, a más alarmas, una visualización mucho más bonita:
Arriba tenéis el ejemplo sencillo que hemos creado paso a paso, y aquí os dejo una captura con muchas más alertas, y lo útil que son:

Conclusiones y mucho más
El nivel de alarmas de Grafana es para un usuario medio/avanzado, ya que no hay nada que con un simple drill down podamos configurar. Tenemos que manejar las consultas de datos, que dependiendo del datasource pueden ser más amigables (como por ejemplo el datasource de Azure, o Prometheus, o InfluxDB v1.8), o mucho más ásperas como es InfluxDB v2 el cuál es todo consultas a mano dentro de Grafana, tengo que reconocer que es complicado. Algo menos complicado si ya tuvieramos al menos los paneles con las consultas que queremos.






Leave a Reply