Saludos amigos, llevo desde 2016 mostrando todas las bondades de Telegraf, InfluxDB, y Grafana. Y no me canso ya que cada día o semana, tengo nuevas tecnologías, o hardware, que quiero monitorizar para tener un control más detallado de todo mi entorno.
Hace apenas unos días adquiría una NVIDIA RTX 3090, una de las mejores gráficas que podemos encontrar a día de hoy, y claro, lo primero que pensé fue, necesito monitorizar este hardware que ha costado más que cualquiera de mis servidores, los cuales ya monitorizo sin problemas.
Dashboard para GPU NVIDIA (ampliable a AMD con un poco de trabajo)
Cuando terminemos la entrada tendremos algo similar a ese Dashboard que te permitirá visualizar:
Dashboard – Resumen
Este dashboard, muy útil y potente nos muestra los siguientes detalles:
- Filtro por Host y por tipo de GPU – En caso de que tengamos varios PC/VDI, nos mostrará el modelo también.
- Temperaturas – La temperatura de la GPU, y muy importante (solo en 3070, 3080 y 3090) la temperatura de VRAM, más conocido como GPU Memory Junction.
- Además de tenerlas para ver la más reciente, hay una gráfica con el historial de la misma.
- Ventiladores – El procentaje al que están girando nuestros ventiladores, en caso de que tengamos más ventiladores, tendréis que modificar la query.
- Velocidades – El dashboards nos muestra las velocidades actuales del reloj de la GPU, la memoria, etc.
- Consumo – El consumo en porcentaje de nuestra GPU y de su memoria.
- Consumo energético – Consumo energético en Watts, que seguro os viene bien para calcular cuanto estáis gastando.
- Además de tenerlo para ver el más reciente, hay una gráfica con el historial del mismo.
- Mining – Es algo simple, si la memoria está al 100% constante, el minado está activo. Ninguna otra aplicación pone la memoria al 100% por tan largo periodo de tiempo.
Topología con todos los componentes lógicos
Esta entrada es diferente a las anteriores, incluye más componentes, algunos de pago como es HWInfo64 Pro, os dejo la imagen completa aquí:
Necesitaremos telegraf para Windows, supongo que ya habréis seguido los pasos para enviar información a InfluxDB, además, necesitaremos tener instalados los drivers de NVIDIA, que incluyen una pequeña aplicación llamada nvidia_smi, y por último, necesitamos también HWInfo64 Pro, que nos permite usar shared memory, y Remote Sensor Monitor que presenta los datos en una web local en formato JSON.
Pequeños requisitos del sistema antes de continuar
Necesitaremos comprobar que tenemos NVIDIA smi instalado, para ello desde un CMD, nos vamos al siguiente directorio C:\Program Files\NVIDIA Corporation\NVSMI> y lanzamos el ejecutable, para ver el resultado:
C:\Program Files\NVIDIA Corporation\NVSMI>nvidia-smi.exe Sun May 23 12:30:07 2021 +-----------------------------------------------------------------------------+ | NVIDIA-SMI 466.27 Driver Version: 466.27 CUDA Version: 11.3 | |-------------------------------+----------------------+----------------------+ | GPU Name TCC/WDDM | Bus-Id Disp.A | Volatile Uncorr. ECC | | Fan Temp Perf Pwr:Usage/Cap| Memory-Usage | GPU-Util Compute M. | | | | MIG M. | |===============================+======================+======================| | 0 NVIDIA GeForce ... WDDM | 00000000:02:00.0 On | N/A | | 70% 45C P2 261W / 280W | 8576MiB / 24576MiB | 100% Default | | | | N/A | +-------------------------------+----------------------+----------------------+
Todo bien, vamos al siguiente paso, instalamos la última versión de HWInfo64, necesitamos comprar una licencia y ponerla en la carpeta donde hemos instalado HWInfo64. Si ejecutamos la aplicación, en sensor mode only, veremos lo siguiente, datos muy precisos e interesantes sobre nuestra GPU:
Por último, tendremos que habilitar que podemos conectarnos a la shared memory, tan sencillo cómo hacer click en el icono y activarlo:
Minimizamos ahora la aplicación, y descargamos el Addon llamado Remote Sensor Monitor desde su web oficial:
Desde una CMD, lanzamos el Remote Sensor Monitor con los siguientes parámetros:
"Remote Sensor Monitor.exe" --gpuz=0 --aida64=0 --ohm=0
Esto nos mostrará el siguiente mensaje:
Starting Remote Sensor Monitor on port 55555... HWiNFO process found! Enabling HWiNFO... Please wait for the web server to start.......Web server running Press [ENTER] to quit
Lo cuál son fantásticas noticias, ya desde nuestro navegador, vamos a http://localhost:55555/ y veremos lo siguiente:
Configuración del fichero telegraf.conf
Tenemos casi todo listo, tenemos un último paso, activar estos dos plugins dentro del fichero de configuración de telegraf.conf, tan sencillo como añadir al final del todo lo siguiente:
# Pulls statistics from nvidia GPUs attached to the host # Pulls statistics from nvidia GPUs attached to the host [[inputs.nvidia_smi]] ## Optional: path to nvidia-smi binary, defaults to $PATH via exec.LookPath bin_path = "C:\\Program Files\\NVIDIA Corporation\\NVSMI\\nvidia-smi.exe" ## Optional: timeout for GPU polling # timeout = "5s" [[inputs.http]] #URL for ESXi for ARM data in JSON format urls = ["http://localhost:55555/"] method = "GET" #Overwrite measurement name from default `http` to `hwinfo_stats` name_override = "hwinfo_stats" #Exclude url and host items from tags tagexclude = ["url"] #Data from HTTP in JSON format data_format = "json" #Set hwinfo metadata as tags tag_keys = ["SensorName", "SensorUnit"] #JSON values to set as string fields json_string_fields = ["SensorValue"] insecure_skip_verify = true
Esto es todo, reiniciamos, o arrancamos el servicio de telegraf y nos vamos a grafana.
Grafana Dashboards
He creado un Dashboard desde cero seleccionando las mejores solicitudes a la base de datos, terminando los colores, pensando en los gráficos y en cómo mostrarlos, y todo está automatizado para que se ajuste a nuestro entorno sin ningún problema y sin tener que editar nada manualmente. El Dashboard se puede encontrar aquí, una vez importado, puedes usar los menús desplegables superiores para seleccionar entre diferentes pcs, tarjetas, etc:
Importar el Dashboard de Grafana de manera sencilla
Para que no tengas que perder horas configurando un nuevo Dashboard, e ingiriendo y depurando lo que quieras, ya he creado un maravilloso Dashboards con todo lo que necesitas para monitorizar nuestro entorno de una forma muy sencilla, se verá como la imagen que te mostré arriba. Selecciona el nombre que quieras e introduce el ID: 14478, que es el ID único del Dashboard, o la URL:
Con los menús de arriba, podremos movernos entre GPU, PCs, etc.:
Por favor, dejar vuestros comentarios aquí, o en GitHub. ¡Muchas gracias por la lectura!
Nada más amigos, espero que os guste, y me gustaría dejaros la serie completa aquí:
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte I (Instalando InfluxDB, Telegraf y Grafana)
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte II (Instalar agente Telegraf en Nodos remotos Linux)
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte III Integración con PRTG
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte IV (Instalar agente Telegraf en Nodos remotos Windows)
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte V (Activar inputs específicos, Red, MySQL/MariaDB, Nginx)
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte VI (Monitorizando Veeam)
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte VII (Monitorizar vSphere)
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte VIII (Monitorizando Veeam con Enterprise Manager)
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte IX (Monitorizando Zimbra Collaboration)
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte X (Grafana Plugins)
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XI
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XII – Plugin nativo de Telegraf para vSphere
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XIII – Veeam Backup for Microsoft Office 365
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XIV – Veeam Availability Console
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XV – Monitorización IPMI de nuestros Hosts ESXi
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XVI – Rendimiento y seguridad avanzada de Veeam Backup for Microsoft Office 365
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XVII – Mostrando los Dashboards en dos monitores usando Raspberry Pi 4
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XVIII – Monitorizar temperatura y estado de Raspberry Pi 4
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XIX (Monitorizando Veeam con Enterprise Manager) Shell Script
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XX (Monitorizando Certificados SSL x.509)
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXI (Monitorizando HTTP Responses)
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXII (Monitorizando Cloudflare con Mapa)
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXIII (Monitorizando WordPress con Jetpack RESTful API)
- En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXIV (Monitorizando de Veeam for Microsoft Azure)
- En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXV (Monitorizando Consumo Eléctrico)
- En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXVI (Monitorizando Veeam Backup for Nutanix)
- En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXVII (Monitorizando ReFS y XFS (block-cloning y reflink)
- En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXVIII (Monitorizando HPE StoreOnce)
- En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXIX (Monitorizando PiHole)
- En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXX (Monitorizando Veeam Backup for AWS)
- En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXXI (Monitorizando Unifi Protect)
- En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXXII (Monitorizando Veeam ONE – experimental)
- En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXXIII (Monitorizando NetApp ONTAP)
- En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXXIV (Monitorizando Runecast)
- En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXXV (Monitorizando GPU)


Leave a Reply