• Skip to main content
  • Skip to secondary menu
  • Skip to primary sidebar
El Blog de Jorge de la Cruz

El Blog de Jorge de la Cruz

El Blog de Jorge de la Cruz - Todas las novedades sobre VMware, Veeam, InfluxData, Grafana, Zimbra, etc.

  • Home
  • VMware
    • VMworld
    • VMware vSphere 6.7
    • VMware vSphere 6.5
  • Veeam
    • Resumen Contenido 2021
    • Veeam v11
      • Continuous Data Protection (CDP
      • Ransomware Protection
      • Archive Tier
      • Mejoras en Instant Recovery
      • Veeam Agent for Mac
      • Veeam Backup for AHV v2.1
    • Veeam Backup for Microsoft Office 365
      • 1 – Razones para proteger nuestra información en Microsoft Office 365
      • 2 – Componentes lógicos de Veeam Backup for Microsoft Office 365 2.0
      • 3 – Instalación paso a paso de Veeam Backup for Microsoft Office 365 v2.0
      • 4 – Configuración inicial de Veeam Backup for Microsoft Office 365 v2.0
      • 5 – Creando trabajos de copia en Veeam Backup for Microsoft Office 365 v2.0
      • 6 – Restaurando elementos en Veeam Backup for Microsoft Office 365 v2.0
    • Veeam Backup for AWS
      • Veeam: Veeam anuncia Veeam Backup for AWS Free Edition
      • Veeam: Cómo Desplegar Veeam Backup for AWS – paso a paso
      • Veeam: Vistazo en profundidad al nuevo Veeam Backup for AWS – Creación de Políticas de Backup y Restauración
      • Veeam: Cómo conectar nuestro Veeam Backup & Replication a Veeam Backup for AWS
    • Veaam ONE
      • En busca del Dashboard perfecto: Veeam ONE – Parte I – Introducción a Veeam ONE
      • En busca del Dashboard perfecto: Veeam ONE – Parte II – Descarga e Instalación de Veeam ONE
      • En busca del Dashboard perfecto: Veeam ONE – Parte III – Añadir una Infraestructura de VMware vSphere a Veeam ONE
      • En busca del Dashboard perfecto: Veeam ONE – Parte IV – Añadir una Infraestructura de Veeam Backup and Replication a Veeam ONE
      • En busca del Dashboard perfecto: Veeam ONE – Parte V – Realizando troubleshooting de vSphere usando Veeam ONE Monitor
      • En busca del Dashboard perfecto: Veeam ONE – Parte VI – Realizando troubleshooting de Veeam Backup and Replication usando Veeam ONE Monitor
      • En busca del Dashboard perfecto: Veeam ONE – Parte VII – Vistazo profundo a los Dashboards en Veeam ONE Reporter
      • En busca del Dashboard perfecto: Veeam ONE – Parte VIII – Vistazo profundo a Reportes en Veeam ONE Reporter
      • En busca del Dashboard perfecto: Veeam ONE – Parte IX – Chargeback para crear reportes de coste de nuestra Infraestructura
    • Veeam Availability Console
      • 1 – Teoría e información útil sobre el producto
      • 2 – Instalación de Veeam Availability Console
      • 3 – Configuración y conexión con VBR Server
      • 4 – Administración centralizada de Veeam Backup Agents
      • 5 – Backup de Agentes a diferentes destinos, SMB, Repositorio Veeam o Cloud Connect
      • 6 – Reportes de Backup de Veeam Agent y Veeam Backup and Replication
      • 7 – Manejando la Facturación de Veeam Agents, Backup and Replication y Cloud Connect
    • Backup y restore de cargas de trabajo a Microsoft Azure
      • 1 – Introducción
      • 2 – Conectividad entre nuestro Datacenter y Microsoft Azure
      • 3 – Desplegar Veeam Backup and Replication en Microsoft Azure
      • 4 – Configuración en nuestro Datacenter para backup a Microsoft Azure
      • 5 – Restaurando a Microsoft Azure, desde Microsoft Azure
      • 6 – Migrar cargas de trabajo desde Microsoft Azure hacía nuestro Datacenter
    • Veeam v9.5 Update 4
      • Veeam Cloud Tier
        • Cómo controlar el ancho de banda en Veeam Cloud Tier
      • Secure Restore y Staged Restore
      • Mejoras en Veeam Agent Management
      • Veeam Community Edition
      • Actualizar Veeam Enterprise Manager y Veeam Backup and Replication a la última versión
      • VeeamONE con Intelligent Diagnostics, Remediation actions, Business View 2.0 y Application Monitoring
    • VeeamON 2022
      • Novedades en Veeam ONE v12
    • VeeamON 2021
      • VBO v6 – Self-Service y Backup Copy Glacier-Azure Archive
    • VeeamON 2020
      • Veeam Backup for AWS v2.0
    • VeeamON 2019
      • Veeam Availability Orchestrator v2.0 – ¡novedades!
    • VeeamON 2017
      • Sesiones recomendadas
      • Día I – Veeam Availability Suite v10 – ¡novedades!
      • Día II – Veeam Azure PN (Powered Network), Scale-out Archive Tier y mucho más
    • VeeamON 2015
      • VeeamON 2015 volverá a Las Vegas en el único Evento sobre Disponibilidad en el Data Center
      • Completo resumen, keynotes e imágenes
      • vBrownBag – Jorge de la Cruz – Stop sending postcards to your customers
  • Zextras
  • PRTG
  • Office 365
    • Microsoft – Añadiendo nuestro dominio a Office 365, configuración de DNS y migración de actual Mailbox
    • Veeam: Usando Microsoft Office 365 para nuestras notificaciones por correo electrónico
    • PRTG: Usando Microsoft Office 365 para nuestras notificaciones por correo electrónico
  • Zimbra
    • Instalación
      • Instalando Zimbra 8.7.6 sobre Ubuntu 14.04 LTS – ¡con Chat y Drive!
      • Amazon Lightsail para instalar Zimbra Collaboration 8.7.1, Parte II
      • Amazon Lightsail para instalar Zimbra Collaboration 8.7.1, Parte I
      • Instalando Zimbra 8.7.x con un solo comando, incluye Chat y Drive
  • Linux
    • InfluxDB, Grafana y Telegraf
      • 1 – Instalación y configuración de los components
      • 2 – Instalar agente en Linux
      • 3 – Integración con PRTG
      • 4 – Instalar agente Telegraf en Nodos remotos Windows
      • 5 – Activar inputs específicos, Red, MySQL/MariaDB, Nginx
      • 6 – Monitorizando Veeam
    • Ansible y Zabbix
      • 1 – Inicio
      • 2 – Instalación de Ansible e integración con Active Directory
      • 3 – Configuración de AutoDiscovery en Zabbix
      • 4 – Instalación del agente de Zabbix en Windows
      • 5 – Instalación del agente de Zabbix en Linux y Auto Remove en Zabbix
    • Jenkins
      • 1 – Inicio
      • 2 – Instalación de Jenkins en Ubuntu
      • 3 – Instalando nuestro primer plugin
      • 4 – Sincronización NTP de Linux
      • 5 – Añadir un Slave Windows a Jenkins
      • 6 – Ejecutar tareas en Linux
      • 7 – Ejecutar tareas en Windows
    • Kubernetes
      • 1 – Introducción a Kubernetes
      • 2 – Instalación paso a paso
      • 3 – RollingUpdate con Kubernetes
      • 4 – Dashboard
      • 5 – Volúmenes NFS
      • 6 – Registry
      • 7 – Traefik
      • 8 – Systemd con Traefik y Proxy de Kubernetes
      • 9 – Heapster Influx Grafana
      • 10 – Labels de Kubernetes
      • 11 – API: Swagger
      • 12 – API: Creando nuestro primer POD
  • Contribuidores
    • Acerca de Jorge
    • Acerca de Oscar Mas
      • Clúster SQL
        • 1 – Introducción
        • 2 – Preparación de los equipos virtuales
        • 3 – Instalación del Clúster de Microsoft
        • 4 – Instalación de SQL Server para Clúster de Microsoft
        • 5 – Configuración de nuestro Clúster de SQL
        • 6 – Monitorización de Clúster de SQL con Zabbix
        • 7 – Actualizando clúster de SQL

En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXXV (Monitorizando GPU)

24 May, 2021 - Escrito en: opensource

Saludos amigos, llevo desde 2016 mostrando todas las bondades de Telegraf, InfluxDB, y Grafana. Y no me canso ya que cada día o semana, tengo nuevas tecnologías, o hardware, que quiero monitorizar para tener un control más detallado de todo mi entorno.

Hace apenas unos días adquiría una NVIDIA RTX 3090, una de las mejores gráficas que podemos encontrar a día de hoy, y claro, lo primero que pensé fue, necesito monitorizar este hardware que ha costado más que cualquiera de mis servidores, los cuales ya monitorizo sin problemas.

Dashboard para GPU NVIDIA (ampliable a AMD con un poco de trabajo)

Cuando terminemos la entrada tendremos algo similar a ese Dashboard que te permitirá visualizar:

Dashboard – Resumen

Este dashboard, muy útil y potente nos muestra los siguientes detalles:

  • Filtro por Host y por tipo de GPU – En caso de que tengamos varios PC/VDI, nos mostrará el modelo también.
  • Temperaturas  – La temperatura de la GPU, y muy importante (solo en 3070, 3080 y 3090) la temperatura de VRAM, más conocido como GPU Memory Junction.
    • Además de tenerlas para ver la más reciente, hay una gráfica con el historial de la misma.
  • Ventiladores  – El procentaje al que están girando nuestros ventiladores, en caso de que tengamos más ventiladores, tendréis que modificar la query.
  • Velocidades  – El dashboards nos muestra las velocidades actuales del reloj de la GPU, la memoria, etc.
  • Consumo – El consumo en porcentaje de nuestra GPU y de su memoria.
  • Consumo energético – Consumo energético en Watts, que seguro os viene bien para calcular cuanto estáis gastando.
    • Además de tenerlo para ver el más reciente, hay una gráfica con el historial del mismo.
  • Mining – Es algo simple, si la memoria está al 100% constante, el minado está activo. Ninguna otra aplicación pone la memoria al 100% por tan largo periodo de tiempo.

Topología con todos los componentes lógicos

Esta entrada es diferente a las anteriores, incluye más componentes, algunos de pago como es HWInfo64 Pro, os dejo la imagen completa aquí:Necesitaremos telegraf para Windows, supongo que ya habréis seguido los pasos para enviar información a InfluxDB, además, necesitaremos tener instalados los drivers de NVIDIA, que incluyen una pequeña aplicación llamada nvidia_smi, y por último, necesitamos también HWInfo64 Pro, que nos permite usar shared memory, y Remote Sensor Monitor que presenta los datos en una web local en formato JSON.

Pequeños requisitos del sistema antes de continuar

Necesitaremos comprobar que tenemos NVIDIA smi instalado, para ello desde un CMD, nos vamos al siguiente directorio C:\Program Files\NVIDIA Corporation\NVSMI> y lanzamos el ejecutable, para ver el resultado:

C:\Program Files\NVIDIA Corporation\NVSMI>nvidia-smi.exe
Sun May 23 12:30:07 2021
+-----------------------------------------------------------------------------+
| NVIDIA-SMI 466.27       Driver Version: 466.27       CUDA Version: 11.3     |
|-------------------------------+----------------------+----------------------+
| GPU  Name            TCC/WDDM | Bus-Id        Disp.A | Volatile Uncorr. ECC |
| Fan  Temp  Perf  Pwr:Usage/Cap|         Memory-Usage | GPU-Util  Compute M. |
|                               |                      |               MIG M. |
|===============================+======================+======================|
|   0  NVIDIA GeForce ... WDDM  | 00000000:02:00.0  On |                  N/A |
| 70%   45C    P2   261W / 280W |   8576MiB / 24576MiB |    100%      Default |
|                               |                      |                  N/A |
+-------------------------------+----------------------+----------------------+

Todo bien, vamos al siguiente paso, instalamos la última versión de HWInfo64, necesitamos comprar una licencia y ponerla en la carpeta donde hemos instalado HWInfo64. Si ejecutamos la aplicación, en sensor mode only, veremos lo siguiente, datos muy precisos e interesantes sobre nuestra GPU:

Por último, tendremos que habilitar que podemos conectarnos a la shared memory, tan sencillo cómo hacer click en el icono y activarlo:

Minimizamos ahora la aplicación, y descargamos el Addon llamado Remote Sensor Monitor desde su web oficial:

Desde una CMD, lanzamos el Remote Sensor Monitor con los siguientes parámetros:

"Remote Sensor Monitor.exe" --gpuz=0 --aida64=0 --ohm=0

Esto nos mostrará el siguiente mensaje:

Starting Remote Sensor Monitor on port 55555...

HWiNFO process found! Enabling HWiNFO...

Please wait for the web server to start.......Web server running

Press [ENTER] to quit

Lo cuál son fantásticas noticias, ya desde nuestro navegador, vamos a http://localhost:55555/ y veremos lo siguiente:

Configuración del fichero telegraf.conf

Tenemos casi todo listo, tenemos un último paso, activar estos dos plugins dentro del fichero de configuración de telegraf.conf, tan sencillo como añadir al final del todo lo siguiente:

# Pulls statistics from nvidia GPUs attached to the host
# Pulls statistics from nvidia GPUs attached to the host
[[inputs.nvidia_smi]]
  ## Optional: path to nvidia-smi binary, defaults to $PATH via exec.LookPath
   bin_path = "C:\\Program Files\\NVIDIA Corporation\\NVSMI\\nvidia-smi.exe"

  ## Optional: timeout for GPU polling
  # timeout = "5s"
  
[[inputs.http]]
#URL for ESXi for ARM data in JSON format
urls = ["http://localhost:55555/"]
method = "GET"
#Overwrite measurement name from default `http` to `hwinfo_stats`
name_override = "hwinfo_stats"

#Exclude url and host items from tags
tagexclude = ["url"]

#Data from HTTP in JSON format
data_format = "json"

#Set hwinfo metadata as tags
tag_keys = ["SensorName", "SensorUnit"]

#JSON values to set as string fields
json_string_fields = ["SensorValue"]

insecure_skip_verify = true

Esto es todo, reiniciamos, o arrancamos el servicio de telegraf y nos vamos a grafana.

Grafana Dashboards

He creado un Dashboard desde cero seleccionando las mejores solicitudes a la base de datos, terminando los colores, pensando en los gráficos y en cómo mostrarlos, y todo está automatizado para que se ajuste a nuestro entorno sin ningún problema y sin tener que editar nada manualmente. El Dashboard se puede encontrar aquí, una vez importado, puedes usar los menús desplegables superiores para seleccionar entre diferentes pcs, tarjetas, etc:

  • https://grafana.com/grafana/dashboards/14478

Importar el Dashboard de Grafana de manera sencilla

Para que no tengas que perder horas configurando un nuevo Dashboard, e ingiriendo y depurando lo que quieras, ya he creado un maravilloso Dashboards con todo lo que necesitas para monitorizar nuestro entorno de una forma muy sencilla, se verá como la imagen que te mostré arriba. Selecciona el nombre que quieras e introduce el ID: 14478, que es el ID único del Dashboard, o la URL:

  • https://grafana.com/grafana/dashboards/14478

Con los menús de arriba, podremos movernos entre GPU, PCs, etc.:Por favor, dejar vuestros comentarios aquí, o en GitHub. ¡Muchas gracias por la lectura!

Nada más amigos, espero que os guste, y me gustaría dejaros la serie completa aquí:

  • En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte I (Instalando InfluxDB, Telegraf y Grafana)
  • En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte II (Instalar agente Telegraf en Nodos remotos Linux)
  • En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte III Integración con PRTG
  • En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte IV (Instalar agente Telegraf en Nodos remotos Windows)
  • En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte V (Activar inputs específicos, Red, MySQL/MariaDB, Nginx)
  • En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte VI (Monitorizando Veeam)
  • En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte VII (Monitorizar vSphere)
  • En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte VIII (Monitorizando Veeam con Enterprise Manager)
  • En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte IX (Monitorizando Zimbra Collaboration)
  • En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte X (Grafana Plugins)
  • En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XI
  • En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XII – Plugin nativo de Telegraf para vSphere
  • En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XIII – Veeam Backup for Microsoft Office 365
  • En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XIV – Veeam Availability Console
  • En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XV – Monitorización IPMI de nuestros Hosts ESXi
  • En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XVI – Rendimiento y seguridad avanzada de Veeam Backup for Microsoft Office 365
  • En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XVII – Mostrando los Dashboards en dos monitores usando Raspberry Pi 4
  • En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XVIII – Monitorizar temperatura y estado de Raspberry Pi 4
  • En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XIX (Monitorizando Veeam con Enterprise Manager) Shell Script
  • En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XX (Monitorizando Certificados SSL x.509)
  • En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXI (Monitorizando HTTP Responses)
  • En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXII (Monitorizando Cloudflare con Mapa)
  • En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXIII (Monitorizando WordPress con Jetpack RESTful API)
  • En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXIV (Monitorizando de Veeam for Microsoft Azure)
  • En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXV (Monitorizando Consumo Eléctrico)
  • En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXVI (Monitorizando Veeam Backup for Nutanix)
  • En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXVII (Monitorizando ReFS y XFS (block-cloning y reflink)
  • En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXVIII (Monitorizando HPE StoreOnce)
  • En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXIX (Monitorizando PiHole)
  • En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXX (Monitorizando Veeam Backup for AWS)
  • En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXXI (Monitorizando Unifi Protect)
  • En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXXII (Monitorizando Veeam ONE – experimental)
  • En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXXIII (Monitorizando NetApp ONTAP)
  • En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXXIV (Monitorizando Runecast)
  • En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXXV (Monitorizando GPU)

Filed Under: opensource Tagged With: gpu grafana, gpu temperature grafana, nvidia grafana

Reader Interactions

Leave a Reply Cancel reply

Your email address will not be published. Required fields are marked *

This site uses Akismet to reduce spam. Learn how your comment data is processed.

Primary Sidebar

  • Email
  • GitHub
  • LinkedIn
  • RSS
  • Twitter
  • YouTube

Gold Partners

Silver Partners

Libros Gratuitos

Cloud por vExperts
VMware por vExperts

VMware vExpert

Puesto 16 en Top vBlog

Calendario de Posts

May 2021
M T W T F S S
 12
3456789
10111213141516
17181920212223
24252627282930
31  
« Apr   Jun »

Disclaimer

Todas las opiniones expresadas en este sitio son las mías propias y no representan las opiniones de ninguna compañía con la que haya trabajado, esté trabajando o vaya a estar trabajando.

Copyright © 2026 · El Blog de Jorge de la Cruz