Saludos amigos, hoy os traigo otra de esas joyas que tanto os gustan. Además de ser gratuito y poder desplegarlo en pocos minutos, es que tiene un potencial que ya quisieran muchas herramientas comerciales.
Se trata del Dashboard para vSphere que os mostré un tiempo atrás, pero de manera mejorada, tanto a la hora de recopilar información, como en la manera que se muestra el Dashboard en Grafana, cuando terminemos (en muy pocos minutos), podremos tener unos Dashboards (en plural amigos) similares a estos:
vSphere Overview Dashboard
vSphere Hosts Overview Dashboard
vSphere Datastore Overview
vSphere VM Overview
Plugin oficial de Telegraf para VMware vSphere
Me comentaba mi amigo Craig, que había salido hace unos días un plugin oficial por parte de Telegraf para vSphere, con lo que lo primero que hice fue irme a su GitHub y comprobar de qué se trataba:
El plugin es canela en rama, no solamente porque directamente habla con el SDK de vCenter, si no porque además, podemos monitorizar todos los siguientes parámetros:
- Cluster Stats
- Cluster services: CPU, memory, failover
- CPU: total, usage
- Memory: consumed, total, vmmemctl
- VM operations: # changes, clone, create, deploy, destroy, power, reboot, reconfigure, register, reset, shutdown, standby, vmotion
- Host Stats:
- CPU: total, usage, cost, mhz
- Datastore: iops, latency, read/write bytes, # reads/writes
- Disk: commands, latency, kernel reads/writes, # reads/writes, queues
- Memory: total, usage, active, latency, swap, shared, vmmemctl
- Network: broadcast, bytes, dropped, errors, multicast, packets, usage
- Power: energy, usage, capacity
- Res CPU: active, max, running
- Storage Adapter: commands, latency, # reads/writes
- Storage Path: commands, latency, # reads/writes
- System Resources: cpu active, cpu max, cpu running, cpu usage, mem allocated, mem consumed, mem shared, swap
- System: uptime
- Flash Module: active VMDKs
- VM Stats:
- CPU: demand, usage, readiness, cost, mhz
- Datastore: latency, # reads/writes
- Disk: commands, latency, # reads/writes, provisioned, usage
- Memory: granted, usage, active, swap, vmmemctl
- Network: broadcast, bytes, dropped, multicast, packets, usage
- Power: energy, usage
- Res CPU: active, max, running
- System: operating system uptime, uptime
- Virtual Disk: seeks, # reads/writes, latency, load
- Datastore stats:
- Disk: Capacity, provisioned, used
¡Impresionante! ¿verdad?, si ya tuvieramos Telegraf, InfluxDB y Grafana, porque habéis seguido la serie completa, solamente tendremos que actualizar nuestro sistema para recibir el plugin de vSphere para Telegraf:
sudo apt-get upgrade
Podremos ver el paquete de telegraf con una actualización, con lo que diremos sí cuando nos pida actualizar:
Reading package lists... Done Building dependency tree Reading state information... Done Calculating upgrade... Done The following packages have been kept back: linux-generic-lts-utopic linux-headers-generic-lts-utopic linux-image-generic-lts-utopic The following packages will be upgraded: bind9-host curl dnsutils filebeat influxdb libbind9-90 libcurl3 libcurl3-gnutls libdns100 libglib2.0-0 libglib2.0-data libisc95 libisccc90 libisccfg90 liblwres90 telegraf tzdata 17 upgraded, 0 newly installed, 0 to remove and 3 not upgraded. Need to get 50.8 MB of archives. After this operation, 17.6 MB of additional disk space will be used. Do you want to continue? [Y/n] y
Una vez que tenemos ya el paquete instalado, solamente nos quedará crear un nuevo fichero en /etc/telegraf/telegraf.d/vsphere-stats.conf, quedara algo así:
## Realtime instance [[inputs.vsphere]] ## List of vCenter URLs to be monitored. These three lines must be uncommented ## and edited for the plugin to work. interval = "60s" vcenters = [ "https://someaddress/sdk" ] username = "[email protected]" password = "secret" vm_metric_include = [] host_metric_include = [] cluster_metric_include = [] datastore_metric_exclude = ["*"] max_query_metrics = 256 timeout = "60s" insecure_skip_verify = true ## Historical instance [[inputs.vsphere]] interval = "300s" vcenters = [ "https://someaddress/sdk" ] username = "[email protected]" password = "secret" datastore_metric_include = [ "disk.capacity.latest", "disk.used.latest", "disk.provisioned.latest" ] insecure_skip_verify = true force_discover_on_init = true host_metric_exclude = ["*"] # Exclude realtime metrics vm_metric_exclude = ["*"] # Exclude realtime metrics max_query_metrics = 256 collect_concurrency = 3
Por supuesto, tendremos que descomentar también todos los parámetros del plugin.
Una vez tengamos esto, si no tuvieramos un SSL válido en nuestro vCenter, lo mejor es que también descomentemos la opción para no comprobar el SSL:
insecure_skip_verify = true
Otra opción es descargar el SSL de nuestro vCenter a nuestro Telegraf, para confiar en él:
openssl s_client -servername TUVCENTER -connect TUVCENTER:443 </dev/null | sed -ne '/-BEGIN CERTIFICATE-/,/-END CERTIFICATE-/p' >/etc/ssl/certs/vcsa.pem
Vamos a reiniciar el servicio de telegraf finalmente:
service telegraf restart
Comprobando que estamos ingiriendo información con Chronograf
Lo normal a estas alturas, si hemos realizado bien todos los pasos, es que ya estemos mandando información recopilada por Telegraf hacía InfluxDB, si realizamos una búsqueda usando el maravilloso Chronograf, podremos comprobar que tenemos información:
Todas las variables de este nuevo plugin de vSphere para Telegraf se guardan en vsphere_* con lo que es realmente sencillo encontrarlas.
Dashboards de Grafana
Es aquí donde he trabajado realmente duro, ya que he creado los Dashboards desde cero seleccionando las mejores peticiones a la base de datos, rematando colores, pensando que gráfica y cómo mostrarla, y además todo está automatizado de manera que encaja con vuestro entorno sin ningún problema y sin tener que editar vosotros nada de forma manual. Los Dashboards los podéis encontrar aquí, una vez importados los cuatro, podéis moveros entre ellos con el menú superior a la derecha, ahora toca descargarlos, o conocer la ID al menos de ellos:
- Grafana vSphere Overview Dashboard
- Grafana vSphere Hosts Dashboard
- Grafana vSphere Datastores Dashboard
- Grafana vSphere VMs Dashboard
Importar los Dashboard de Grafana de manera sencilla
Para que no tengáis que perder horas configurando un nuevo Dashboard, e ingerir y depurar queries, os he creado ya cuatro maravillosos Dashboards con todo lo necesario para monitorizar nuestro entorno de manera muy sencilla, os quedará como la imagen que os mostré más arriba.
Desde nuestro Grafana, haremos Create – Import
Seleccionaremos el nombre que queramos e introduciremos una a una las ID: 8159, 8162, 8165, 8168, que son las ID únicas del Dashboard, o las URL:
- https://grafana.com/dashboards/8159
- https://grafana.com/dashboards/8162
- https://grafana.com/dashboards/8165
- https://grafana.com/dashboards/8168
Con el menú de arriba a la derecha, podéis cambiar entre los Dashboards de Hosts, Datastores, VMs y claro el principal de Overview:
Algunas de las mejoras que este Dashboard incluyen son las selecciones de variables arriba a la izquierda, dependiendo de lo que seleccioneis, podréis ver solamente el Clúster, ESXi, o VM que os interesa. Por favor dejar vuestro feedback en los comentarios.
Espero que os guste, y me gustaría dejaros la serie completa aquí, para que empecéis a jugar con los plugins que os he ido contando todos estos años:
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte I (Instalando InfluxDB, Telegraf y Grafana)
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte II (Instalar agente Telegraf en Nodos remotos Linux)
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte III Integración con PRTG
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte IV (Instalar agente Telegraf en Nodos remotos Windows)
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte V (Activar inputs específicos, Red, MySQL/MariaDB, Nginx)
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte VI (Monitorizando Veeam)
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte VII (Monitorizar vSphere)
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte VIII (Monitorizando Veeam con Enterprise Manager)
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte IX (Monitorizando Zimbra Collaboration)
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte X (Grafana Plugins)
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XI
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XII – Plugin nativo de Telegraf para vSphere
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XIII – Veeam Backup for Microsoft Office 365
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XIV – Veeam Availability Console
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XV – Monitorización IPMI de nuestros Hosts ESXi
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XVI – Rendimiento y seguridad avanzada de Veeam Backup for Microsoft Office 365
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XVII – Mostrando los Dashboards en dos monitores usando Raspberry Pi 4
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XVIII – Monitorizar temperatura y estado de Raspberry Pi 4
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XIX (Monitorizando Veeam con Enterprise Manager) Shell Script
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XX (Monitorizando Certificados SSL x.509)
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXI (Monitorizando HTTP Responses)
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXII (Monitorizando Cloudflare con Mapa)
- En busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXIII (Monitorizando WordPress con Jetpack RESTful API)
- En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXIV (Monitorizando de Veeam for Microsoft Azure)
- En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXV (Monitorizando Consumo Eléctrico)
- En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXVI (Monitorizando Veeam Backup for Nutanix)
- En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXVII (Monitorizando ReFS y XFS (block-cloning y reflink)
- En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXVIII (Monitorizando HPE StoreOnce)
- En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXIX (Monitorizando PiHole)
- En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXX (Monitorizando Veeam Backup for AWS)
- En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXXI (Monitorizando Unifi Protect)
- En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXXII (Monitorizando Veeam ONE – experimental)
- En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXXIII (Monitorizando NetApp ONTAP)
- En Busca del Dashboard perfecto: InfluxDB, Telegraf y Grafana – Parte XXXIV (Monitorizando Goldshell Miners – JSONv2)





muchas gracias, un gran trabajo con los paneles que me ahorra mucho trabajo, de 10
Fantastico ! He visto tu blog tambien, gracias por el link, un saludo.
Genial post y muy útil, en breve lo pondré en uso en mi infra. Gracias Jorge!
Muy buena info, estoy teniendo un problema con las contadores de memoria de los host esxi, los valores que informa no son lo que realmente son, me muestra memoria de host consumida 800 mb y en realidad estoy usando 13 gb en total. Abra alguna solucion ?
Saludos Ignacio,
Tienes razón, ya lo he corregido, había que hacer algo de matemáticas, pero ya se ve bien, puedes descargar la nueva versión desde grafana.com o desde GitHub, un saludo
Hola Jorge, excelente articulo. Solamente tengo una pregunta, las variables que recolecta telegram, cambian si la versión de vmware es 5.5.
Más que todo tengo problemas con esta CPU.READINESS.AVERAGE, tanto para hosts, como para máquinas virtuales. No despliega ninguna información. Muchas gracias
Saludos Julio, es el unico dato que no tienes? Tienes ese dato si miras en tu vCenter Client?
Hola si es el único que no tengo.
Tengo entendido que esta variable me va a mostrar el uso del Ready. Si es así, si la tengo en el vCenter Client
Lo único extraño es que desde el estatus de telegraf me envia este mensaje
[inputs.vsphere] Metric name cpu.readiness.average is unknown. Will not be collected
Puede ser que el SDK en 5.5 no este mostrando esa variable, es lo único que se me ocurre, dices que tienes la ultima versión de telegraf, si?
Hi Jorge, thank you for awesome tutorial. I have successfully deployed it on 1 vCenter, my question is how to monitor if I have multiple vCenters and all credential are different
Hello,
You will need to add multiple sections of the
[[inputs.vsphere]]## List of vCenter URLs to be monitored. These three lines must be uncommented
## and edited for the plugin to work.
vcenters = [ "https://vcenter.local/sdk" ]
username = "[email protected]"
password = "secret"
Try it and let me know
hice upgrade y aun no tengo ninguna archivo conf en /etc/telegraf/telegraf.d/vsphere-stats.conf
Saludos,
En ese directorio solamente vas a tener el vsphere-stats.conf en caso de que tu lo crees manualmente como dice el tutorial, esto lo hago para evitar tocar el telegraf.conf directamente, ya que cuando se actualiza se sobreescribe, pero nunca se sobreescribiran tus ficheros dentro de vsphere-stats.conf
Hola Jorge,
Excelente guía, me pregunto si hay forma de integrar reportes y alertas como valor adicional.
Nice work. Everything seems to work properly but no data in vSphere Overview -> Datastores – Usage Capacity. Datastore status are ok. I think the query is wrong. Thanks
Hello,
Are you using the latest version of the Dashboard from grafana or github? And have you let it ingesting data for a few hours? The Datastore usage capacity doesn’t pull data that often
Just loaded the github version. So I will wait a few hours and will come back to you with my results. Thanks.
Still no luck. Although I waited a long time, there are still no data. Which query should be there? At my site it says
SELECT mean(“value”) FROM “measurement” WHERE $timeFilter GROUP BY time($__interval) fill(null)
That is good, do you have vCenter? Or just standalone ESXi?
vCenter 6.7. It’s very strange because on the Datastore dashboard everything seems ok.
Maybe the telegraf.config is wrong. I’m not sure, what to comment out.
## Clusters
# cluster_include = [ “/*/host/**”] # Inventory path to clusters to collect (by default all are collected)
cluster_metric_include = [] ## if omitted or empty, all metrics are collected
# cluster_metric_exclude = [] ## Nothing excluded by default
# cluster_instances = false ## false by default
## Datastores
# cluster_include = [ “/*/datastore/**”] # Inventory path to datastores to collect (by default all are collected)
datastore_metric_include = [] ## if omitted or empty, all metrics are collected
# datastore_metric_exclude = [] ## Nothing excluded by default
# datastore_instances = false ## false by default
## Datacenters
# datacenter_include = [ “/*/host/**”] # Inventory path to clusters to collect (by default all are collected)
datacenter_metric_include = [] ## if omitted or empty, all metrics are collected
#datacenter_metric_exclude = [ “*” ] ## Datacenters are not collected by default.
# datacenter_instances = false ## false by default
I found the solution by myself. The correct query is
SELECT mean(“used_latest”) * (100 / mean(“capacity_latest”)) FROM “vsphere_datastore_disk” WHERE (“source” =~ /^$datastore$/) AND $timeFilter GROUP BY time($__interval), “source”
And now I got the nice stapled LCD graphics in my dashboard.
hola estimado tengo el mismo problema no muestra datos tengo la version vSphere 5
2019-08-05T19:40:58Z W! [inputs.vsphere] Metric name cpu.readiness.average is unknown. Will not be collected
me podria ayudar a solucionar este problema?
Saludos Hector,
Estás usando vCenter sí? Puede ser que para vSphere 5.0 no funcione, está ya sin soporte desde hace tiempo, igual para 5.5. Un saludo
problema con panel, lo importo veo bien los filtro (es decir se populan con datos del cluster) pero por mas que seleccione cualquier opcion , no me grafica nada.
Saludos,
Puedes poner mas ejemplos, alguna imagen, o decirme si tienes datos en chronograf, si usas vcenter o no, etc.
Un saludo
Hola jorge, he estado tratando de montar tu solucion en un ambiente cerrado. este ambiente esta dentro de una DMZ, instale grafana, telegraf y influxdb, realice la config del .conf tal cual como lo indicas y he estado teniendo bastantes problemas con la conexion al vcenter.
netamente relacionado a certificados, pero lo que he estado mirando es que al tratar de conectar al vcenter intenta realizar una conexion para salir por el proxy y estos equipos no tienen salida a internet, no se si iria por ahi el tema
agregue el Skip para el SSL, pero aun asi me da distintos tipos de errores cada vez que intento conectar
2019-11-28T02:48:55Z E! [agent] Service for [inputs.vsphere] failed to start: Post https://vcenter.localdomain/sdk: Unable to connect
2019-11-28T02:48:55Z E! [telegraf] Error running agent: Post https://vcenter.localdomain/sdk: Unable to connect
2019-11-28T02:48:49Z E! [agent] Service for [inputs.vsphere] failed to start: 404 Not Found
2019-11-28T02:48:49Z E! [telegraf] Error running agent: 404 Not Found
2019-11-28T02:48:12Z E! [agent] Service for [inputs.vsphere] failed to start: Post https://vcenter.localdomain/sdk: x509: certificate signed by unknown authority
2019-11-28T02:48:12Z E! [telegraf] Error running agent: Post https://vcenter.localdomain/sdk: x509: certificate signed by unknown authority
Saludos, el server de telegraf no puede conectarse a tu vcenter por el puerto 443, revisa eso y todo funcionara, quiza incluso revisa DNS, que el server de telegraf resuelve tu fqdn tambien de vcenter
Un saludo
Buenos días Jorge, antes de nada, gracias por compartir el gran trabajo que has realizado. Quería hacerte una pregunta acerca de los dashboards de vSphere, ¿sería posible crear alertas de alguna manera? Tengo SMTP configurado correctamente, pero cuando intento ir al menú “Alerts” me devuelve el error “Template variables are not supported in alert queries”.
Muchas gracias.
Saludos Dario,
Si, mira lo tengo en otro blog:
Grafana: Usando Microsoft Teams para nuestras notificaciones cuando se superan umbrales establecidos
Pero no te va ha dejar crear alertas de variables, etc, es algo limitado, quizás quieras ojear Kapacitor
Buenas Jorge!
Esto es algo que debería de implantar todo el mundo. Maravilla y gran trabajo!
Estoy intentando configurar el telegraf pero obtengo estos errores:
[inputs.vsphere] Error in plugin: while collecting cluster: ServerFaultCode: This operation is restricted by the administrator – ‘vpxd.stats.maxQueryMetrics’. Contact your system administrator.
En el vpxa.log
The query size of 10396 metrics exceeded the vpxd.stats.maxQueryMetrics limit of 256 metrics. Dropping.
¿Hay alguna solución sin tener que modificar los valores en el vcenter?
Gracias!
Oh, Gracias Antonio,
Has usado la configuracion que sale en el post? Porque alli estoy usando 256 para las metricas.
Ojea y dime 🙂
No esperaba esta rapidez de respuesta XD
Exacto, 256. He probado en otro vcenter con menos nodos pero tampoco llegamos:
The query size of 452 metrics exceeded the vpxd.stats.maxQueryMetrics limit of 256 metrics. Dropping.
¿Alguna idea?
Por lo que hemos visto por encima, hay que modificar los valores del vcenter pero que no es recomendable porque pone esos limites para proteger la base de datos por lo que no sabemos que hacer.
Ya me dices
Gracias!!!!!!!
Buenas Jorge muchisimas gracias por esta implementacion funciona muy bien, sabes como si se puede configurar telegraf para mas de un vcenter en la configuracion a la vez?
Saludos, simple, crea otro fichero llamado mivcenter2.conf que se encuentre en /etc/telegraf/telegraf.d/ y ya estaria 🙂
Hola muy buenos días Jorge de la Cruz. Increíble tutorial ha funcionado a la perfección pero tengo una pequeña duda al respecto.
He implementado tal y como dices el Dashboard para poder visualizar VmSphere y funciona correctamente. Yo he ido al siguiente nivel y he metido a mano el plugin de Telegram en cada maquina y si selecciono el Hostname es posible visualizar cada equipo.
Sería posible de alguna manera el que se haga un Dashboard a cada maquina? Y si fuera asi de que manera? Gracias de antemano.
Saludos Jesus,
Si has metido el agente en cada VM, que sea Linux o Windows, tienes que crearte un Dashboard a tu gusto, hay varios Dashboards con cosas de Windows, o de Linux. yo tengo varios, si miras el mio de VBO Security, ese tiene cosas de Windows, y si miras el de Raspberry, ese tiene cosas de Linux, los combinas y ya tienes todo 🙂
Hola muy buenos días Jorge.
He seguido al completo tu tutorial y te tengo que dar mis 10 por que ha funcionado todo correctamente.
Mi cuestión es la siguiente : Tengo un DashBoard que cada vez que selecciono el HostName me cambia entre maquinas y me monitoria correctamente cada maquina. Al implementar el otro Dashboard que has puesto para descargar que aparecen todas las maquinas no consigo visualizar cada dato con su HOSTNAME.
Donde se podría visualizar el fallo? Gracias de antemano.
Saludos Jesus,
No utilizo hostname para el dashboard de las VMs, solo el nombre de la VM en vSphere. Puedes cambiar todo esto si usas el guesthostname, que tendras que tocar en las variables del dashboard y en la query.
Buenos días Jorge,
Primero de todo felicitarte por tu blog, lo sigo siempre y me ha ayudado muchísimas veces.
Comentarte que he implantado los dashboards en mi entorno de vsphere y funciona de lujo. Lo único que veo que no me cuadra, són las métricas de las VMs Windows, en concreto las de consumo de memoria RAM. Me indica unos valores que si los miro directamente en la VM no cuadran.
Muchas gracias,
Voy a ojear y te cuento. Te cuadran cuando lo ves en VMware directamente? En el Overview?
un saludo
Hello JORGE
your posts are awesome!!
lucky there is google translate 🙂
I was trying to implement this for vsphere 6.7 monitoring
installed everything on Ubuntu 18.04.4 LTS as you instructed
however in the part where you check with Chronograf, I can’t see the data.
also im getting an alert: “could not connect to capacitor, check your connection settings…”
what am I missing?
Hello Tamirh,
Chec if Grafana gives you any answer at all, have you configured the telegraf.conf as explained? One part I do not cover is to configure telegraf to send the data to influxdb, which is done on the by default installation of telegraf, check the output configuration.
Hello again Jorge
I can login successfully to Grafana. well, I didnt configure telegraf.conf
I implemented it as explained in “In search of the perfect Dashboard: InfluxDB, Telegraf and Grafana – Part XII – Native Telegraf plugin for vSphere”
and then I followed this post: “In search of the perfect Dashboard: InfluxDB, Telegraf and Grafana – Part I (Installing InfluxDB, Telegraf and Grafana):
do I need to implement this as well:
In search of the perfect Dashboard: InfluxDB, Telegraf and Grafana – Part VII (Monitor vSphere)
thanks much
Hello Tamirh,
If you have configured telegraf to send data to InfluxDB, and Grafana you aded the influxdb datasource, as explained on the Part I, and then finally configured the Part XII you should be golden and see data.
How do you install a Telegraf plugin?? can you share some instructions? other then creating the /etc/telegraf/telegraf.d/vsphere-stats.conf file. what do I do with the other GO files?
Im working in a closed environment so Its almost impossible for me to update my server using sudo apt-get upgrade.
Hello Jorge
I finally managed to create your dashboards and it looks AWESOME!!!!
one thing is that in the Overview dashboard the ‘Datastores – Usage Capacity’ is smudged and unreadable. can this be fixed somehow?
thanks
El dashboard de Virtual Machine tiene un BUG.
Yo tengo más VM’s en vCenter qué lo presentado en dashboard.
He tentado eliminar el código REGEX, pero nada hay cambiado.
Hola,
El limite son 1000 VMs en Grafana – https://community.grafana.com/t/size-limit-in-templating-variables/8920/2 si tienes mas, habría que depurar un poco las variables para dejarlas mas finas.
Hola,
Gracias por tu respuesta.
No, yo tengo +/- 300 en vCenter, pero el dashboard solamente 283.
Donde están las 17 VM’s?
Algo no está bien.
Gracias Jorge.
Seguro que si miras en el log estas overbuffer, cambia esto en tu telegraf.conf metric_buffer_limit = 10000 ponle mas como 20000 y reincia el server de telegraf, asegurate que en el log no te esta diciendo que no se llena el buffer
He probado ambas opciones:
metric_buffer_limit = 10000
metric_buffer_limit = 20000
Pero en el log no veo ningún error relacionado con el búfer…
Descomenta el # max_query_objects = 256
Buenas Jorge, funcionan los dashboards con la última versión de grafana, los importados pero no recogen datosm sólo los del Overview (CPU y Network)
Saludos,
Saludos, a mi me funciona todos los dashboards, y me recoge toda la información, te dice algo los logs de telegraf?
Buenas Jorge, aparentemente parece estar todo bien, pero en la mayoria de los dashboars se quedan en no data, lo he instalado todo sobre un ubuntu server 20.04 con la ultima version de grafana y el vcenter es la ultuma release de la 6.7
¿Podrá ser por tenerlo todo en las últimas versiones?
Buenas de nuevo!
Al final conseguí configurarlo en un entorno con menos máquinas. El problema es que quiero configurar donde hay unas 2000 máquinas.
Sería interesante poder filtrar por carpetas del VMware por ejemplo y otra de las formas, por sistema operativo Windows y Linux. ¿Te suena como se podría hacer esto?
Muchas gracias y felicidades por tu trabajo, soy tu admirador secreto. XD
Hello,
Great dashboard however all i get is 100% on the CPU average in the vSphere Overview dashboard. The query is using SELECT last(“usage_average”) FROM “vsphere_host_cpu” WHERE (“vcenter” =~ /^$vcenter$/ AND “clustername” =~ /^$clustername$/) AND $timeFilter GROUP BY time(1m), “clustername” fill(none) but when i look at the series data these filelds have multiple CPU numbers. Do you have an ideal on how to fix this. I’m using the latest dashboard on Grafana
Hola Jorge,
Estoy utilizando esxi 5.5 (Sin vCenter) y por alguna razón no me está sacando valores de los datastores:
El log me devuelve lo siguiente:
2020-12-14T11:08:43Z D! [inputs.vsphere] Find(Datastore, /*/datastore/**) returned 6 objects
2020-12-14T11:08:43Z D! [inputs.vsphere] Using fast metric metadata selection for datastore
2020-12-14T11:08:43Z W! [inputs.vsphere] Metric name disk.capacity.latest is unknown. Will not be collected
2020-12-14T11:08:43Z W! [inputs.vsphere] Metric name disk.used.latest is unknown. Will not be collected
2020-12-14T11:08:43Z W! [inputs.vsphere] Metric name disk.provisioned.latest is unknown. Will not be collected
¿Alguna idea que puede estar ocurriendo?
Gracias de antemano.
Saludos Iker,
Los datastores tardan en aparecer, ya que las metricas son de cada 30 minutos o asi, dale un poco de tiempo.
Un saludo
Gracias por la respuesta Jorge.
Lleva todo el fin de semana “recolectando” datos pero sigue sin aparecer. He revisado desde Chronograf y ni si quiera me ha generado el Measurement. ¿Puede estar relacionado con la versión 5.5?
Gracias nuevamente.
Saludos Iker,
Puede ser si, no puedes subir el vCenter a uno mas moderno? Y dejar los ESXi tal cual están?
Un saludo
Hola Jorge,
No tengo vCenter desplegado, estoy apuntando directamente al Host ESXi. ¿Requiere vCenter para extraer estos valores?
Gracias.
Saludos Iker,
Si, es un requerimiento obligatorio, lo menciono al comienzo cuando digo que extrae la informacion del SDK de vCenter.
Un saludo
Hola Jorge:
gracias por todo, has hecho que me aficione a Grafana (TIG), una buena solución.
Me estoy peleando con dos cosas, y no consigo ver como correlacionar datos:
Una es tener un dashboard para ver como evoluciona el numero de VMs, esto es importante por ejemplo cuando has licenciado VEEAM por VMs, es una forma de poner una alerta para que te avise antes de que te pases de lo licenciado.
Otro tema es hacer un dashboard, que nos permita que VMs hay en un Datastore, he conseguido sacar las VMs que hay en cada ESXi, pero no consigo cuales son las que hay en cada DataStore.
Alguna idea?
Gracias
Txema
Saludos Txema,
Muchas gracias por tus palabras! Es sencillo, ya tienes la consulta que puedes poner en una grafica normal, es esta:
SELECT count(distinct("vmname")) AS "VM" FROM (SELECT "usage_average", "vmname" FROM "vsphere_vm_cpu" WHERE $timeFilter)Eso te da el numero de VMs, creo que para historico quiza tuvieramos que tocar un poco, pero ojealo.
Para la segunda, no creo que puedes hacerlo, ya que ninguna de las tags que incluyen las metricas de vm es el datastore, con lo que no tengo ni idea de como hacer un link entre ellas 🙁 Quiza si abres un bug en el github de telegraf puedas conseguir que lo consideren.
Un saludo
Gracias Jorge!!!!
Hola Jorge,
Estoy tratando de excluir algunos datastore que son locales, estos tiene como nombre datastore1 al datastore30
He descomentado la siguiente linea:
datastore_exclude = [ “//datastore“] # Inventory paths to exclude
También he intentado modificando la query que viene en el dashboard, pero tampoco lo he logrado.
Saludos
Hola:
Donde le dices al script en que bucket lo tiene que guardar?
Un saludo.
Hola, esto se configura a nivel de output. Con namepass vsphere, y el resto con lo que quieras con namedrop vsphere aqui mas info
https://docs.influxdata.com/telegraf/v1.18/administration/configuration/#measurement-filtering
Buenas Jorge,
Tengo un par de preguntas:
Para la parte del CPU Ready de la VM, ¿tiene en cuenta los vcores o eso hay que dividirlo entre los cores? Lo digo porque no es lo mismo un CPU Ready del 8% en una VM de 8 vcpu que de 1vcpu.
Por otro lado, desconozco si es un problema mío, pero en el filtrado de los cluster, no me los muestra (solo aparece All), aunque en la graficas si que los detecta bien. ¿Qué puede estar pasando?
Saludos.
Buenas,
estamos teniendo problemas al recolectar las métricas cuando metemos varios vCenter. Son más o menos 2500 vms. Se ha ampliado la CPU y RAM. También hemos agregado el parámetro metric_buffer_limit a 10000, pero seguimos perdiendo métricas. También nos aparece errores haciendo referencia al vpxd.stats.maxQueryMetrics.
¿Alguna idea para solucionar este problema?
Muchas gracias.
Saludos Antonio,
Para tantas VMs, quiza seria mejor tener varios telegraf que recolecten de cada vCenter, y ver como se comporta. Para el error, juega con la variable https://github.com/influxdata/telegraf/tree/master/plugins/inputs/vsphere#configuring-max_query_metrics-setting.
Ya me dices
Hola Jorge.
Antes de nada, darte las gracias por ofrecer tus conocimientos y recursos.
Soy nuevo en todo esto.
Tengo una duda y un problemilla con el dashboard VMware vSphere – Overview.
La duda que tengo, ¿Cómo habilito los logs de telegraf?, lo tengo instalado en centos 7.
El problemilla con el dashboard, en la parte de cluster overview, resulta que en un cluster, me sale duplicado los datos de Uptime, CPU y RAM con diferentes datos. ¿Sabes el motivo?, en el otro sale bien.
Sin mas, darte de nuevo las gracias.
Saludos,
Yo creo que no es en telegraf. Que InfluxDB usas, y que version del dashboard? Saludos
Holaaaa.
Gracias por tu pronta respuesta.
De influxdb uso la version 2.6.1 y de dashboard el que aparece en la web de grafana id: 8159 (Last update: 2022-09-06T16:00:40)
Un saludo.
Saludos, si puedes y no hay datos internos, pon una captura y ojeo
Saludos
Hola Jorge.
No se como adjuntar una imagen. Te la envío al correo del blog.
Un saludo.
my grafana not showing any status from dashboard vmware vsphere overview, can i help me please?
Hello,
What InfluxDB version you have, and what is the telegraf configuration to send data to your influxDB? Also, have you enabled telegraf.log? Do you have data on InfluxDB? Please share more info
Buenas tardes, estoy intentando usar el dashboard 8159, pero no me carga, tiene algún problema. De antemano muchas gracias por la ayuda con los dashboard, he implementado algunas cosas y me ha ahorrado mucho trabajo.
Saludos,
Álvaro
Saludos Alvaro,
Que te sale? Que error? Quiza no estas usando InfluxDB v2.0, no se. Muestra el error.
Gracias
Buenos días Jorge, cuando quiero importar lo deja el 8159, me sale un mensaje “NetworkError when attempting to fetch resource”, pero solo es con ese dashboard, el resto que publicaste me carga sin problemas (8162, 8165, 8168).
Gracias por contestar, quedo atento a tu respuesta.
Saludos
Estimado Jorge,
Al intentar cargar el 8159 me sale el mensaje “NetworkError when attempting to fetch resource”, con los otros dashboard no tengo problemas, los pude cargar normalmente.
Si estoy trabajando con InfluxDB V2.0.
Saludos,
Hola, prueba ahora a ver, o mejor, vete a las revisiones y baja el ultimo a ver:
https://grafana.com/grafana/dashboards/8159-vmware-vsphere-overview/?tab=revisions
Saludos!
Estimado Jorge,
Pude cargar la revisión 44, de la revisión 45 a la 48 tuve el mismo inconveniente que te comenté, muchas gracias, estaré pendiente de volver hacer pruebas con revisiones futuras.
Agradezco tu pronta respuesta.
Saludos,
́́Álvaro
Usas la ultima version de Grafana?
Que raro nadie ha comentado nada.
La versión de grafana que tengo es la 9.5.3
Gracias por el trabajo, he seguido los pasos y todo genial, lo unico es que no me aparece el grafico de Virtual Machine CPU Usage in % y tengo todos los checks habilitados como indicas :S. Tengo algo mal?
Hola Jorge,
Tendria una consulta si es que podrias darme una mano.
He creado realizar la instalación completa gracias al tutorial y visualizo las graficas en el dashboard que facilitaste, pero hay un valor que me parece interesante si es que lo podemos lograr, pero no se si es posible debido a la configuración del InfluxDB, del DashBoard o incluso del vCenter. Sabrias si es posible obtener las metricas del espacio en disco de las maquinas virtuales?
Desde ya muchas gracias por el aporte
Hola Jorge
He tratado de configurar el ambiente para monitorear un vmware vCenter server version6.0.0 pero la conexion de telegraf no la he podido implementar ya que causa error. me aparece esto en syslog
May 23 09:50:09 bumvmonlnx01 systemd[1]: Starting Telegraf…
May 23 09:50:09 bumvmonlnx01 telegraf[2208]: 2024-05-23T13:50:09Z I! Loading config: /etc/telegraf/telegraf.conf
May 23 09:50:09 bumvmonlnx01 telegraf[2208]: 2024-05-23T13:50:09Z I! Loading config: /etc/telegraf/telegraf.d/influx.conf
May 23 09:50:09 bumvmonlnx01 telegraf[2208]: 2024-05-23T13:50:09Z I! Loading config: /etc/telegraf/telegraf.d/ping.conf
May 23 09:50:09 bumvmonlnx01 telegraf[2208]: 2024-05-23T13:50:09Z I! Loading config: /etc/telegraf/telegraf.d/vsphere-stats.conf
May 23 09:50:09 bumvmonlnx01 telegraf[2208]: 2024-05-23T13:50:09Z W! DeprecationWarning: Option “force_discover_on_init” of plugin “inputs.vsphere” deprecated since version 1.14.0 and will be removed in 2.0.0: option is ignored
May 23 09:50:09 bumvmonlnx01 telegraf[2208]: 2024-05-23T13:50:09Z I! Starting Telegraf 1.30.2 brought to you by InfluxData the makers of InfluxDB
May 23 09:50:09 bumvmonlnx01 telegraf[2208]: 2024-05-23T13:50:09Z I! Available plugins: 233 inputs, 9 aggregators, 31 processors, 24 parsers, 60 outputs, 6 secret-stores
May 23 09:50:09 bumvmonlnx01 telegraf[2208]: 2024-05-23T13:50:09Z I! Loaded inputs: cpu disk diskio kernel mem ping processes swap system vsphere
May 23 09:50:09 bumvmonlnx01 telegraf[2208]: 2024-05-23T13:50:09Z I! Loaded aggregators:
May 23 09:50:09 bumvmonlnx01 telegraf[2208]: 2024-05-23T13:50:09Z I! Loaded processors:
May 23 09:50:09 bumvmonlnx01 telegraf[2208]: 2024-05-23T13:50:09Z I! Loaded secretstores:
May 23 09:50:09 bumvmonlnx01 telegraf[2208]: 2024-05-23T13:50:09Z I! Loaded outputs: influxdb_v2
May 23 09:50:09 bumvmonlnx01 telegraf[2208]: 2024-05-23T13:50:09Z I! Tags enabled: host=bumvmonlnx01
May 23 09:50:09 bumvmonlnx01 telegraf[2208]: 2024-05-23T13:50:09Z W! Deprecated inputs: 0 and 1 options
May 23 09:50:09 bumvmonlnx01 systemd[1]: Started Telegraf.
May 23 09:50:09 bumvmonlnx01 telegraf[2208]: 2024-05-23T13:50:09Z I! [agent] Config: Interval:10s, Quiet:false, Hostname:”bumvmonlnx01″, Flush Interval:10s
May 23 09:50:09 bumvmonlnx01 telegraf[2208]: 2024-05-23T13:50:09Z D! [agent] Initializing plugins
May 23 09:50:09 bumvmonlnx01 telegraf[2208]: 2024-05-23T13:50:09Z D! [agent] Connecting outputs
May 23 09:50:09 bumvmonlnx01 telegraf[2208]: 2024-05-23T13:50:09Z D! [agent] Attempting connection to [outputs.influxdb_v2]
May 23 09:50:09 bumvmonlnx01 telegraf[2208]: 2024-05-23T13:50:09Z D! [agent] Successfully connected to outputs.influxdb_v2
May 23 09:50:09 bumvmonlnx01 telegraf[2208]: 2024-05-23T13:50:09Z D! [agent] Starting service inputs
May 23 09:50:09 bumvmonlnx01 telegraf[2208]: 2024-05-23T13:50:09Z I! [inputs.vsphere] Starting plugin
May 23 09:50:09 bumvmonlnx01 telegraf[2208]: 2024-05-23T13:50:09Z D! [inputs.vsphere] Creating client: 10.91.xxx.yyy
May 23 09:50:09 bumvmonlnx01 telegraf[2208]: 2024-05-23T13:50:09Z E! [telegraf] Error running agent: starting input inputs.vsphere: Post “https://10.91.xxx.yyy/sdk”: EOF
May 23 09:50:09 bumvmonlnx01 systemd[1]: telegraf.service: Main process exited, code=exited, status=1/FAILURE
May 23 09:50:09 bumvmonlnx01 systemd[1]: telegraf.service: Failed with result ‘exit-code’.
May 23 09:50:09 bumvmonlnx01 systemd[1]: telegraf.service: Scheduled restart job, restart counter is at 1.
May 23 09:50:09 bumvmonlnx01 systemd[1]: Stopped Telegraf.
Gracias por tu ayuda
Hola Jorge
ya pude dejar funcionando con tu ayuda el dashboard de monitoreo de Vmware 6.5 y tambien otro dashboard para vmaware 6.0 con captura y alimentacion de mi parte utilizando algunos elementos de recuperacion de datos de Nagios. la duda que tengo es cuando el dashboard de grafana para 6.5 lleva algun tiempo y tengo mas de un Vcenter monitoreado, el dashboard no permite dejar de visualizar un vcenter, siempre aparecen los dos y a veces esto deja mucha informacion en pantalla. Puedes ayudarme con esto??