Saludos amigos, Windows Server 2019 ya está aquí, y una de las novedades que incluye entre otras muchas, es finalmente la deduplicación para volúmenes ReFS. La cual nos permitirá reducir el espacio de los ficheros de Veeam que almacenemos allí con mucho mejor resultado que NTFS, que ya era una locura.
Os dejo una imagen para que veamos cómo finalmente se juntan dos de las tecnologías más punteras de Microsoft Windows Server, ReFS y deduplication:
Nota: Tener en cuenta que el tamaño máximo para deduplicar por fichero es 1TB, si tenéis ficheros más grandes que estos, tendréis que intentar reducir el tamaño, o en Veeam por ejemplo, crear más trabajos con otras VMs.
Nota 2: Yo voy a usar esta nueva deduplicación de Windows Server 2019 para un Veeam Backup Repository, pero Veeam no ha anunciado aún soporte oficial para esto. Con lo que usarlo bajo vuestra propia responsabilidad o contactar al Soporte de Veeam antes de realizarlo en producción.
¿Qué es la deduplicación de datos?
La deduplicación de datos es una característica disponible desde Windows Server 2012 R2 solamente para volúmenes NTFS. Con la deduplicación conseguimos reducir el espacio que usamos en disco guardando únicamente una copia de los datos que son idénticos dentro de un volumen.
Como vemos en la ilustración anterior, con la deduplicación conseguimos comprobar que datos, a nivel de bloque o byte están duplicados y no guardarlos para conseguir un mayor volumen de datos ocupando menos espacio de disco final.
Realmente, cómo funciona la deduplicación de Windows Server es mediante una conjunto de tareas que se ejecutan en segundo plano revisando e identificando los bloques o bytes duplicados. El fichero o byte se divide en 32 y 128 KB, en este momento es cuando se identifican elementos duplicados en el volumen. Todos los elementos duplicados son borrados del disco, conservando una referencia a una copia del pedazo que no es borrado.
Los datos al final no son eliminados, son comprimidos mediante la deduplicación.
Cómo habilitar Microsoft Windows Server 2019 Deduplication en volúmenes ReFS
Lo primero que haremos será comprobar que estamos usando Windows Server 2019 efectivamente:
Cuando añadimos el disco o discos, los marcaremos como Online para poder operar con ellos:
Inicializaremos el disco o discos:
Marcaremos GPT ya que seguramente tengamos particiones grandes:
Ahora crearemos un volumen simple:
Cuando lleguemos a la parte de Format Partition, seleccionaremos ReFS y 64K para el unit size:
Una vez tenemos los volúmenes listos, nos iremos al Server Manager, y seleccionaremos la opción de Add roles and features:
Bajaremos hasta la opción llamada File and Storage Services – File and iSCSI Services y marcaremos File Server y Data Deduplication:
El proceso tarda apenas un minuto en finalizar, quizá menos:
Una vez activado el servicio, desde el Server Manager, si nos vamos hasta File and Storage Services – Volumes, podremos ver nuestro volumen en ReFS, haremos botón derecho y haremos click en Configure Data Deuplication:
En el tipo de duplicación, he marcado la opción de Virtualizaed Backup Server y que me deduplique los ficheros con antigüedad superior a 3 días:
Vemos como los savings de deduplicación por ahora son cero: 
Forzando las tareas de Microsoft Windows Server 2019 deduplication
Podemos forzar las tareas de deduplicación en el volumen si nos vamos al Task scheduler y buscamos dentro de la carpeta de deduplication:
Con los comandos Get-DedupJob, Get-DedupStatus y Get-DedupVolume podemos ver qué está sucediendo:
Durante el proceso de deduplicación, veremos un proceso llamado fsgdmhost.exe consumiendo CPU y RAM, este es nuestro proceso de deduplicación:
Dentro del Resource Monitor, en Disk, podemos ver en gran detalle el proceso, y los consecuentes sub procesos partiendo los chunks de datos para ver donde se puede deduplicar y borrar datos duplicados, ¿no es ésto como un dulce sueño?
Cuando termine el proceso, si lanzamos de nuevo los comandos Get-DedupStatus y Get-DedupVolume veremos los savings, en mi caso he ahorrado hasta un 67% y ahorrado 80GB de espacio para un trabajo de copia que he estado lanzando por una semana:
Aquí podremos ver los mismos savings pero de manera visual:
Como podéis ver, la nueva deduplicación de datos en Microsoft Windows Server 2019 para ReFS va a darnos muchas cosas buenas y un ahorro impresionante de espacio en disco. Espero vuestras pruebas y comentarios.

¿También seria compatible con el fast-clone del ReFS cuando Veeam realiza un full backup sintético?
Aunque Veeam detecta que es un ReFS, tambien detecta la deduplicacion, con lo que no hay fastclone de momento, habra que esperar a U4 quiza.
Un saludo
Habrá que estar atento entonces a las U4, ya que gracias al fastclone actualmente consigo un ratio de 3,42:1 en el ahorro de almacenamiento de los backups.
Aprovecho para darte las gracias por tus artículos, son realmente muy útiles!!
Hola Jorge.
Me parece un post muy interesante.
Estoy por activar ese rol en un servidor (Windows 2019) de ficheros con unos 8 millones de archivos (.PDF y .DOC) de 150-250K de media.
He ejecutado la herramienta de evaluación de la deduplicación y de unas 550G me ahorra 143Gb (no está mal).
Tengo alguna duda:
Entiendo que en lo que se refiere a permisos de ficheros no se tendría que ver afectado en nada, pues aunque estén en diferentes ubicaciones, se aplicarían permisos a los punteros, y si se copia el fichero a una ubicación (del mismo servidor) que no tenga deduplicación, me conservaría los permisos del fichero (no se si me explico bien 😐 )
La información de la deduplicación dónde se guarda? Es decir en caso de catastrofe, como una degradación del disco de sistema, se puede remontar el recurso deduplicado?
Por ejemplo una VM 2019 con disco de sistema (C:) y disco de datos con deduplicacion (D:), se puede entregar el fichero VMDK (correspondiente al disco D:) a otro servidor y “recuperar” la información?
En lo referente a los backups con Veeam, el hecho de copiar una VM con el rol de deduplicación, afecta mucho al rendimiento, tanto a nivel de tamaño de la copia como al tiempo de ésta?
Un saludo
Saludos Pep,
Como bien dices, a nivel de permisos no afecta en nada. La información de la deduplicación se guarda en el volumen en cuestión, mediante metadata, etc que está oculta en ese mismo volumen, con lo que puedes mover todo el volumen, o reconectarlo a otro windows, etc. Siempre que tengas todo el volumen entero.
En caso de necesitar re-hidratar la información, en caso de que quieras migrar todo a otro lugar, etc. Puedes hacerlo también mediante Powershell.
Cuéntame un poco más sobre Veeam, que no me queda claro, hablamos de una VM a la que quieres hacer el backup? O un backup que quieres poner en un volumen de Veeam, que luego se deduplica? En ambos casos, el rendimiento no se ve afectado no.
Me refería a hacer backup con el Veeam de una VM con un disco o recurso con la reduplicación activada