StorageReview.com

StorageReview establece un nuevo récord para Pi: 314 billones de dígitos en un Dell PowerEdge R7725

Empresa  ◇  Software

StorageReview ha recuperado su popularidad computacional con un nuevo récord de resolución de pi de 314 billones de dígitos. La carrera moderna por el π ha pasado de los experimentos en la nube a una infraestructura flexible y completa. En 2022, Google Cloud llevó el π a 100 billones de dígitos, ejecutando y-cruncher en una flota masiva de instancias en la nube y consumiendo decenas de petabytes de E/S en el proceso. Esta marca se convirtió en la cifra clave de "hasta dónde es posible" con la infraestructura tradicional.

La acción se trasladó entonces al laboratorio. A principios de 2024, ampliamos nuestro récord a 105 billones de dígitos en un sistema respaldado por casi un petabyte de SSD Solidigm QLC. Este logro estableció un nuevo punto de referencia en cuanto a escalabilidad y demostró la eficiencia con la que podía operar una sola máquina local. Unos meses después, lo volvimos a lograr, esta vez alcanzando los 202 billones de dígitos. Esto confirmó que la tecnología flash de alta densidad y un ajuste meticuloso podían superar el rendimiento de la infraestructura de hiperescala para esta carga de trabajo específica y exigente.

Por supuesto, los récords invitan a los rivales. Linus Media Group y KIOXIA se alzaron con la victoria con una racha de 300 billones de dígitos, impulsada por un gran clúster de almacenamiento compartido Weka con 2 PB de memoria flash. Ese esfuerzo demostró lo que podía hacer una infraestructura tradicional con un alto consumo de almacenamiento, a pesar de tener que lidiar con un rack de hardware, una factura de electricidad elevada y complejidades de refrigeración. ¡No podíamos quedarnos de brazos cruzados y dejar que ese récord se mantuviera!

StorageReview ha logrado calcular π hasta 314 billones de dígitos, utilizando un único servidor Dell PowerEdge R7725 de 2U equipado con dos CPU AMD EPYC de 192 núcleos y cuarenta SSD Micron 6550 Ion de 61.44 TB. Tras la configuración y el ajuste del sistema en julio, iniciamos la prueba el 31 de julio de 2025. Por suerte, nuestra prueba de pi finalizó durante el segundo día de SC25, lo que nos permitió establecer un nuevo récord en computación de alto rendimiento (HPC).

Escalado del y-cruncher a 314 billones de dígitos

Una vez superados los cientos de billones de dígitos, y-cruncher se comporta menos como un benchmark tradicional y más como una prueba de estrés de infraestructura a largo plazo. La aplicación en sí es sencilla, pero la forma en que interactúa con el hardware a esta escala se convierte en el factor determinante. Todo se reduce a la capacidad del sistema para ejecutar miles de operaciones de precisión múltiple sin paralizar las CPU ni saturar la capa de almacenamiento. En concreto, la capa de almacenamiento es donde se logró este récord. Implementamos 40 SSD Micron 6550 Ion Gen5 NVMe, 34 de los cuales se asignaron a y-cruncher. Este conjunto de SSD proporcionó aproximadamente 2.1 petabytes, lo que le dio a y-cruncher suficiente espacio para ejecutar la ejecución de 314T. Los 6 SSD restantes se utilizaron para crear un volumen RAID10 por software, que se utilizó para registrar los 314T dígitos de pi.

Los cambios de diseño entre los servidores Dell PowerEdge de 16.ª y 17.ª generación también contribuyeron a mejorar el rendimiento de nuestro último récord de 314T. En nuestro récord anterior de 202T, aprovechamos el Dell PowerEdge R760 de 24 bahías, que utilizaba un conmutador PCIe en la placa base de la unidad, lo que compensaba la densidad de la unidad con el rendimiento. En los servidores Dell PowerEdge de 17.ª generación, como el R770 con Intel o el R7725 con AMD, las placas base volvieron a ser de solo conexión directa, con 2 o 4 líneas PCIe por bahía. En el PowerEdge R7725, con su placa base Gen5 E3.S de 40 bahías, cada SSD cuenta con 2 líneas PCIe. Si bien esto puede parecer una pérdida de rendimiento, la plataforma aún es capaz de alcanzar hasta 280 GB/s de lectura y escritura cuando las 40 bahías se utilizan simultáneamente.

Utilizando el benchmark de almacenamiento interno de y-cruncher, registramos el rendimiento de almacenamiento de cada plataforma en la configuración utilizada en cada ejecución. En cada carga de trabajo, observamos aumentos del rendimiento de almacenamiento que oscilaron entre el 72 % y el 383 %, con métricas de lectura y escritura equilibradas.

Métrico Sistema 202T (registro antiguo) Sistema 314T (nuevo récord) Diferencia porcentual (314T vs 202T)
Escritura secuencial 47.0 GB/s 107 GB/s + 127.7%
Lectura secuencial 56.7 GB/s 127 GB/s + 124.0%
Escritura con pasos de umbral 62.2 GB/s 107 GB/s + 72.0%
Lectura con paso de umbral 20.9 GB/s 101 GB/s + 383.3%

El Dell PowerEdge R7725 no es solo una caja de almacenamiento; también ofrece un gran potencial de procesamiento como plataforma AMD Turin de doble socket. Utilizamos CPU AMD EPYC 9965 de 192 núcleos, con un total de 384 núcleos. También reemplazamos los disipadores de aire de fábrica por placas frías CoolIT SP5 con refrigeración líquida, refrigeradas por una CDU de líquido a aire CoolIT AHx10. Esta combinación mantuvo las CPU a velocidades de reloj más altas y sostenidas, los ventiladores del chasis funcionando a un 30 % de PWM y el consumo promedio del sistema en torno a los 1,600 W.

En cuanto al software, la plataforma ejecutó Ubuntu 24.04.2 LTS Server en lugar de Windows Server, como en ejecuciones anteriores. Esto maximizó la estabilidad del sistema y generó mejoras significativas en el rendimiento de las cargas de trabajo. Realizamos numerosas iteraciones de prueba antes de iniciar nuestra ejecución, incluyendo la reserva de 4 de los 384 núcleos para operaciones del sistema en segundo plano. El resultado no solo fue superar el récord existente de Pi, sino que lo arrasamos en numerosas métricas. Nada se acerca a nuestra ejecución en términos de rendimiento, consumo de energía y, lo más impresionante, fiabilidad. También somos la única ejecución de récord mundial de Pi a gran escala sin un segundo de inactividad. De principio a fin, la ejecución nunca tuvo que reanudarse.

Eficiencia energética récord

El enfoque de StorageReview para cada una de nuestras ejecuciones de registro pi ha sido reducir la complejidad y ejecutar la prueba de rendimiento con el mínimo consumo de energía necesario. El registro anterior de 300T, que aprovechó un clúster de almacenamiento distribuido y una red de alta velocidad, tuvo como contrapartida mayores requisitos de energía y refrigeración. Optamos por un camino diferente, centrándonos en la densidad de almacenamiento para utilizar un único servidor 2U tanto para el almacenamiento de intercambio como para el de salida. Esto contribuyó significativamente a la reducción de nuestro consumo total de energía y refrigeración. Nuestro Dell PowerEdge R7725 consumió tan solo 4,304.662 kWh durante la ejecución de 314T, lo que equivale a tan solo 13.70 kWh por billón de dígitos. Esto lo convierte en uno de los cálculos pi a gran escala con mayor eficiencia energética. Al comparar ambos enfoques, la diferencia se hace evidente de inmediato, como se muestra en la tabla a continuación.

Ejecutar kWh totales Costo a $0.12/kWh Costo a $0.20/kWh
Weka Cluster Run de 300T 33,600 kWh (aprox.) $4,032 $6,720
Ejecución de un solo servidor 314T 4,304.662 kWh $517 $861

Es importante tener en cuenta que, durante el cálculo, nuestro 314T utilizó SSD en una configuración JBOD sin resiliencia de datos. El consumo de energía y el rendimiento general del sistema fueron los factores que llevaron a esta decisión, pero también generaron un debate sobre el diseño de la solución de almacenamiento en función de la carga de trabajo. Cada carga de trabajo es diferente, y algunas que pueden reiniciarse con un impacto mínimo en la producción podrían no requerir el mismo nivel de tolerancia a fallos. En nuestro caso, nos centramos en proteger la salida de datos con RAID de software tradicional.

110 días de duración total

A pesar de calcular más dígitos que cualquier ejecución anterior, el tiempo de reloj fue significativamente menor que el récord anterior, que requirió aproximadamente 225 días para completarse (175 días de cómputo excluyendo el tiempo de inactividad). Esta ventana ininterrumpida de 110 días es el resultado de un sistema operativo estable, una carga de fondo minimizada, una topología NUMA equilibrada y una matriz de scratch diseñada para el patrón que y-cruncher genera a esta escala.

Aspectos técnicos destacados

  • Total de dígitos calculados: 314,000,000,000,000
  • Hardware utilizado: Dell PowerEdge R7725 con 2 CPU AMD EPYC 9965, 1.5 TB de DRAM DDR5, 40 Micron 61.44 TB 6550 Ion
  • Software y algoritmos: y-cruncher v0.8.6.9545, Chudnovsky
  • Desgaste de SSD según SMART:7.3 PB escritos por unidad o 249.11 PB en los 34 SSD utilizados para intercambio
  • Punto de control lógico más grande: 850,538,385,064,992 (774 TiB)
  • Uso máximo lógico del disco: 1,605,960,520,636,440 (1.43 PiB)
  • Lectura de bytes de disco lógico: 148,356,635,606,263,504 (132 PiB)
  • Bytes de disco lógico escritos: 126,658,805,195,776,600 (112 PiB)
  • Fecha de Inicio: Jue 31 Jul 17:16:41 2025
  • Fecha Final:Mar 18 nov 05:57:08 2025
  • Pi: 8793223.144 segundos, 101.773 días
  • Tiempo total de cálculo: 9274878.580 segundos
  • Tiempo de pared de principio a fin: 9463226.454 segundos

Pensamientos Finales

Durante décadas, las ejecuciones extremas de pi fueron una forma de presumir de lo que se consideraba "grande" en aquel momento. Los primeros discos se basaban en ordenadores de sobremesa de alto rendimiento y almacenamiento externo, y luego se trasladaron a equipos empresariales locales. Más recientemente, la carrera se trasladó a la nube, donde trabajos como la ejecución de 100 billones de dígitos de Google demostraron que se podía acceder a un disco por fuerza bruta con suficientes instancias y E/S. Después, vimos la llegada de grandes clústeres de almacenamiento compartido, que sacrificaron la simplicidad por un paralelismo puro y una enorme factura de energía y refrigeración.

Nuestro enfoque ha ido en la dirección opuesta. A lo largo de múltiples ejecuciones récord, hemos tratado a y-cruncher como una carga de trabajo HPC seria, no como una maniobra puntual. Las soluciones de 105T y 202T nos ayudaron a identificar los cuellos de botella reales, dimensionar y optimizar el almacenamiento temporal, mantener las CPU alimentadas sin sobrecargar la capa de E/S y reforzar el sistema para que un trabajo de meses de duración realmente finalice. La ejecución de 314T es el resultado de esa experiencia. No es solo un número mayor, sino un diseño más maduro.

Las métricas confirman esta historia. Superamos los 300 billones de dígitos en un solo Dell PowerEdge R7725 de 2U con SSD 6550 Ion de 40 Micron y dos CPU AMD EPYC de 192 núcleos, mantuvimos el sistema en línea durante 110 días seguidos y nunca tuvimos que reiniciarlo tras un fallo. El rendimiento del almacenamiento se duplicó con creces en comparación con nuestra plataforma de 202T; sin embargo, el servidor promedió unos 1,600 W y consumió 4,305 kWh en total. Esto equivale a 13.70 kWh por billón de dígitos, una fracción de la energía estimada utilizada por el clúster de 300T anterior: menos nodos, menor complejidad, menos energía, más trabajo realizado.

Por eso este récord es importante, más allá de presumir: si un servidor comercial 2U puede soportar una ejecución de un procesador Y de este tamaño, con ese nivel de fiabilidad y eficiencia, los mismos patrones de diseño se aplican directamente a la ciencia de la producción. Los modelos climáticos de larga duración, las simulaciones físicas, los procesos genómicos y los trabajos de entrenamiento de IA se basan en los mismos fundamentos: E/S equilibrada, temperaturas predecibles, firmware estable y una arquitectura que puede mantenerse en pie durante meses. Esta plataforma ha demostrado que puede hacer precisamente eso en condiciones que no dejan margen de error.

Sí, StorageReview ha recuperado el título de pi con 314 billones de dígitos. Y lo que es más importante, hemos establecido el estándar de lo que significa "bueno" en computación numérica a gran escala en hardware real. Si alguien quiere batir el récord, nos gustaría que lo consiguiera por completo: más dígitos, menos consumo, menor tiempo de inactividad y la misma fiabilidad sin tiempo de inactividad. Hasta entonces, este es el punto de referencia para la eficiencia.

Interactuar con StorageReview

Boletín informativo | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Canal RSS

kevin obrien

Dentro del StorageReview Lab evaluando productos y trabajando con líderes de la industria para desarrollar nuevos entornos de prueba. En casa estoy formando una familia.