A principios de este año, establecimos un nuevo récord al calcular 314 billones de dígitos de Pi . El cálculo se ejecutó durante meses en un único Dell PowerEdge R7725, llevando al límite la infraestructura moderna de CPU y almacenamiento, a la vez que demostró el gran avance del hardware empresarial. Sin embargo, cuando finalmente terminó, el récord resultó ser solo una parte de la historia. El cálculo produjo un conjunto de datos masivo compuesto por 628 archivos, cada uno de aproximadamente 206 GB, con un total de más de 130 TB. Estos archivos representan el resultado completo del cálculo y suelen ser la parte más interesante de un proyecto como este. Los matemáticos, desarrolladores y científicos de datos a menudo desean explorar conjuntos de datos como este con mayor profundidad, ya sea para validar partes del cálculo, experimentar con nuevos métodos analíticos o trabajar con conjuntos de datos numéricos inusualmente grandes.
Esto plantea un problema práctico que va mucho más allá del cálculo de Pi. Las cargas de trabajo computacionales modernas generan cada vez más conjuntos de datos de salida enormes que deben permanecer accesibles mucho después de que finalice el proceso. Las simulaciones científicas, los análisis genómicos y los entrenamientos de IA a gran escala producen resultados que pueden abarcar decenas o cientos de terabytes. Si bien un entorno de laboratorio puede ser ideal para generar esos datos, rara vez es el mejor lugar para alojarlos indefinidamente para una audiencia global.
Para nuestro proyecto Pi, mantener más de 130 TB de resultados almacenados permanentemente en el laboratorio de StorageReview no era la solución adecuada. Los investigadores ya habían comenzado a solicitar acceso, y para que el conjunto de datos estuviera ampliamente disponible se requería una infraestructura capaz de almacenarlo de forma fiable y distribuirlo de manera eficiente.
Ahí es donde Backblaze intervino. La compañía aloja el conjunto completo de datos de Pi en Backblaze B2 Cloud Storage, lo que permite que los investigadores y aficionados que deseen trabajar con los resultados puedan acceder a ellos. Proporcionar almacenamiento duradero y acceso global para un conjunto de datos de este tamaño es un compromiso importante, y agradecemos la ayuda de Backblaze para garantizar que los resultados de este cálculo sin precedentes permanezcan disponibles para toda la comunidad.
Esta colaboración también ilustra una tendencia cada vez más frecuente en la infraestructura moderna: las ventajas prácticas de los flujos de trabajo híbridos que combinan la computación local con el almacenamiento y la distribución en la nube. El cálculo de Pi se realizó íntegramente en nuestro laboratorio, en un único sistema, pero una vez finalizado el trabajo, la nube se convirtió en el lugar idóneo para alojar y compartir los resultados.
Sin embargo, antes de que eso sucediera, los datos debían viajar desde nuestro laboratorio hasta Backblaze. Transferir más de 130 TB de resultados no es tarea fácil, pero gracias a una buena conexión de red, la transferencia se completó en menos de dos semanas, manteniendo un rendimiento constante de 2 Gbps durante gran parte del proceso. Los conjuntos de datos grandes siguen siendo un factor determinante, y cuando se transfieren cientos de gigabytes a la vez, el ancho de banda se convierte rápidamente en el factor limitante.
Ahora que el conjunto de datos está almacenado de forma segura en Backblaze B2, los resultados del cálculo de 314 billones de dígitos pueden trascender los límites de nuestro laboratorio. Los investigadores pueden descargar los archivos, experimentar con ellos, verificar secciones del cálculo o explorar los dígitos para sus propios proyectos. Con el Día de Pi 2026 a la vuelta de la esquina, este es el momento perfecto para poner el conjunto de datos a disposición del público.
Backblaze B2: Almacenamiento en la nube empresarial para datos a gran escala
Para que el conjunto de datos de Pi estuviera ampliamente disponible, se requería una infraestructura capaz de almacenar y distribuir de forma fiable grandes volúmenes de datos. Backblaze B2 Cloud Storage es una plataforma de almacenamiento de objetos empresarial diseñada precisamente para este tipo de carga de trabajo. El almacenamiento de objetos permite guardar colecciones masivas de archivos en depósitos de objetos escalables, en lugar de en jerarquías de archivos tradicionales, lo que lo hace ideal para grandes conjuntos de datos, copias de seguridad y flujos de datos modernos. B2 también es compatible con las API de S3, lo que permite a las organizaciones interactuar con el servicio mediante herramientas y flujos de trabajo conocidos sin necesidad de rediseñar las aplicaciones o los procesos de datos existentes.
Backblaze ha centrado su plataforma en ofrecer almacenamiento duradero con una economía sencilla y una operación simple. Su arquitectura está diseñada para una durabilidad de datos del 99,9
Alojar el conjunto de datos en Backblaze B2
Una vez completado el cálculo del PI de 314 billones de dígitos y transferidos los datos del R7725 al almacenamiento NAS, surgió la cuestión de cómo poner el conjunto de datos a disposición del público. Distribuir 130 TB directamente desde el laboratorio no era una opción viable. Nuestra conexión WAN opera a un máximo de 2 Gbps de subida y 2 Gbps de bajada, y se comparte entre todas las operaciones del laboratorio. Las descargas públicas continuas a una escala significativa habrían generado interferencias con el trabajo diario, y el límite de ancho de banda por sí solo habría hecho que las descargas simultáneas de gran tamaño fueran lentas e inestables para cualquiera que intentara acceder a los datos.
La idea inicial era distribuir el conjunto de datos mediante BitTorrent. Si bien técnicamente habría funcionado, no es la opción más accesible para la mayoría de los usuarios. Descargar un conjunto de datos de 130 TB a través de torrent requiere un cliente, cierto conocimiento del funcionamiento de las descargas por torrent y paciencia con un proceso que no es tan sencillo como una descarga directa. Para un conjunto de datos destinado a ser ampliamente accesible a investigadores y a la comunidad en general, era conveniente evitar esas dificultades.
Backblaze B2 solucionó ambos problemas de forma eficaz. El conjunto de datos se aloja completamente en la infraestructura en la nube, por lo que las descargas públicas no dependen de la red WAN del laboratorio ni sobrecargan sus operaciones. Las conexiones a B2 se realizan mediante HTTPS directamente desde la infraestructura de Backblaze, lo que garantiza que las descargas sean seguras, consistentes y no dependan de la disponibilidad de terceros. El conjunto de datos completo reside ahora en el bucket pi-314-trillones como 628 objetos que suman aproximadamente 132 TB, organizados en una única ruta de datos y accesibles para cualquier persona, sin afectar al laboratorio.
La transferencia desde el NAS del laboratorio se gestionó con una configuración sencilla de Rclone, enrutada a través de nuestro UDM Pro Max, que actúa como puerta de enlace del laboratorio, a una velocidad constante de poco más de 2 Gbps durante toda la subida. Con ese rendimiento, transferir 130 TB requirió aproximadamente 10 días de transferencia continua. Los gráficos siguientes muestran el rendimiento tanto por minuto como acumulado.
Utilización de la WAN durante la transferencia
El panel de control de la red UniFi del laboratorio confirma las características de carga durante el período de transferencia. La interfaz WAN muestra a Backblaze como la aplicación dominante en volumen de tráfico, con un rendimiento de carga de 2.27 Gbps y un uso mensual de datos WAN registrado de 90.9 TB durante el período. La conexión se mantuvo estable en todo momento, sin pérdidas de paquetes significativas durante la transferencia.

El panel de control de UniFi muestra un rendimiento de subida sostenido de más de 2 Gbps con Backblaze como la principal aplicación WAN durante el período de transferencia.
Rendimiento de transferencia por minuto
El gráfico a continuación muestra el rendimiento de transferencia muestreado por minuto en un intervalo representativo de la carga. Las barras alcanzan consistentemente entre 15 y 16 gigabytes por minuto, lo que coincide con una velocidad de línea sostenida de aproximadamente 2 Gbps. Las breves pausas visibles en el gráfico corresponden a las validaciones de suma de comprobación que se realizan periódicamente durante la transferencia para confirmar la integridad de los datos antes de continuar.

Tasa de transferencia de bytes por minuto durante la carga, que muestra un rendimiento constante de entre 15 y 16 GB por minuto en toda la ventana de transferencia activa.
Progreso de transferencia acumulada
El gráfico de bytes acumulados registra el total de datos transferidos desde el 4 hasta el 10 de febrero, mostrando un aumento lineal constante de 0 a aproximadamente 100 TB durante ese período. La pendiente constante a lo largo de todo el período refleja la estabilidad de la transferencia, sin interrupciones importantes ni caídas en la velocidad.
Diseño final de los cubos
Backblaze creó el bucket pi-314-trillion, que contiene los 628 archivos y tiene un tamaño confirmado de 132 210,5 GB. El bucket está configurado como privado, conservando todas las versiones de los archivos, y es accesible a través del punto final compatible con S3 en s3.us-west-004.backblazeb2.com. El almacenamiento de objetos simplifica la gestión de un conjunto de datos de esta magnitud. Cada archivo es direccionable individualmente, se puede obtener la lista completa mediante programación y no hay jerarquías de sistemas de archivos ni límites de volumen que sortear.

La consola de Backblaze B2 muestra el bucket pi-314-trillion, que confirma 628 archivos, un tamaño total de 132,210.5 GB y el punto final compatible con S3.
Acceso al conjunto de datos
Los investigadores nos han estado pidiendo acceso a estos datos; de hecho, ya tenemos un proyecto en marcha. Michael Kleber es ingeniero principal de software en Google, pero ha estado trabajando con los dígitos de pi desde que se doctoró en matemáticas en 1999. Los matemáticos esperan que pi sea un número normal , así que es razonable preguntarse: «De las 10^d secuencias de d dígitos, ¿cuál tarda más en aparecer por primera vez en pi, y cuántos dígitos requiere?». Kleber realizó la búsqueda hasta d=7, y cuando Fabrice Bellard calculó 2.7 billones de dígitos de pi en 2009, Kleber lo animó a extenderla hasta d=11, el límite de lo que era posible en ese momento. «Con 314 billones de dígitos aleatorios, hay alrededor de un 79 % de probabilidad de ver todas las cadenas de longitud 13», dice Kleber, «¡así que espero que tengamos suerte!». Ahora que Backblaze ha puesto los datos a disposición de todos, esperamos que esto ocurra con mucha más frecuencia.
El conjunto de datos PI está alojado en Backblaze B2 y disponible para su descarga para cualquier persona interesada en trabajar con él. El acceso se proporciona mediante un enlace de solicitud, a través del cual los usuarios pueden obtener credenciales o instrucciones de descarga para recuperar los archivos del bucket. Backblaze alojará el conjunto de datos para garantizar que permanezca disponible para la investigación y la verificación durante todo el período.
Opciones de descarga
Los usuarios pueden recuperar archivos individuales del conjunto de datos o la colección completa de 130 TB, según sus necesidades. El bucket está estructurado de forma que se pueden seleccionar y descargar objetos individuales directamente sin necesidad de descargar todo el conjunto de datos. Para quienes deseen recuperar todo, se puede realizar una sincronización completa del bucket utilizando las herramientas que se describen a continuación. Para esta opción, se recomienda disponer de 135 TB de espacio libre.
Herramientas recomendadas
- Rclone Es la herramienta recomendada para acceder al conjunto de datos. Se integra a la perfección con Backblaze B2 y permite a los usuarios ajustar el proceso de descarga según sus necesidades de ancho de banda.
- API compatible con S3Por lo tanto, cualquier herramienta de descarga con capacidad para S3 puede utilizarse para recuperar los datos. El único requisito es que la herramienta permita modificar la URL del punto final de S3 predeterminado para que apunte al punto final de B2 en lugar de AWS.
Un ejemplo real de infraestructura híbrida
Nuestro cálculo de Pi, con 314 billones de dígitos, es un claro ejemplo de cómo funciona una infraestructura híbrida en la práctica. El cálculo se ejecutó íntegramente en un único servidor Dell PowerEdge R7725 en el laboratorio de StorageReview, pero dado que el sistema debía reasignarse a otros proyectos y tareas una vez finalizada la ejecución, mantener 130 TB de resultados alojados permanentemente en el laboratorio nunca fue una opción viable.
Existe un deseo real de compartir los datos con quienes quieran utilizarlos, ya sea para trabajos científicos serios o simplemente para satisfacer la curiosidad sobre las cifras. Sin embargo, alojar un conjunto de datos de ese tamaño en el laboratorio se convierte rápidamente en una carga para las operaciones. El ancho de banda se consume, la infraestructura se satura y el trabajo diario del laboratorio compite con cada solicitud de descarga entrante.
Una solución como Backblaze B2 elimina todas esas dificultades. Los datos residen en una infraestructura en la nube diseñada específicamente para conjuntos de datos de esta magnitud, con un rendimiento que se adapta a la demanda, múltiples puntos de redundancia para garantizar la integridad de los datos y la seguridad y la experiencia operativa propias de una plataforma de almacenamiento empresarial. El procesamiento se realizó en las instalaciones porque así lo requería el proyecto. El almacenamiento se encuentra en la nube porque, sencillamente, es la mejor opción para todo lo que venga después.




Amazon