Eerder dit jaar vestigden we een nieuw record door 314 biljoen cijfers van Pi te berekenen . De berekening duurde maanden op één enkele Dell PowerEdge R7725, waarbij moderne CPU- en opslaginfrastructuur tot het uiterste werd gedreven en werd aangetoond hoe ver de hardware voor bedrijven is gevorderd. Toen de berekening eindelijk was voltooid, bleek het record zelf echter slechts een deel van het verhaal te zijn. De berekening leverde een enorme dataset op, bestaande uit 628 bestanden van elk ongeveer 206 GB, met een totale omvang van meer dan 130 TB. Deze bestanden vertegenwoordigen het volledige resultaat van de berekening en zijn vaak het meest interessante onderdeel van een dergelijk project. Wiskundigen, ontwikkelaars en datawetenschappers willen dergelijke datasets vaak verder onderzoeken, of het nu is om delen van de berekening te valideren, te experimenteren met nieuwe analysemethoden of te werken met ongebruikelijk grote numerieke datasets.
Dat leidt tot een praktisch probleem dat veel verder reikt dan het berekenen van Pi. Moderne computertaken genereren steeds vaker enorme datasets die lang na de voltooiing van de berekening toegankelijk moeten blijven. Wetenschappelijke simulaties, genoomanalyses en grootschalige AI-trainingen leveren allemaal resultaten op die tientallen of honderden terabytes groot kunnen zijn. Hoewel een laboratoriumomgeving perfect geschikt is om die data te genereren, is het zelden de beste plek om die data voor onbepaalde tijd voor een wereldwijd publiek beschikbaar te stellen.
Voor ons Pi-project was het permanent opslaan van meer dan 130 TB aan resultaten in het StorageReview-lab niet de juiste oplossing. Onderzoekers hadden al toegang aangevraagd en om de dataset breed beschikbaar te maken, was een infrastructuur nodig die de dataset betrouwbaar kon opslaan en efficiënt kon distribueren.
Dat is waar Backblaze in beeld kwam. Het bedrijf host de volledige Pi-dataset in Backblaze B2 Cloud Storage, waardoor de resultaten toegankelijk zijn voor onderzoekers en enthousiastelingen die ermee willen werken. Het bieden van duurzame opslag en wereldwijde toegang voor een dataset van deze omvang is een waardevolle toezegging, en we waarderen de hulp van Backblaze enorm om ervoor te zorgen dat de resultaten van deze recordbrekende berekening beschikbaar blijven voor de bredere gemeenschap.
De samenwerking illustreert ook een trend die we steeds vaker zien in moderne infrastructuren: de praktische voordelen van hybride workflows die on-premises computing combineren met cloudgebaseerde opslag en distributie. De Pi-berekening zelf werd volledig in ons lab op één systeem uitgevoerd, maar zodra het werk was voltooid, was de cloud de logische plek om de resultaten te hosten en te delen.
Voordat dat kon gebeuren, moesten de gegevens echter eerst van ons lab naar Backblaze worden overgebracht. Het verplaatsen van meer dan 130 TB aan resultaten is geen kleine klus, maar met een stabiele netwerkverbinding was de overdracht in minder dan twee weken voltooid, waarbij gedurende een groot deel van het proces een constante doorvoer van 2 Gbps werd gehandhaafd. Grote datasets hebben nog steeds een grote impact, en wanneer je honderden gigabytes tegelijk verplaatst, wordt bandbreedte al snel de beperkende factor.
Nu de dataset veilig is opgeslagen in Backblaze B2, kunnen de resultaten van de berekening van 314 biljoen cijfers verder reiken dan de grenzen van ons lab. Onderzoekers kunnen de bestanden downloaden, ermee experimenteren, delen van de berekening verifiëren of de cijfers verkennen voor hun eigen projecten. Met Pi-dag 2026 in aantocht is dit het perfecte moment om de dataset beschikbaar te stellen.
Backblaze B2: Enterprise cloudopslag voor grootschalige data
Om de Pi-dataset breed beschikbaar te maken, was een infrastructuur nodig die in staat was om zeer grote hoeveelheden data betrouwbaar op te slaan en te distribueren. Backblaze B2 Cloud Storage is een objectopslagplatform voor bedrijven, speciaal ontworpen voor dit soort workloads. Objectopslag maakt het mogelijk om enorme verzamelingen bestanden op te slaan in schaalbare objectbuckets in plaats van ze te dwingen in traditionele bestandsstructuren. Dit maakt het platform uitermate geschikt voor grote datasets, back-ups en moderne datapipelines. B2 ondersteunt bovendien S3-compatibele API's, waardoor organisaties met de service kunnen communiceren met behulp van vertrouwde tools en workflows, zonder bestaande applicaties of dataprocessen opnieuw te hoeven ontwerpen.
Backblaze heeft zich met zijn platform gericht op het leveren van duurzame opslag met een eenvoudige prijs en operationele eenvoud. De architectuur is ontworpen voor een data-duurzaamheid van 99,9 ...
De dataset hosten in Backblaze B2
Nadat de berekening van PI met 314 biljoen cijfers was voltooid en de data van de R7725 naar NAS-opslag was overgezet, rees de vraag hoe de dataset publiekelijk beschikbaar te maken. Het rechtstreeks aanbieden van 130 TB vanuit het lab was geen praktische optie. Onze WAN-verbinding heeft een maximale upload- en downloadsnelheid van 2 Gbps en wordt gedeeld door alle labactiviteiten. Langdurige publieke downloads op een aanzienlijke schaal zouden de dagelijkse werkzaamheden verstoren, en de bandbreedtebeperking alleen al zou grote gelijktijdige downloads traag en onbetrouwbaar maken voor iedereen die de data probeert te benaderen.
Het oorspronkelijke idee was om de dataset via BitTorrent te verspreiden. Hoewel dat technisch gezien zou hebben gewerkt, is het voor de meeste gebruikers niet de meest toegankelijke methode. Het downloaden van een dataset van 130 TB via torrent vereist een client, enige kennis van torrenting en geduld met een proces dat niet zo eenvoudig is als een directe download. Voor een dataset die breed toegankelijk moet zijn voor onderzoekers en de bredere gemeenschap, was het de moeite waard om die drempel te vermijden.
Backblaze B2 heeft beide problemen netjes opgelost. De dataset wordt volledig in de cloud gehost, waardoor openbare downloads niet afhankelijk zijn van het WAN-netwerk van het lab en geen belasting vormen voor de labactiviteiten. Verbindingen met B2 worden rechtstreeks via HTTPS vanuit de Backblaze-infrastructuur aangeboden, wat betekent dat downloads veilig, consistent en niet afhankelijk zijn van de beschikbaarheid van externe seeders. De volledige dataset bevindt zich nu in de bucket pi-314-trillion als 628 objecten met een totale grootte van ongeveer 132 TB, georganiseerd onder één datapad en toegankelijk voor iedereen, zonder impact op het lab.
De overdracht van de NAS in het lab werd afgehandeld met een eenvoudige Rclone-configuratie, gerouteerd via onze UDM Pro Max, die als labgateway fungeert, met een constante snelheid van iets meer dan 2 Gbps gedurende de hele upload. Met die doorvoersnelheid duurde het verplaatsen van 130 TB ongeveer 10 dagen onafgebroken. De onderstaande grafieken laten zien hoe dat eruitzag, zowel per minuut als cumulatief.
WAN-gebruik tijdens overdracht
Het UniFi-netwerkdashboard voor het lab bevestigt de uploadkarakteristieken gedurende het overdrachtsvenster. De WAN-interface toont Backblaze als de dominante applicatie qua verkeersvolume, met een uploaddoorvoer van 2.27 Gbps en een maandelijks WAN-dataverbruik van 90.9 TB gedurende de periode. De verbinding bleef gedurende de hele overdracht stabiel, zonder noemenswaardig pakketverlies.

Het UniFi-dashboard toont een constante uploaddoorvoer van meer dan 2 Gbps met Backblaze als de belangrijkste WAN-applicatie gedurende de overdrachtsperiode.
Overdrachtsdoorvoer per minuut
De onderstaande grafiek toont de overdrachtssnelheid per minuut, gemeten over een representatief tijdsvenster van de upload. De balken bereiken consistent waarden tussen de 15 en 16 gigabyte per minuut, wat overeenkomt met een constante lijnsnelheid van ongeveer 2 Gbps. De korte onderbrekingen in de grafiek corresponderen met periodieke pauzes voor checksum-validatie tijdens de overdracht, om de gegevensintegriteit te controleren voordat de overdracht wordt voortgezet.

De overdrachtssnelheid per minuut tijdens het uploaden laat een constante doorvoer zien van 15 tot 16 GB per minuut gedurende het actieve overdrachtsvenster.
Cumulatieve overdrachtsvoortgang
De grafiek met cumulatieve bytes toont de totale hoeveelheid overgedragen data van 4 tot en met 10 februari, en laat een consistente lineaire stijging zien van 0 tot ongeveer 100 TB gedurende die periode. De gestage helling over de gehele periode weerspiegelt de stabiliteit van de overdracht zonder grote onderbrekingen of snelheidsdalingen.
Definitieve indeling van de emmers
Backblaze heeft de bucket pi-314-trillion aangemaakt, die alle 628 bestanden bevat en een bevestigde grootte heeft van 132,210.5 GB. De bucket is geconfigureerd als privé, waarbij alle bestandsversies worden bewaard, en is toegankelijk via het S3-compatibele eindpunt op s3.us-west-004.backblazeb2.com. Objectopslag maakt het beheren van een dataset van deze omvang eenvoudig. Elk bestand is individueel adresseerbaar, de volledige lijst kan programmatisch worden opgevraagd en er zijn geen bestandsysteemhiërarchieën of volumelimieten waarmee rekening moet worden gehouden.

De Backblaze B2-console toont de pi-314-trillion bucket met 628 bestanden, een totale grootte van 132,210.5 GB en een S3-compatibel eindpunt.
Toegang tot de dataset
Onderzoekers hebben ons om toegang tot deze data gevraagd; sterker nog, we hebben al een project lopen. Michael Kleber is Principal Software Engineer bij Google, maar hij speelt al met de cijfers van pi sinds hij in 1999 net zijn doctoraat in de wiskunde had behaald. Wiskundigen gaan ervan uit dat pi een normaal getal is , dus het is redelijk om te vragen: "Van de 10^d reeksen van d cijfers, welke duurt het langst voordat deze voor het eerst in pi voorkomt, en hoeveel cijfers heeft die reeks nodig?" Kleber voerde de zoektocht uit tot d=7, en toen Fabrice Bellard in 2009 2.7 biljoen cijfers van pi berekende, moedigde Kleber hem aan om door te gaan tot d=11, de limiet van wat destijds mogelijk was. "Met 314 biljoen willekeurige cijfers is er ongeveer 79% kans om alle reeksen van lengte 13 te zien", zegt Kleber, "dus ik hoop dat we geluk hebben!" We verwachten dit nu veel vaker, nu Backblaze de data voor iedereen beschikbaar heeft gemaakt.
De PI-dataset wordt gehost op Backblaze B2 en is beschikbaar voor iedereen die geïnteresseerd is om met de data te werken. Toegang wordt verleend via een aanvraaglink, waarmee gebruikers inloggegevens of downloadinstructies kunnen verkrijgen om bestanden uit de bucket te halen. Backblaze zal de dataset hosten om ervoor te zorgen dat de data gedurende die periode beschikbaar blijft voor onderzoek en verificatie.
Download opties
Gebruikers kunnen, afhankelijk van hun behoeften, individuele bestanden uit de dataset ophalen of de volledige collectie van 130 TB. De bucket is zo gestructureerd dat individuele objecten direct kunnen worden benaderd en gedownload zonder de hele dataset te hoeven downloaden. Voor degenen die alles willen ophalen, kan een volledige synchronisatie van de bucket worden uitgevoerd met behulp van de onderstaande tools. Voor deze optie wordt 135 TB vrije ruimte aanbevolen.
Aanbevolen tools
- Rclone is de aanbevolen tool voor toegang tot de dataset. Het integreert naadloos met Backblaze B2 en stelt gebruikers in staat het downloadproces aan te passen aan hun beschikbare bandbreedte.
- S3-compatibele APIElke downloadtool met S3-functionaliteit kan dus worden gebruikt om de gegevens op te halen. De enige vereiste is dat de tool het mogelijk moet maken om de standaard S3-eindpunt-URL te overschrijven, zodat deze naar het B2-eindpunt verwijst in plaats van naar AWS.
Een concreet voorbeeld van hybride infrastructuur
Onze berekening van Pi, een getal met 314 biljoen cijfers, is een duidelijk voorbeeld van hoe een hybride infrastructuur er in de praktijk uitziet. De berekening werd volledig uitgevoerd op één enkele Dell PowerEdge R7725 in het StorageReview-lab, maar omdat het systeem na afloop van de berekening opnieuw moest worden toegewezen aan andere projecten en taken, was het permanent opslaan van 130 TB aan resultaten in het lab nooit een duurzame optie.
De wens om de data beschikbaar te stellen aan iedereen die er gebruik van wil maken, of het nu voor serieus wetenschappelijk werk is of om de nieuwsgierigheid naar de cijfers te bevredigen, is reëel. Maar het hosten van zo'n grote dataset binnen het lab wordt al snel een belasting voor de bedrijfsvoering. Bandbreedte raakt op, infrastructuur blijft bezet en de dagelijkse werkzaamheden van het lab concurreren met elk binnenkomend downloadverzoek.
Een oplossing zoals Backblaze B2 neemt al die frictie weg. De data bevindt zich in een cloudinfrastructuur die speciaal is ontworpen voor datasets van deze omvang, met een doorvoer die meegroeit met de vraag, meerdere redundantiepunten om ervoor te zorgen dat er niets verloren gaat, en de beveiliging en operationele expertise die horen bij een enterprise storage platform. De rekenkracht was lokaal omdat de taak dat vereiste. De opslag bevindt zich in de cloud omdat dat simpelweg de betere oplossing is voor alles wat daarna komt.




Amazon