No início deste ano, estabelecemos um novo recorde ao calcular 314 trilhões de dígitos de Pi . O cálculo foi executado durante meses em um único Dell PowerEdge R7725, levando a infraestrutura moderna de CPU e armazenamento ao limite e demonstrando o quanto o hardware corporativo evoluiu. Quando a execução finalmente terminou, no entanto, o próprio recorde se revelou apenas parte da história. O cálculo gerou um conjunto de dados massivo composto por 628 arquivos, cada um com aproximadamente 206 GB, totalizando mais de 130 TB. Esses arquivos representam o artefato completo do cálculo e geralmente são a parte mais interessante de um projeto como este. Matemáticos, desenvolvedores e cientistas de dados frequentemente desejam explorar conjuntos de dados como este mais a fundo, seja para validar partes do cálculo, experimentar novos métodos analíticos ou trabalhar com conjuntos de dados numéricos excepcionalmente grandes.
Isso cria um problema prático que vai muito além do cálculo de Pi. As cargas de trabalho computacionais modernas geram, cada vez mais, conjuntos de dados de saída enormes que precisam permanecer acessíveis muito tempo depois da conclusão da tarefa computacional. Simulações científicas, análises genômicas e treinamentos de IA em larga escala produzem resultados que podem abranger dezenas ou centenas de terabytes. Embora um ambiente de laboratório possa ser perfeitamente adequado para gerar esses dados, raramente é o melhor lugar para hospedá-los indefinidamente para um público global.
Para o nosso projeto com o Raspberry Pi, manter mais de 130 TB de resultados permanentemente armazenados no laboratório da StorageReview não era a solução ideal. Os pesquisadores já haviam começado a solicitar acesso, e disponibilizar o conjunto de dados amplamente exigia uma infraestrutura capaz de armazená-lo de forma confiável e distribuí-lo com eficiência.
Foi aí que a Backblaze entrou em cena. A empresa está hospedando todo o conjunto de dados do Raspberry Pi no Backblaze B2 Cloud Storage, tornando os resultados acessíveis a pesquisadores e entusiastas que desejam trabalhar com eles. Fornecer armazenamento durável e acesso global para um conjunto de dados desse tamanho é um compromisso significativo, e agradecemos a ajuda da Backblaze para garantir que os resultados dessa computação recordista permaneçam disponíveis para a comunidade em geral.
A colaboração também ilustra uma tendência que observamos cada vez mais na infraestrutura moderna: os benefícios práticos dos fluxos de trabalho híbridos que combinam computação local com armazenamento e distribuição em nuvem. O cálculo do Pi em si foi executado inteiramente em nosso laboratório, em um único sistema, mas, uma vez concluído o trabalho, a nuvem tornou-se o local lógico para hospedar e compartilhar os resultados.
Antes que isso pudesse acontecer, porém, os dados precisavam viajar do nosso laboratório para a Backblaze. Transferir mais de 130 TB de resultados não é tarefa fácil, mas com uma conexão de rede robusta, a transferência foi concluída em menos de duas semanas, mantendo uma taxa de transferência constante de 2 Gbps durante grande parte do processo. Grandes conjuntos de dados ainda exercem influência, e quando se trata de transferir centenas de gigabytes por vez, a largura de banda rapidamente se torna o fator limitante.
Agora que o conjunto de dados está armazenado com segurança no Backblaze B2, os resultados do cálculo de 314 trilhões de dígitos podem ir além dos limites do nosso laboratório. Pesquisadores podem baixar os arquivos, experimentar com eles, verificar partes do cálculo ou explorar os dígitos para seus próprios projetos. Com o Dia do Pi de 2026 se aproximando, este é o momento perfeito para disponibilizar o conjunto de dados.
Backblaze B2: Armazenamento em nuvem empresarial para dados em larga escala
Para disponibilizar amplamente o conjunto de dados do Raspberry Pi, foi necessária uma infraestrutura capaz de armazenar e distribuir grandes volumes de dados de forma confiável. O Backblaze B2 Cloud Storage é uma plataforma de armazenamento de objetos corporativa projetada exatamente para esse tipo de carga de trabalho. O armazenamento de objetos permite que coleções massivas de arquivos sejam armazenadas em buckets de objetos escaláveis, em vez de forçá-las a hierarquias de arquivos tradicionais, tornando-o ideal para grandes conjuntos de dados, backups e pipelines de dados modernos. O B2 também oferece suporte a APIs compatíveis com o S3, permitindo que as organizações interajam com o serviço usando ferramentas e fluxos de trabalho familiares, sem precisar redesenhar aplicativos ou processos de dados existentes.
A Backblaze concentrou sua plataforma em fornecer armazenamento durável com economia transparente e simplicidade operacional. A arquitetura foi projetada para oferecer 11% de durabilidade de dados, distribuindo-os entre pods de armazenamento para garantir confiabilidade a longo prazo em escala. A empresa também construiu uma reputação de transparência, publicando relatórios detalhados de confiabilidade de unidades e mantendo preços previsíveis, o que é muito apreciado por equipes de infraestrutura. No nosso caso, o B2 oferece uma solução prática para hospedar um conjunto de dados muito grande gerado em nosso laboratório, garantindo que os resultados permaneçam acessíveis a qualquer pessoa interessada em explorar os dados, ao mesmo tempo que demonstra como o armazenamento em nuvem pode ampliar o alcance dos ambientes de computação locais. Além do Backblaze B2 Cloud Storage padrão, o B2 Overdrive suporta até 1 Tbps de throughput.
Hospedagem do conjunto de dados no Backblaze B2
Com o cálculo da PI de 314 trilhões de dígitos concluído e os dados transferidos do R7725 para o armazenamento NAS, a questão de como disponibilizar o conjunto de dados publicamente exigiu alguma reflexão. Disponibilizar 130 TB diretamente do laboratório não era uma opção viável. Nossa conexão WAN opera com um máximo de 2 Gbps de upload e 2 Gbps de download e é compartilhada por todas as operações do laboratório. Downloads públicos contínuos em qualquer escala significativa criariam conflitos com o trabalho diário, e o limite de largura de banda por si só tornaria grandes downloads simultâneos lentos e instáveis para qualquer pessoa que tentasse acessar os dados.
A ideia inicial era distribuir o conjunto de dados via BitTorrent. Embora isso funcionasse tecnicamente, não seria a experiência mais acessível para a maioria dos usuários. Baixar um conjunto de dados de 130 TB via torrent exige um cliente, alguma familiaridade com o funcionamento de torrents e paciência com um processo que não é tão simples quanto um download direto. Para um conjunto de dados destinado a ser amplamente acessível a pesquisadores e à comunidade em geral, essa dificuldade valia a pena ser evitada.
O Backblaze B2 resolveu ambos os problemas de forma impecável. O conjunto de dados está hospedado inteiramente em infraestrutura de nuvem, portanto, os downloads públicos não dependem da WAN do laboratório e não sobrecarregam as operações do mesmo. As conexões com o B2 são feitas via HTTPS diretamente da infraestrutura do Backblaze, o que significa que os downloads são seguros, consistentes e não estão sujeitos à disponibilidade de seeders de terceiros. O conjunto de dados completo agora reside no bucket pi-314-trillion como 628 objetos, totalizando cerca de 132 TB, organizados em um único caminho de dados e acessíveis a qualquer pessoa, sem qualquer impacto no laboratório.
A transferência do NAS do laboratório foi feita com uma configuração simples do Rclone, roteada através do nosso UDM Pro Max, que serve como gateway do laboratório, a uma taxa constante de pouco mais de 2 Gbps durante todo o upload. Com essa taxa de transferência, mover 130 TB exigiu aproximadamente 10 dias de transferência contínua. Os gráficos abaixo mostram como isso se apresentou, tanto em termos de taxa por minuto quanto cumulativa.
Utilização da WAN durante a transferência
O painel de controle da rede UniFi para o laboratório confirma as características de upload ao longo da janela de transferência. A interface WAN mostra o Backblaze como o aplicativo dominante em volume de tráfego, com taxa de transferência de upload de 2.27 Gbps e uso mensal de dados da WAN registrado em 90.9 TB para o período. A conexão permaneceu estável durante todo o período, sem eventos significativos de perda de pacotes.

O painel de controle do UniFi mostra uma taxa de transferência de upload sustentada de mais de 2 Gbps, com o Backblaze como o principal aplicativo WAN durante o período de transferência.
Taxa de transferência por minuto
O gráfico abaixo mostra a taxa de transferência amostrada por minuto em uma janela representativa do upload. As barras atingem consistentemente entre 15 e 16 gigabytes por minuto, o que corresponde a uma taxa de linha sustentada de aproximadamente 2 Gbps. As breves lacunas visíveis no gráfico correspondem a pausas de validação de checksum executadas periodicamente durante a transferência para confirmar a integridade dos dados antes de prosseguir.

Taxa de transferência de bytes por minuto durante o upload, mostrando uma taxa de transferência consistente entre 15 e 16 GB por minuto ao longo da janela de transferência ativa.
Progresso cumulativo de transferências
O gráfico de bytes cumulativos acompanha o total de dados transferidos de 4 a 10 de fevereiro, mostrando um aumento linear consistente de 0 a aproximadamente 100 TB durante esse período. A inclinação constante ao longo de todo o período reflete a estabilidade da transferência, sem grandes interrupções ou quedas de taxa.
Layout final do balde
A Backblaze criou o bucket pi-314-trillion, que contém todos os 628 arquivos e tem um tamanho confirmado de 132,210.5 GB. O bucket está configurado como privado, com todas as versões dos arquivos mantidas, e é acessível pelo endpoint compatível com S3 em s3.us-west-004.backblazeb2.com. O armazenamento de objetos torna o gerenciamento de um conjunto de dados dessa escala bastante simples. Cada arquivo é endereçável individualmente, a lista completa pode ser obtida programaticamente e não há hierarquias de sistema de arquivos ou limites de volume a serem contornados.

O console do Backblaze B2 mostra o bucket pi-314-trillion, confirmando 628 arquivos, tamanho total de 132,210.5 GB e o endpoint compatível com S3.
Acessando o conjunto de dados
Pesquisadores têm nos pedido acesso a esses dados; na verdade, já temos um projeto em andamento. Michael Kleber é Engenheiro de Software Sênior no Google, mas ele trabalha com os dígitos de pi desde que se formou em matemática, em 1999. Matemáticos esperam que pi seja um número normal , então é razoável perguntar: “Das 10^d sequências de d dígitos, qual leva mais tempo para aparecer pela primeira vez em pi e quantos dígitos ela possui?” Kleber realizou a busca até d=7 e, quando Fabrice Bellard calculou 2.7 trilhões de dígitos de pi em 2009, Kleber o incentivou a estender a busca até d=11, o limite do que era possível na época. “Com 314 trilhões de dígitos aleatórios, há cerca de 79% de chance de encontrarmos todas as sequências de comprimento 13”, diz Kleber, “então espero que tenhamos sorte!” Esperamos muito mais disso agora que a Backblaze disponibilizou os dados para todos.
O conjunto de dados PI está hospedado no Backblaze B2 e disponível para download por qualquer pessoa interessada em trabalhar com os dados. O acesso é fornecido por meio de um link de solicitação, através do qual os usuários podem obter credenciais ou instruções de download para recuperar arquivos do bucket. O Backblaze hospedará o conjunto de dados para garantir que os dados permaneçam disponíveis para pesquisa e verificação durante todo o período.
Opções de Download
Os usuários podem recuperar arquivos individuais do conjunto de dados ou a coleção completa de 130 TB, dependendo de suas necessidades. O bucket é estruturado de forma que objetos individuais possam ser acessados e baixados diretamente, sem a necessidade de baixar todo o conjunto de dados. Para aqueles que desejam recuperar tudo, uma sincronização completa do bucket pode ser realizada utilizando as ferramentas descritas abaixo. Para essa opção, recomenda-se 135 TB de espaço livre.
Ferramentas Recomendadas
- Rclone é a ferramenta recomendada para acessar o conjunto de dados. Ela se integra perfeitamente ao Backblaze B2 e permite que os usuários ajustem o processo de download de acordo com suas necessidades de largura de banda disponível.
- API compatível com S3Portanto, qualquer ferramenta de download compatível com S3 pode ser usada para recuperar os dados. O único requisito é que a ferramenta permita alterar a URL do endpoint S3 padrão para apontar para o endpoint da B2 em vez da AWS.
Um exemplo real de infraestrutura híbrida
Nosso cálculo de Pi com 314 trilhões de dígitos é um exemplo claro de como a infraestrutura híbrida se apresenta na prática. O cálculo foi executado inteiramente em um único Dell PowerEdge R7725 no laboratório da StorageReview, mas, como o sistema precisava ser realocado para outros projetos e tarefas após a conclusão do cálculo, manter 130 TB de resultados hospedados permanentemente no laboratório nunca foi uma opção sustentável.
O desejo de disponibilizar os dados para aqueles que desejam utilizá-los, seja para trabalhos científicos sérios ou para satisfazer a curiosidade sobre os números, é real. No entanto, hospedar um conjunto de dados desse tamanho dentro do laboratório rapidamente se torna um fardo para as operações. A largura de banda é consumida, a infraestrutura fica sobrecarregada e o trabalho diário do laboratório compete com cada solicitação de download recebida.
Uma solução como o Backblaze B2 elimina todos esses atritos. Os dados residem em uma infraestrutura de nuvem criada especificamente para conjuntos de dados dessa escala, com taxa de transferência que se adapta à demanda, múltiplos pontos de redundância para garantir que nada se perca e a segurança e a expertise operacional que acompanham uma plataforma de armazenamento empresarial. O processamento computacional era local porque a tarefa exigia isso. O armazenamento está na nuvem porque essa é simplesmente a melhor ferramenta para tudo o que vem depois.




Amazon