StorageReview.com

Pi 레코드 이후: Backblaze B2로 130TB 데이터셋 서비스하기

클라우드  ◇  기업

올해 초, 저희는 파이(π)의 소수점 이하 314조 자리까지 계산하여 새로운 기록을 세웠습니다. 이 계산은 델 파워엣지 R7725 단일 서버에서 수개월 동안 진행되었으며 , 최신 CPU 및 스토리지 인프라의 한계를 시험하는 동시에 엔터프라이즈 하드웨어의 발전상을 보여주었습니다. 하지만 계산이 마침내 완료되었을 때, 기록 달성 자체는 이야기의 일부에 불과했습니다. 이 계산으로 약 206GB 크기의 파일 628개, 총 130TB가 넘는 방대한 데이터 세트가 생성되었습니다. 이 파일들은 계산의 모든 결과물을 담고 있으며, 이러한 프로젝트에서 가장 흥미로운 부분인 경우가 많습니다. 수학자, 개발자, 데이터 과학자들은 종종 이러한 데이터 세트를 더 자세히 살펴보고 싶어합니다. 계산의 일부를 검증하거나, 새로운 분석 방법을 실험하거나, 매우 큰 수치 데이터 세트를 다루기 위해서입니다.

이는 파이(π) 계산을 훨씬 뛰어넘는 실질적인 문제를 야기합니다. 현대의 컴퓨팅 작업은 점점 더 방대한 출력 데이터 세트를 생성하며, 이러한 데이터 세트는 계산 작업이 완료된 후에도 오랫동안 접근 가능해야 합니다. 과학 시뮬레이션, 유전체 분석, 대규모 AI 학습 실행 등은 모두 수십 또는 수백 테라바이트에 달하는 결과를 생성할 수 있습니다. 연구실 환경은 이러한 데이터를 생성하는 데는 완벽할 수 있지만, 전 세계 사용자를 위해 무기한으로 데이터를 보관하기에는 최적의 장소가 아닌 경우가 많습니다.

라즈베리 파이 프로젝트의 경우, 130TB가 넘는 결과를 StorageReview 연구실에 영구적으로 보관하는 것은 적절한 해결책이 아니었습니다. 연구원들이 이미 데이터 접근을 요청하기 시작했고, 데이터셋을 널리 활용하려면 안정적으로 저장하고 효율적으로 배포할 수 있는 인프라가 필요했습니다.

바로 이 지점에서 백블레이즈(Backblaze)가 나섰습니다. 백블레이즈는 전체 파이 데이터셋을 백블레이즈 B2 클라우드 스토리지에 호스팅하여, 연구자와 애호가들이 결과를 활용할 수 있도록 지원하고 있습니다. 이처럼 방대한 데이터셋에 영구적인 저장 공간과 전 세계적인 접근성을 제공하는 것은 매우 의미 있는 일이며, 기록적인 연산 결과가 더 많은 사람들이 이용할 수 있도록 보장해 준 백블레이즈의 도움에 깊이 감사드립니다.

이번 협업은 현대 인프라에서 점점 더 많이 나타나는 추세, 즉 온프레미스 컴퓨팅과 클라우드 기반 스토리지 및 배포를 결합하는 하이브리드 워크플로우의 실질적인 이점을 잘 보여줍니다. 파이(π) 계산 자체는 연구실의 단일 시스템에서 완전히 수행되었지만, 작업이 완료된 후에는 클라우드가 결과를 저장하고 공유하는 데 가장 적합한 장소가 되었습니다.

하지만 그 전에 먼저 데이터가 저희 연구실에서 백블레이즈(Backblaze)로 전송되어야 했습니다. 130TB가 넘는 데이터 세트를 옮기는 것은 결코 쉬운 일이 아니지만, 원활한 네트워크 덕분에 2주도 채 안 되어 전송이 완료되었고, 전송 과정 대부분에서 2Gbps의 안정적인 처리량을 유지했습니다. 대규모 데이터 세트는 여전히 용량이 크기 때문에 한 번에 수백 기가바이트를 전송할 때는 대역폭이 빠르게 병목 현상을 일으킵니다.

이제 데이터셋이 Backblaze B2에 안전하게 저장되었으므로, 314조 자리 숫자 계산 결과는 우리 연구실의 경계를 넘어 활용될 수 있게 되었습니다. 연구자들은 파일을 다운로드하여 실험하고, 계산의 일부를 검증하거나, 자신의 프로젝트를 위해 숫자를 탐색할 수 있습니다. 2026년 파이 데이가 다가오는 지금, 이 데이터셋을 공개하기에 더할 나위 없이 좋은 시기입니다.

Backblaze B2: 대규모 데이터를 위한 엔터프라이즈 클라우드 스토리지

Pi 데이터셋을 널리 보급하려면 대용량 데이터를 안정적으로 저장하고 배포할 수 있는 인프라가 필요했습니다. Backblaze B2 클라우드 스토리지는 바로 이러한 워크로드에 맞춰 설계된 엔터프라이즈급 객체 스토리지 플랫폼입니다. 객체 스토리지는 기존의 파일 계층 구조에 얽매이지 않고 확장 가능한 객체 버킷에 방대한 파일 모음을 저장할 수 있도록 해주므로, 대규모 데이터셋, 백업, 최신 데이터 파이프라인에 매우 적합합니다. 또한 B2는 S3 호환 API를 지원하여 기존 애플리케이션이나 데이터 처리 방식을 변경하지 않고도 익숙한 도구와 워크플로를 사용하여 서비스를 이용할 수 있습니다.

Backblaze는 경제성과 운영 편의성을 바탕으로 내구성이 뛰어난 스토리지를 제공하는 데 플랫폼을 집중해 왔습니다. 11나인(나인분율)의 데이터 내구성을 보장하도록 설계된 아키텍처를 통해 스토리지 포드에 데이터를 분산시켜 대규모 환경에서도 장기적인 안정성을 확보합니다. 또한, 상세한 드라이브 안정성 보고서를 공개 하고 예측 가능한 가격 정책을 유지하여 많은 인프라 팀으로부터 투명성을 인정받고 있습니다. 저희의 경우, B2는 연구실에서 생성된 매우 큰 규모의 데이터 세트를 호스팅하는 데 실용적인 솔루션을 제공하여, 데이터 탐색에 관심 있는 모든 사용자가 결과에 접근할 수 있도록 보장하는 동시에 클라우드 스토리지가 온프레미스 컴퓨팅 환경의 활용 범위를 어떻게 확장할 수 있는지 보여줍니다. 표준 Backblaze B2 클라우드 스토리지 외에도 B2 Overdrive는 최대 1Tbps의 처리량을 지원합니다.

Backblaze B2에 데이터셋 호스팅하기

314조 자리에 달하는 파이(PI) 계산이 완료되고 데이터가 R7725에서 NAS 스토리지로 옮겨진 후, 이 데이터 세트를 공개적으로 제공하는 방법에 대한 고민이 필요했습니다. 130TB에 달하는 데이터를 연구실에서 직접 제공하는 것은 현실적인 선택이 아니었습니다. 연구실의 WAN 연결 속도는 업로드와 다운로드 모두 최대 2Gbps로 제한되어 있으며, 모든 연구실 운영에서 공유되고 있습니다. 의미 있는 규모의 지속적인 공개 다운로드는 일상적인 업무에 지장을 초래할 뿐만 아니라, 대역폭 제한으로 인해 대규모 동시 다운로드 시 데이터 접근이 느리고 불안정해질 수 있었습니다.

처음에는 BitTorrent를 통해 데이터셋을 배포하는 방안을 고려했습니다. 기술적으로는 가능했지만, 대부분의 사용자에게는 접근성이 떨어지는 방식이었습니다. 130TB에 달하는 데이터셋을 토렌트로 다운로드하려면 클라이언트 프로그램이 필요하고, 토렌트 사용 방법에 대한 기본적인 이해와 더불어 직접 다운로드처럼 간단하지 않은 과정을 거쳐야 했기 때문입니다. 연구자 및 일반 사용자들이 폭넓게 이용할 수 있도록 의도된 데이터셋인 만큼, 이러한 불편함을 최소화하는 것이 더 나은 선택이었습니다.

Backblaze B2는 두 가지 문제를 깔끔하게 해결했습니다. 데이터셋 전체가 클라우드 인프라에 호스팅되므로, 공개 다운로드는 연구실 WAN에 의존하지 않고 연구실 운영에 부하를 주지 않습니다. B2와의 연결은 Backblaze 인프라에서 직접 HTTPS를 통해 제공되므로 다운로드가 안전하고 일관적이며 제3자 시더의 가용성에 영향을 받지 않습니다. 이제 전체 데이터셋은 pi-314-trillion 버킷에 총 132TB에 달하는 628개의 객체로 구성되어 단일 데이터 경로로 정리되어 있으며, 연구실에 아무런 영향을 주지 않고 누구나 접근할 수 있습니다.

연구실 NAS에서 데이터 전송은 간단한 Rclone 설정을 통해 이루어졌으며, 연구실 게이트웨이 역할을 하는 UDM Pro Max를 경유하여 업로드 전 과정에 걸쳐 2Gbps 이상의 속도를 유지했습니다. 이 속도로 130TB를 전송하는 데에는 약 10일 동안 연속 전송이 필요했습니다. 아래 차트는 분 단위 및 누적 전송 시간을 보여줍니다.

전송 중 WAN 사용률

실험실의 UniFi 네트워크 대시보드는 전송 기간 동안의 업로드 특성을 확인시켜 줍니다. WAN 인터페이스에서는 Backblaze가 트래픽 양 기준으로 가장 많이 사용되는 애플리케이션으로 나타났으며, 업로드 처리량은 2.27Gbps, 해당 기간 동안의 월간 WAN 데이터 사용량은 90.9TB로 기록되었습니다. 전송 중 연결은 안정적으로 유지되었으며, 중요한 패킷 손실은 발생하지 않았습니다.

UniFi 대시보드는 전송 기간 동안 Backblaze가 가장 많이 사용된 WAN 애플리케이션이며, 2Gbps 이상의 업로드 처리량이 지속적으로 유지됨을 보여줍니다.

분당 전송 처리량

아래 차트는 업로드 과정의 대표적인 구간에서 분 단위로 샘플링된 전송 처리량을 보여줍니다. 막대 그래프는 분당 15~16기가바이트 사이의 처리량을 꾸준히 유지하며, 이는 약 2Gbps의 회선 속도에 해당합니다. 차트에 보이는 짧은 간격은 데이터 무결성을 확인하기 위해 전송 과정 중에 주기적으로 실행되는 체크섬 검증 일시 중지 시간을 나타냅니다.

업로드 중 분당 바이트 전송률은 활성 전송 시간 동안 분당 15~16GB의 일관된 처리량을 보여줍니다.

누적 이체 진행 상황

누적 데이터 전송량 차트는 2월 4일부터 2월 10일까지 전송된 총 데이터 양을 보여주며, 해당 기간 동안 0에서 약 100TB까지 꾸준히 선형적으로 증가하는 추세를 나타냅니다. 전체 기간에 걸쳐 안정적인 기울기를 보이는 것은 주요 중단이나 전송 속도 저하 없이 전송이 안정적으로 진행되었음을 반영합니다.

최종 버킷 레이아웃

Backblaze는 628개의 모든 파일을 포함하고 있으며 확인된 크기가 132,210.5GB인 pi-314-trillion 버킷을 생성했습니다. 이 버킷은 모든 파일 버전이 보존되는 비공개 버킷으로 구성되어 있으며, S3 호환 엔드포인트인 s3.us-west-004.backblazeb2.com을 통해 접근할 수 있습니다. 객체 스토리지를 사용하면 이처럼 방대한 데이터 세트를 손쉽게 관리할 수 있습니다. 모든 파일에 개별적으로 접근할 수 있고, 전체 파일 목록을 프로그래밍 방식으로 가져올 수 있으며, 파일 시스템 계층 구조나 용량 제한과 같은 제약 조건이 없습니다.

Backblaze B2 콘솔에서 pi-314-trillion 버킷에 628개의 파일, 총 크기 132,210.5GB, 그리고 S3 호환 엔드포인트가 표시되는 것을 확인할 수 있습니다.

데이터 세트에 액세스하기

연구원들이 이 데이터에 대한 접근 권한을 요청해 왔습니다. 사실, 저희는 이미 관련 프로젝트를 진행 중입니다. 마이클 클레버는 구글의 수석 소프트웨어 엔지니어이지만, 1999년 수학 박사 학위를 받은 이후로 원주율(π)의 자릿수를 가지고 놀아 왔습니다. 수학자들은 원주율이 정규분포를 따른다고 생각하기 때문에, "d자리 숫자로 이루어진 10^d개의 수열 중에서 원주율에 처음 나타나는 데 가장 오랜 시간이 걸리는 것은 무엇이며, 그 수열은 몇 자리 숫자일까?"라는 질문을 던지는 것은 당연합니다. 클레버는 d=7까지 탐색을 진행했고, 2009년 파브리스 벨라르가 2조 7천억 개의 원주율 자릿수를 계산했을 때, 클레버는 그에게 당시 가능한 한계인 d=11까지 확장해 보라고 권했습니다. 클레버는 "314조 개의 무작위 숫자 중에서 길이가 13인 모든 수열을 발견할 확률은 약 79% 입니다 ."라며, "운이 좋기를 바랍니다!"라고 말했습니다. Backblaze가 모든 사람에게 데이터를 공개했으니 이제 이런 현상이 훨씬 더 많이 나타날 것으로 예상합니다.

PI 데이터셋은 Backblaze B2에 호스팅되어 있으며, 데이터 활용에 관심 있는 모든 사용자가 다운로드할 수 있습니다. 접근 권한은 요청 링크를 통해 제공되며 , 사용자는 해당 링크를 통해 자격 증명을 받거나 버킷에서 파일을 다운로드하는 방법에 대한 지침을 얻을 수 있습니다 . Backblaze는 해당 기간 동안 연구 및 검증을 위해 데이터에 지속적으로 접근할 수 있도록 데이터셋을 호스팅할 예정입니다.

다운로드 옵션

사용자는 필요에 따라 데이터 세트에서 개별 파일 또는 130TB 전체 컬렉션을 검색할 수 있습니다. 버킷은 전체 데이터 세트를 다운로드하지 않고도 개별 객체에 직접 접근하여 다운로드할 수 있도록 구성되어 있습니다. 모든 데이터를 검색하려는 경우, 아래에 설명된 도구를 사용하여 버킷을 완전히 동기화할 수 있습니다. 이 옵션을 사용하려면 135TB의 여유 공간이 권장됩니다.

추천 도구

  • Rclone 데이터셋 접근에 권장되는 도구입니다. Backblaze B2와 완벽하게 통합되며, 사용자는 자신의 대역폭 요구 사항에 맞춰 다운로드 속도를 조정할 수 있습니다.
  • S3 호환 API따라서 S3 기능을 갖춘 모든 다운로드 도구를 사용하여 데이터를 가져올 수 있습니다. 단, 해당 도구가 기본 S3 엔드포인트 URL을 AWS가 아닌 B2 엔드포인트를 가리키도록 재정의할 수 있어야 합니다.

하이브리드 인프라의 실제 사례

314조 자리에 달하는 파이(π) 값 계산은 하이브리드 인프라가 실제로 어떻게 작동하는지 보여주는 명확한 사례입니다. 이 계산은 StorageReview 연구실의 Dell PowerEdge R7725 서버 한 대에서만 실행되었지만, 계산이 완료된 후 시스템을 다른 프로젝트 및 작업에 재배정해야 했기 때문에 130TB에 달하는 계산 결과를 연구실에 영구적으로 보관하는 것은 지속 가능한 옵션이 아니었습니다.

데이터를 활용하고자 하는 사람들, 즉 진지한 과학 연구를 위한 사용자든 단순히 숫자에 대한 호기심을 충족하려는 사용자든, 그들에게 데이터를 제공하고자 하는 바람은 분명합니다. 하지만 그 정도 규모의 데이터셋을 연구실 내에 보관하는 것은 운영에 상당한 부담을 줍니다. 대역폭이 소모되고, 인프라가 계속 사용되며, 연구실의 일상적인 업무는 들어오는 모든 다운로드 요청과 경쟁하게 됩니다.

Backblaze B2와 같은 솔루션은 이러한 모든 마찰을 제거합니다. 데이터는 이러한 규모의 데이터 세트에 맞게 특별히 구축된 클라우드 인프라에 저장되며, 수요에 따라 확장되는 처리량, 데이터 손실을 방지하는 다중 백업 시스템, 그리고 엔터프라이즈급 스토리지 플랫폼에서 제공하는 보안 및 운영 전문성을 갖추고 있습니다. 컴퓨팅은 업무 특성상 필요했기 때문에 온프레미스에 구축되었고, 스토리지는 이후 모든 작업에 더 나은 도구이기 때문에 클라우드에 구축되었습니다.

StorageReview에 참여

뉴스레터 | 유튜브 | 팟캐스트 ( 아이튠즈 / 스포티파이) | 인스타그램 | 트위터 | 틱톡 | RSS 피드

브라이언 빌러

Brian은 오하이오주 신시내티에 있으며 StorageReview.com의 수석 분석가이자 사장입니다.