StorageReview.com

StorageReview, Dell PowerEdge R7725에서 파이(π) 값 314조 자리 기록 달성으로 새로운 기록 경신

기업  ◇  소프트웨어

StorageReview가 314조 자리까지 파이(π) 값을 계산하는 새로운 기록을 세우며 컴퓨팅 분야의 선두 자리를 되찾았습니다. 현대의 파이 계산 경쟁은 클라우드 환경에서의 실험에서 벗어나 본격적인 인프라 활용 단계로 접어들었습니다. 2022년, 구글 클라우드는 대규모 클라우드 인스턴스에서 y-cruncher를 실행하고 수십 페타바이트의 I/O를 처리하며 파이 값을 100조 자리까지 계산하는 데 성공했습니다. 당시 이 기록은 기존 인프라로 "어디까지 가능한가"를 보여주는 대표적인 수치로 여겨졌습니다.

이후 본격적인 테스트는 연구실로 옮겨갔습니다. 2024년 초, 거의 1페타바이트에 달하는 Solidigm QLC SSD로 구성된 시스템에서 105조 자리까지 연산량을 늘리는 데 성공했습니다. 이 성과는 확장성 측면에서 새로운 기준을 제시했으며, 단일 온프레미스 시스템이 얼마나 효율적으로 작동할 수 있는지를 입증했습니다. 몇 달 후, 우리는 다시 한번 202조 자리까지 연산량을 늘리는 데 성공했습니다. 이는 고밀도 플래시 메모리와 세심한 튜닝을 통해 이처럼 까다로운 워크로드에 대해 하이퍼스케일 인프라보다 뛰어난 성능을 발휘할 수 있음을 보여주었습니다.

물론 기록 경신에는 도전자들이 따르기 마련입니다. Linus Media Group과 KIOXIA는 2PB 플래시 메모리를 갖춘 대규모 Weka 공유 스토리지 클러스터를 활용하여 300조 자리 숫자에 달하는 기록 경신에 성공했습니다. 이 프로젝트는 비록 하드웨어 랙, 막대한 전기 요금, 복잡한 냉각 시스템 등의 부담은 있었지만, 스토리지 집약적인 기존 인프라가 무엇을 해낼 수 있는지 보여주었습니다. 우리는 이 기록이 깨지지 않도록 가만히 지켜볼 수 없었습니다!

StorageReview는 듀얼 AMD EPYC 192코어 CPU와 40개의 61.44TB Micron 6550 Ion SSD가 장착된 2U Dell PowerEdge R7725 서버 한 대를 사용하여 원주율(π)을 314조 자리까지 계산하는 데 성공했습니다 . 시스템 구축 및 튜닝은 7월에 진행되었으며, 2025년 7월 31일에 계산을 시작했습니다. 마침 SC25 둘째 날에 계산이 완료되어 새로운 HPC 기록을 세우는 데 성공했습니다.

y-cruncher를 314조 자리까지 확장

수백조 자리 숫자에 도달하면 y-cruncher는 기존 벤치마크라기보다는 장기 인프라 스트레스 테스트에 더 가깝게 동작합니다. 애플리케이션 자체는 간단하지만, 이 규모에서 하드웨어와 상호 작용하는 방식이 결정적인 요소가 됩니다. 모든 것은 시스템이 CPU를 멈추게 하거나 스토리지 계층에 과부하를 주지 않고 수천 개의 다중 정밀도 연산을 얼마나 잘 처리할 수 있느냐에 달려 있습니다. 특히 스토리지 계층에서 이 기록이 달성되었습니다. 우리는 40개의 Micron 6550 Ion Gen5 NVMe SSD를 배포했고, 그중 34개를 y-cruncher에 할당했습니다. 이 SSD 풀은 약 2.1페타바이트의 용량을 제공하여 y-cruncher가 314T 실행을 수행하기에 충분한 공간을 확보했습니다. 나머지 6개의 SSD는 소프트웨어 RAID10 볼륨을 구축하는 데 사용되었으며, 이를 통해 파이의 314T 자리를 기록했습니다.

16세대와 17세대 Dell PowerEdge 서버 간의 설계 변경은 최근 314T 기록 경신에 기여했습니다. 이전 202T 기록 경신 당시에는 드라이브 백플레인에 PCIe 스위치를 사용하는 24베이 Dell PowerEdge R760을 사용했는데, 이 서버는 드라이브 밀도를 희생하는 대신 성능을 향상시켰습니다. Intel 기반 R770이나 AMD 기반 R7725와 같은 17세대 Dell PowerEdge 서버에서는 백플레인이 베이당 2개 또는 4개의 PCIe 레인을 사용하는 직접 연결 방식으로 변경되었습니다. 40베이 Gen5 E3.S 백플레인을 탑재한 PowerEdge R7725에서는 각 SSD에 2개의 PCIe 레인이 할당됩니다. 이로 인해 성능이 다소 저하될 수 있지만, 40개 베이를 모두 동시에 사용할 경우에도 최대 280GB/s의 읽기/쓰기 속도를 유지할 수 있습니다.

내부 y-cruncher 스토리지 벤치마크를 사용하여 각 실행에 사용된 구성에서 각 플랫폼의 스토리지 성능을 기록했습니다. 모든 워크로드에서 스토리지 성능이 72%에서 383%까지 향상되었으며, 읽기 및 쓰기 지표는 균형을 이루었습니다.

메트릭 202T 시스템 (기존 기록) 314T 시스템 (신기록) 백분율 차이 (314T 대 202T)
순차적 쓰기 47.0GiB/초 107GiB/초 127.7%
순차적 읽기 56.7GiB/초 127GiB/초 124.0%
임계값 스트라이드 쓰기 62.2GiB/초 107GiB/초 72.0%
임계값 스트라이드 읽기 20.9GiB/초 101GiB/초 383.3%

델 파워엣지 R7725는 단순한 스토리지 장치가 아니라, 듀얼 소켓 AMD 튜린 플랫폼으로서 상당한 컴퓨팅 성능을 제공합니다. 저희는 192코어 AMD EPYC 9965 CPU(총 384코어)를 활용했습니다. 또한 기본 제공되는 공랭식 방열판을 CoolIT SP5 수랭식 냉각판으로 교체하고, CoolIT AHx10 액체-공기 변환 냉각 장치(CDU)로 냉각했습니다. 이러한 조합을 통해 CPU는 높은 클럭 속도를 지속적으로 유지할 수 있었고, 섀시 팬은 약 30% PWM 속도로 작동했으며, 시스템 평균 전력 소비량은 약 1,600W를 기록했습니다.

소프트웨어 측면에서, 이번 테스트 플랫폼은 이전처럼 Windows Server 대신 Ubuntu 24.04.2 LTS Server를 사용했습니다. 이를 통해 시스템 안정성을 극대화하고 워크로드 성능을 크게 향상시켰습니다. 테스트 실행에 앞서 384개 코어 중 4개를 백그라운드 시스템 작업에 할당하는 등 여러 차례 테스트를 진행했습니다. 그 결과, 기존 파이 기록을 경신했을 뿐만 아니라 여러 지표에서 압도적인 기록을 달성했습니다. 성능, 전력 소비, 그리고 가장 인상적인 안정성 측면에서 우리의 기록에 필적하는 것은 없습니다. 또한, 단 한 순간의 다운타임도 없이 대규모 파이 세계 기록을 달성한 유일한 사례입니다. 시작부터 끝까지, 단 한 번의 재시작도 필요하지 않았습니다.

기록적인 전력 효율

StorageReview는 파이 레코드 달성을 위한 모든 벤치마크 실행에서 복잡성을 줄이고 필요한 최소한의 전력만 사용하는 방식을 채택했습니다. 이전 300조 기록 달성에는 분산 스토리지 클러스터와 고속 네트워크를 활용했지만, 이로 인해 전력 소비와 냉각 요구량이 크게 증가했습니다. 저희는 스토리지 밀도를 높이는 데 집중하여 스왑 스토리지와 출력 스토리지를 모두 단일 2U 서버에 저장하는 방식을 택했습니다. 이는 전반적인 전력 소비와 냉각 요구량을 줄이는 데 중요한 역할을 했습니다. Dell PowerEdge R7725는 314조 실행 동안 단 4,304.662kWh의 전력만 소비했으며, 이는 1조 자리당 13.70kWh에 불과합니다. 이는 가장 에너지 효율적인 대규모 파이 계산 중 하나입니다. 아래 표에서 볼 수 있듯이 두 접근 방식의 차이가 즉시 드러납니다.

달리기 총 kWh 비용은 kWh당 0.12달러입니다. 비용은 kWh당 0.20달러입니다.
300T Weka 클러스터 실행 33,600kWh(추정) $4,032 $6,720
314T 단일 서버 실행 4,304.662 kWh로 $517 $861

계산 과정에서 314T 테스트를 진행할 때 데이터 복원력이 없는 JBOD 구성의 SSD를 사용했다는 점에 유의해야 합니다. 전력 소비와 전반적인 시스템 성능이 이러한 결정의 주요 요인이었지만, 이 경험을 통해 워크로드에 맞춰 스토리지 솔루션을 설계해야 한다는 논의가 시작되었습니다. 모든 워크로드는 서로 다르며, 프로덕션에 미치는 영향을 최소화하면서 재시작할 수 있는 워크로드는 동일한 수준의 내결함성이 필요하지 않을 수 있습니다. 저희의 경우, 기존 소프트웨어 RAID를 사용하여 데이터 출력을 보호하는 데 중점을 두었습니다.

총 실행 시간 110일

이전 어떤 실행보다 더 많은 자릿수를 계산했음에도 불구하고, 실제 소요 시간은 이전 기록보다 훨씬 짧았습니다. 이전 기록은 완료하는 데 약 225일(다운타임을 제외한 계산일 175일)이 걸렸습니다. 110일이라는 중단 없는 기간은 안정적인 운영 체제, 최소화된 백그라운드 부하, 균형 잡힌 NUMA 토폴로지, 그리고 이 규모에서 y-cruncher가 생성하는 패턴에 맞게 설계된 스크래치 어레이 덕분입니다.

기술 하이라이트

  • 계산된 총 자릿수: 314,000,000,000,000
  • 사용 된 하드웨어델 파워엣지 R7725 (AMD EPYC 9965 CPU 2개, 1.5TB DDR5 DRAM, 40x 마이크론 61.44TB 6550 Ion 하드 드라이브)
  • 소프트웨어 및 알고리즘: y-cruncher v0.8.6.9545, 추드노프스키
  • SMART 기준 SSD 마모도드라이브당 7.3PB, 스왑에 사용된 34개의 SSD 전체에서는 총 249.11PB가 기록되었습니다.
  • 논리적으로 가장 큰 체크포인트: 850,538,385,064,992(774TiB)
  • 논리적 최대 디스크 사용량: 1,605,960,520,636,440 (1.43PiB)
  • 논리 디스크 읽은 바이트 수: 148,356,635,606,263,504 (132PiB)
  • 쓴 논리 디스크 바이트 수: 126,658,805,195,776,600 (112PiB)
  • 시작 날짜: 2025년 7월 31일 목요일 17:16:41
  • 종료 날짜: 2025년 11월 18일 화요일 오전 5시 57분 8초
  • 파이: 8793223.144초, 101.773일
  • 총 계산 시간: 9274878.580 초
  • 시작부터 끝까지 벽 시간: 9463226.454 초

생각을 폐쇄

수십 년 동안, 극한의 라즈베리 파이(π) 연산은 당시 "최고 사양 컴퓨터"로 여겨지던 것들을 과시하는 수단이었습니다. 초기에는 고성능 데스크톱과 외장 스토리지를 활용한 기록 경신이 주를 이루었고, 이후에는 기업용 로컬 장비를 활용했습니다. 최근에는 클라우드 컴퓨팅으로 경쟁의 장이 옮겨갔는데, 구글의 100조 자리 숫자 연산과 같은 사례는 충분한 인스턴스와 I/O 용량만 있다면 무차별 대입 방식으로도 기록을 경신할 수 있음을 보여주었습니다. 그러다 대규모 공유 스토리지 클러스터가 등장하면서, 단순함을 희생하고 막대한 병렬 처리 능력과 엄청난 전력 및 냉각 비용을 감수하게 되었습니다.

저희는 정반대의 접근 방식을 취했습니다. 여러 차례의 기록 경신 시도를 통해 y-cruncher를 일회성 이벤트가 아닌 진지한 HPC 워크로드로 취급했습니다. 105T 및 202T 솔루션 실행을 통해 실제 병목 현상을 파악하고, 스크래치 스토리지의 크기를 조정하고 최적화하며, I/O 계층에 과부하를 주지 않고 CPU에 지속적으로 데이터를 공급하고, 수개월이 걸리는 작업도 실제로 완료될 수 있도록 시스템을 강화할 수 있었습니다. 314T 실행은 이러한 경험의 결과물입니다. 단순히 숫자가 커진 것이 아니라, 더욱 성숙한 설계를 구현한 것입니다.

측정 결과는 이러한 사실을 뒷받침합니다. 40개의 Micron 6550 Ion SSD와 듀얼 192코어 AMD EPYC CPU를 탑재한 단일 2U Dell PowerEdge R7725 서버에서 300조 자리를 돌파하는 데이터를 처리했으며, 시스템을 110일 동안 연속으로 온라인 상태로 유지하면서 단 한 번의 장애 복구도 필요하지 않았습니다. 스토리지 처리량은 202조 자리 플랫폼 대비 두 배 이상 증가했지만, 서버는 평균 약 1,600W의 전력을 소비했고 총 소비량은 4,305kWh에 불과했습니다. 이는 1조 자리당 13.70kWh에 해당하며, 이전 300조 자리 클러스터에서 추정된 에너지 사용량의 극히 일부에 불과합니다. 노드 수가 적고, 시스템 복잡성이 낮아졌으며, 에너지 소비는 줄었지만 처리량은 증가했습니다.

이 기록이 단순한 자랑거리를 넘어 중요한 이유는 바로 여기에 있습니다. 상용 2U 서버 하나가 이 정도 규모의 연산 작업을 이 정도의 신뢰성과 효율성으로 처리할 수 있다면, 동일한 설계 패턴이 실제 과학 생산 현장에도 그대로 적용될 수 있다는 것을 의미하기 때문입니다. 장시간 실행되는 기후 모델, 물리 시뮬레이션, 유전체학 파이프라인, AI 학습 작업 등은 모두 균형 잡힌 I/O, 예측 가능한 발열 관리, 안정적인 펌웨어, 그리고 수개월 동안 문제없이 작동할 수 있는 아키텍처라는 동일한 기본 요소에 따라 성패가 좌우됩니다. 이 플랫폼은 이제 단 하나의 오류도 용납되지 않는 극한 환경에서도 이러한 조건을 완벽하게 충족할 수 있음을 입증했습니다.

네, StorageReview가 314조 자리까지 계산하며 파이(π) 계산 기록을 되찾았습니다. 더 중요한 것은, 실제 하드웨어에서 대규모 수치 연산을 수행하는 데 있어 "우수함"의 기준을 새롭게 정립했다는 점입니다. 만약 누군가 이 기록을 깨고 싶다면, 더 많은 자릿수, 더 적은 전력 소비, 더 짧은 처리 시간, 그리고 동일한 무중단 안정성을 모두 갖춰야 할 것입니다. 그때까지, 이것이 효율성의 기준이 될 것입니다.

StorageReview에 참여

뉴스레터 | 유튜브 | 팟캐스트 ( 아이튠즈 / 스포티파이) | 인스타그램 | 트위터 | 틱톡 | RSS 피드

케빈 오브라이언

StorageReview Lab 내부에서 제품을 평가하고 업계 리더와 협력하여 새로운 테스트 환경을 개발합니다. 집에서 나는 가족을 부양하고 있습니다.