StorageReview.com

Google Ironwood TPU: AI 추론 성능의 엄청난 도약

AI  ◇  기업

지난주, 구글은 최신 맞춤형 AI 가속기인 아이언우드 TPU(Ironwood TPU)를 공개하며 점점 더 까다로워지는 AI 환경에서 상당한 성능 향상을 보여주었습니다. 구글 클라우드 넥스트 25(Google Cloud Next XNUMX)에서 발표된 아이언우드는 구글의 XNUMX세대 TPU로, 특히 추론 분야에서 최신 AI 워크로드를 처리하도록 특별히 설계되었습니다.

아이언우드 TPU

TPU 이해하기

Ironwood에 대해 자세히 알아보기 전에 TPU가 무엇인지 이해하는 것이 좋습니다. TPU(텐서 프로세싱 유닛)는 구글이 머신 러닝 워크로드 가속화를 위해 특별히 개발한 특수 칩입니다. 처음에는 그래픽 처리를 위한 병렬 처리에 최적화된 범용 CPU나 GPU와 달리, TPU는 신경망의 핵심인 행렬 및 텐서 연산에 최적화되어 있습니다. 구글은 전통적으로 다양한 TPU 버전을 제공해 왔으며, 효율성과 추론, 사전 학습된 모델 실행에 중점을 둔 'e' 시리즈와 대규모 모델 학습을 위한 순수 성능에 중점을 둔 'p' 시리즈로 구분하는 경우가 많았습니다.

아이언우드 소개 

새로운 Ironwood TPU는 구글이 지금까지 개발한 AI 가속기 중 가장 야심찬 제품입니다. 이는 추론 작업이 많은 '추론 모델'의 요구 사항을 충족하도록 특별히 설계된 구글 최초의 TPU입니다. Ironwood는 이전 버전과 비교하여 모든 주요 성능 지표에서 상당한 개선을 이루었으며, 다음과 같은 사항을 포함합니다.

TPU v5e TPU v5p TPU v6e TPU v7e
BF16 컴퓨팅 197 TFLOPs 459 TFLOPs 918 TFLOPs 2.3 P실패작*
INT8/FP8 컴퓨팅 394 TOP/TFLOP* 918 TOP/TFLOP* 1836 TOP/TFLOP 4.6 POP/PFLOP
HBM 대역폭 0.8 TB / 초 2.8 TB / 초 1.6 TB / 초 7.4 TB / 초
HBM 용량 16 GB 95 GB 32 GB 192 GB
칩 간 상호 연결 대역폭(링크당) 400Gbps 800Gbps 800Gbps 1200Gbps
상호 연결 토폴로지 2D 토러스 3D 토러스 2D 토러스 3D 토러스
TPU 포드 크기 256 8960 256 9216
예비 코어 아니 아니 가능 가능

참고: * 표시가 있는 숫자는 공식적으로 계산된 숫자가 아닙니다.

특히 Ironwood의 특징은 다음과 같습니다.

  • 엄청난 연산 능력: 각 칩은 4.6페타플롭스의 FP8 성능을 제공하여 NVIDIA의 Blackwell B200과 동일한 성능 등급을 제공합니다.
  • 메모리 용량 증가: 칩당 192GB 고대역폭 메모리(HBM)
  • 대폭 향상된 메모리 대역폭: 칩당 7.37TB/s, Trillium보다 4.5배 더 빨라 메모리 제약이 있는 AI 추론에 대한 더 빠른 데이터 액세스 가능
  • 향상된 상호 연결 기능: 1.2TBps 양방향 대역폭, Trillium보다 1.5배 향상되어 칩 간 통신 효율성이 더욱 향상됩니다.

추측: 아이언우드가 사라진 v6p일까?

흥미롭게도 구글은 예상되었던 TPU v6p 세대를 건너뛰고 바로 v7e Ironwood 출시에 돌입한 것으로 보입니다. 이는 이 칩이 원래 v6p 학습용 칩으로 개발되었을 가능성을 시사합니다. 그러나 모델 크기가 빠르게 확장되고 NVIDIA의 GB200 NVL72와 같은 제품과 경쟁해야 했기 때문에 구글은 이 칩을 v7e Ironwood로 재설계했을 가능성이 높습니다. "e" 시리즈 칩(일반적으로 더 경제적인 모델)으로 지정된 칩에 사용된 9216 TPU 포드의 거대한 크기와 3D Torus 인터커넥트는 이 이론을 강력하게 뒷받침합니다.

앞서가는 길

구글은 아이언우드 TPU가 올해 말 구글 클라우드를 통해 출시될 것이라고 발표했습니다. 이 기술은 이미 제미니 2.5와 알파폴드를 포함한 구글의 최첨단 AI 시스템에 적용되고 있습니다.

이러한 강력한 신규 가속기가 개발자와 연구자에게 제공됨에 따라 AI 기능, 특히 막대한 계산 능력과 정교한 추론 기능이 모두 필요한 대규모 추론 작업 부하에 있어 획기적인 발전이 이루어질 가능성이 높습니다.

StorageReview에 참여

뉴스레터 | 유튜브 | 팟캐스트 ( 아이튠즈 / 스포티파이) | 인스타그램 | 트위터 | 틱톡 | RSS 피드

디뱐시 자이나교

머신러닝 엔지니어이자 홈랩 운영자, 그리고 기술 애호가입니다. StorageReview에서 AI 및 신흥 워크로드 테스트를 주도하며, 인사이트와 성능 분석 결과를 제공하고 있습니다.