StorageReview.com

Google Ironwood TPU: Ogromny skok w wydajności wnioskowania AI

AI  ◇  Enterprise

W zeszłym tygodniu Google ujawniło kulisy swojego najnowszego, niestandardowego akceleratora AI – Ironwood TPU – prezentując znaczącą poprawę wydajności w coraz bardziej wymagającym świecie sztucznej inteligencji. Zaprezentowany podczas konferencji Google Cloud Next 25, Ironwood to siódma generacja procesorów TPU firmy Google, zaprojektowanych specjalnie do obsługi nowoczesnych obciążeń AI, szczególnie w obszarze wnioskowania.

Żelazny TPU

Zrozumienie TPU

Zanim zagłębimy się w Ironwood, warto zrozumieć, czym są układy TPU. Jednostki przetwarzania tensorowego (Tensor Processing Units) to wyspecjalizowane układy opracowane przez Google specjalnie do przyspieszania obciążeń uczenia maszynowego. W przeciwieństwie do procesorów ogólnego przeznaczenia, a nawet procesorów graficznych (GPU), które są zoptymalizowane pod kątem przetwarzania równoległego, początkowo pod kątem grafiki, układy TPU są zoptymalizowane pod kątem operacji macierzowych i tensorowych, stanowiących istotę sieci neuronowych. Historycznie Google oferował różne wersje układów TPU, często rozróżniając serię „e” (skoncentrowaną na wydajności i wnioskowaniu, uruchamiającą wstępnie wytrenowane modele) oraz serię „p” (skoncentrowaną na surowej wydajności w celu trenowania dużych modeli).

Przedstawiamy Ironwood 

Nowy Ironwood TPU to jak dotąd najbardziej ambitny akcelerator sztucznej inteligencji Google. To pierwszy TPU firmy zaprojektowany specjalnie z myślą o wymaganiach „modeli rozumowania” opartych na wnioskowaniu. Ironwood oferuje znaczną poprawę wszystkich kluczowych wskaźników wydajności w porównaniu z poprzednimi modelami, w tym:

TPU v5e TPU v5p TPU v6e TPU v7e
BF16 Compute TFLOPY 197 TFLOPY 459 TFLOPY 918 2.3 PFLOP-y*
Obliczenia INT8/FP8 394 TOP/TFLOP* 918 TOPy/TFLOPY* 1836 TOPy/TFLOPY 4.6 POP/PFLOP
Szerokość pasma HBM 0.8 TB / s 2.8 TB / s 1.6 TB / s 7.4 TB / s
Pojemność HBM 16 GB 95 GB 32 GB 192 GB
Przepustowość połączeń między chipami (na łącze) 400 Gbps 800 Gbps 800 Gbps 1200 Gbps
Topologia połączeń międzysieciowych Torus 2D Torus 3D Torus 2D Torus 3D
Rozmiar modułu TPU 256 8960 256 9216
Rdzenie zapasowe Nie Nie Tak Tak

Uwaga: Liczby oznaczone gwiazdką „*” są nieoficjalnymi liczbami obliczonymi.

Co najważniejsze, Ironwood charakteryzuje się:

  • Ogromna moc obliczeniowa: każdy układ zapewnia wydajność FP8 na poziomie 4.6 petaFLOPS, co plasuje go w tej samej klasie wydajności co układ Blackwell B200 firmy NVIDIA
  • Zwiększona pojemność pamięci: 192 GB pamięci o dużej przepustowości (HBM) na układ
  • Znacznie zwiększona przepustowość pamięci: 7.37 TB/s na układ, 4.5 razy więcej niż w przypadku Trillium, co umożliwia szybszy dostęp do danych w celu wnioskowania AI przy ograniczonej pamięci
  • Ulepszone możliwości połączeń: dwukierunkowa przepustowość 1.2 TBps, 1.5-krotnie większa niż w przypadku Trillium, umożliwiająca wydajniejszą komunikację między układami

Spekulacje: Czy Ironwood to zaginiony v6p?

Co ciekawe, Google najwyraźniej pominęło oczekiwaną generację TPU v6p i od razu przeszło do wydania Ironwood v7e. Sugeruje to, że ten układ mógł być pierwotnie przeznaczony do trenowania v6p. Jednak ze względu na szybko rosnące rozmiary modeli i konieczność konkurowania z takimi ofertami jak GB200 NVL72 firmy NVIDIA, Google prawdopodobnie zmieniło jego pozycjonowanie na Ironwood v7e. Ogromny rozmiar modułu TPU 9216 i zastosowanie połączenia 3D Torus w układzie określanym jako seria „e” (zazwyczaj bardziej ekonomiczny wariant) zdecydowanie potwierdzają tę teorię.

Droga przed nami

Google ogłosiło, że procesory TPU Ironwood będą dostępne jeszcze w tym roku za pośrednictwem Google Cloud. Technologia ta jest już wykorzystywana w niektórych z najnowocześniejszych systemów AI Google, w tym Gemini 2.5 i AlphaFold.

W miarę jak te nowe, wydajne akceleratory staną się dostępne dla deweloperów i badaczy, prawdopodobnie umożliwią one przełom w możliwościach sztucznej inteligencji, zwłaszcza w przypadku zadań wymagających wnioskowania na dużą skalę, które wymagają zarówno ogromnej mocy obliczeniowej, jak i zaawansowanych możliwości wnioskowania.

Skontaktuj się z StorageReview

Biuletyn | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Kanał RSS

Divyansh Jain

Inżynier uczenia maszynowego, homelabber i entuzjasta technologii. W StorageReview kieruję testami sztucznej inteligencji i nowych obciążeń, dostarczając analizy i analizy wydajności.