W zeszłym tygodniu Google ujawniło kulisy swojego najnowszego, niestandardowego akceleratora AI – Ironwood TPU – prezentując znaczącą poprawę wydajności w coraz bardziej wymagającym świecie sztucznej inteligencji. Zaprezentowany podczas konferencji Google Cloud Next 25, Ironwood to siódma generacja procesorów TPU firmy Google, zaprojektowanych specjalnie do obsługi nowoczesnych obciążeń AI, szczególnie w obszarze wnioskowania.
Zrozumienie TPU
Zanim zagłębimy się w Ironwood, warto zrozumieć, czym są układy TPU. Jednostki przetwarzania tensorowego (Tensor Processing Units) to wyspecjalizowane układy opracowane przez Google specjalnie do przyspieszania obciążeń uczenia maszynowego. W przeciwieństwie do procesorów ogólnego przeznaczenia, a nawet procesorów graficznych (GPU), które są zoptymalizowane pod kątem przetwarzania równoległego, początkowo pod kątem grafiki, układy TPU są zoptymalizowane pod kątem operacji macierzowych i tensorowych, stanowiących istotę sieci neuronowych. Historycznie Google oferował różne wersje układów TPU, często rozróżniając serię „e” (skoncentrowaną na wydajności i wnioskowaniu, uruchamiającą wstępnie wytrenowane modele) oraz serię „p” (skoncentrowaną na surowej wydajności w celu trenowania dużych modeli).
Przedstawiamy Ironwood
Nowy Ironwood TPU to jak dotąd najbardziej ambitny akcelerator sztucznej inteligencji Google. To pierwszy TPU firmy zaprojektowany specjalnie z myślą o wymaganiach „modeli rozumowania” opartych na wnioskowaniu. Ironwood oferuje znaczną poprawę wszystkich kluczowych wskaźników wydajności w porównaniu z poprzednimi modelami, w tym:
| TPU v5e | TPU v5p | TPU v6e | TPU v7e | |
| BF16 Compute | TFLOPY 197 | TFLOPY 459 | TFLOPY 918 | 2.3 PFLOP-y* |
| Obliczenia INT8/FP8 | 394 TOP/TFLOP* | 918 TOPy/TFLOPY* | 1836 TOPy/TFLOPY | 4.6 POP/PFLOP |
| Szerokość pasma HBM | 0.8 TB / s | 2.8 TB / s | 1.6 TB / s | 7.4 TB / s |
| Pojemność HBM | 16 GB | 95 GB | 32 GB | 192 GB |
| Przepustowość połączeń między chipami (na łącze) | 400 Gbps | 800 Gbps | 800 Gbps | 1200 Gbps |
| Topologia połączeń międzysieciowych | Torus 2D | Torus 3D | Torus 2D | Torus 3D |
| Rozmiar modułu TPU | 256 | 8960 | 256 | 9216 |
| Rdzenie zapasowe | Nie | Nie | Tak | Tak |
Uwaga: Liczby oznaczone gwiazdką „*” są nieoficjalnymi liczbami obliczonymi.
Co najważniejsze, Ironwood charakteryzuje się:
- Ogromna moc obliczeniowa: każdy układ zapewnia wydajność FP8 na poziomie 4.6 petaFLOPS, co plasuje go w tej samej klasie wydajności co układ Blackwell B200 firmy NVIDIA
- Zwiększona pojemność pamięci: 192 GB pamięci o dużej przepustowości (HBM) na układ
- Znacznie zwiększona przepustowość pamięci: 7.37 TB/s na układ, 4.5 razy więcej niż w przypadku Trillium, co umożliwia szybszy dostęp do danych w celu wnioskowania AI przy ograniczonej pamięci
- Ulepszone możliwości połączeń: dwukierunkowa przepustowość 1.2 TBps, 1.5-krotnie większa niż w przypadku Trillium, umożliwiająca wydajniejszą komunikację między układami
Spekulacje: Czy Ironwood to zaginiony v6p?
Co ciekawe, Google najwyraźniej pominęło oczekiwaną generację TPU v6p i od razu przeszło do wydania Ironwood v7e. Sugeruje to, że ten układ mógł być pierwotnie przeznaczony do trenowania v6p. Jednak ze względu na szybko rosnące rozmiary modeli i konieczność konkurowania z takimi ofertami jak GB200 NVL72 firmy NVIDIA, Google prawdopodobnie zmieniło jego pozycjonowanie na Ironwood v7e. Ogromny rozmiar modułu TPU 9216 i zastosowanie połączenia 3D Torus w układzie określanym jako seria „e” (zazwyczaj bardziej ekonomiczny wariant) zdecydowanie potwierdzają tę teorię.
Droga przed nami
Google ogłosiło, że procesory TPU Ironwood będą dostępne jeszcze w tym roku za pośrednictwem Google Cloud. Technologia ta jest już wykorzystywana w niektórych z najnowocześniejszych systemów AI Google, w tym Gemini 2.5 i AlphaFold.
W miarę jak te nowe, wydajne akceleratory staną się dostępne dla deweloperów i badaczy, prawdopodobnie umożliwią one przełom w możliwościach sztucznej inteligencji, zwłaszcza w przypadku zadań wymagających wnioskowania na dużą skalę, które wymagają zarówno ogromnej mocy obliczeniowej, jak i zaawansowanych możliwości wnioskowania.




Amazon