Spoločnosť AMD usporiadala svoju doteraz najväčšiu akciu Advancing AI, pričom kládla dôraz na škálovateľnosť ako ústrednú tému. Spoločnosť predstavila grafickú kartu Instinct MI455X, 72-GPU Helios rack a procesory EPYC Venice 6. generácie. MI455X disponuje 432 GB HBM4, čo je o 50 % viac ako B300 alebo Rubin od NVIDIA, s pamäťovou šírkou pásma 23.3 TB/s a výpočtovým výkonom MXFP4 až 40.26 PFLOPS. Kompletný Helios rack škáluje tieto čísla o 72, čím sa dosahuje 2.9 exaFLOPS FP4, 31 TB HBM4, pamäťová šírka pásma 1.7 PB/s, šírka pásma nahor a 43 TB/s nadol do dátového centra. Vo všetkých metrikách sa AMD snaží byť lídrom v tomto odvetví. Tento článok skúma MI455X a Helios; uvedenie na trh Venice je rozobrané v samostatnej analýze.
Druhou témou je otvorenosť, ktorá siaha do každej vrstvy, počnúc prepojením. Vo vnútri racku zdieľa všetkých 72 GPU pamäť cez UALink, otvorenú konzorciálnu štruktúru, ktorú AMD prevádzkuje na Ethernete ako UALink-over-Ethernet (UALoE). Keď prevádzka opustí rack, presunie sa cez Ultra Ethernet, otvorený štandard škálovania od Ultra Ethernet Consortium. Rovnaký Instinct spúšťa aj zvyšok zásobníka. Matematika s nízkou presnosťou používa otvorené dátové formáty MXFP4, MXFP6 a MXFP8 od OCP a rack, v ktorom je to všetko uložené, je postavený podľa dizajnu Open Rack Wide od Open Compute Project. Dokonca aj softvér je vyvíjaný v otvorenom prostredí, pričom kompilátor, runtime a knižnice ROCm sú dostupné v zdrojovom kóde.
Keďže každá špecifikácia v zásobníku je dnes publikovaná a na stiahnutie, hyperscaler môže považovať Helios za plán a vytvoriť si verziu na mieru vyladenú pre svoje vlastné zariadenia a pracovné zaťaženie, pričom prispôsobí sieťové rozhrania, napájanie alebo správu. To znamená, že všetko, čím sa v tomto článku zaoberáme, je referenčný návrh, ktorý predstavila spoločnosť AMD; jednotky, ktoré zákazníci nasadia, sa môžu výrazne líšiť. Záujemcovia sú už vybraní: AMD uvádza, že Helios prijímajú OpenAI, Meta, Anthropic, Microsoft , Oracle a ďalšie.
AMD Instinct MI455X: vlajková loď CDNA 5
MI455X je prvý akcelerátor CDNA 5, ktorý obsahuje 320 miliárd tranzistorov. MI455X obsahuje osem akcelerátorových komplexných čipov (XCD) postavených na uzle N2 od spoločnosti TSMC, plus dva I/O čipy a dva čipy Fabric a Cache na uzle N3 a dvanásť zásobníkov HBM4. Je to najväčší čip, aký bol kedy postavený na puzdre CoWoS-L od spoločnosti TSMC.
Pamäť je jednou z hlavných tém. Týchto dvanásť zásobníkov HBM4 má spolu 432 GB s rýchlosťou 23.3 TB/s, pričom HBM4 zdvojnásobuje rozhranie na zásobník na 2 048 bitov a dva čipy Fabric a Cache pridávajú 192 MB L2 s rýchlosťou 54 TB/s.
MI455X sa nebráni ani I/O. Prenáša 72 liniek UALoE pre obojsmernú šírku pásma 3.6 TB/s pre zvyšok racku, 256 GB/s obojsmernej Infinity Fabric pre hostiteľský procesor a možnosť výberu dvoch liniek PCIe Gen6 x16 alebo troch AMD AI-NIC pre horizontálne škálovanie.
V porovnaní s čipom, ktorý nahrádza, a ponukami spoločnosti NVIDIA vedie MI455X v každom kritériu.
| špecifikácia | AMD MI455X | NVIDIA Rubín | AMD MI355X | NVIDIA B300 |
|---|---|---|---|---|
| architektúra | CDNA 5 | rubín | CDNA 4 | Blackwell Ultra |
| Tranzistory | 320B | 336B | 185B | 208B |
| Kapacita HBM | 432GB HBM4 | 288GB HBM4 | 288 GB HBM3E | 288 GB HBM3E |
| Šírka pásma HBM | 23.3 TB/s | 22 TB/s | 8 TB/s | 8 TB/s |
| Škálovanie na GPU | 3.6 TB/s | 3.6 TB/s | 1.08 TB/s | 1.8 TB/s |
| Škálovanie na GPU | 2,400 Gb/s | 1,600 Gb/s | 400 Gb/s | 800 Gb/s |
| Prepojenie CPU-GPU | 256 GB/s Infinity Fabric | 1.8 TB/s C2C (1:2) | PCIe 5 | 900 GB/s C2C (1:2) |
Začnime tým, kde vedie AMD. So 432 GB má MI455X o 50 % viac HBM ako MI355X, B300 alebo Rubin, pričom všetky dosahujú maximum 288 GB. Jeho pamäťová šírka pásma 23.3 TB/s je tiež najvyššia v skupine. Rad škálovateľných kariet sa vychyľuje rovnakým smerom: 2 400 Gbit/s na GPU oproti 1 600 pre Rubin a 800 pre B300. Každá MI455X opúšťa rack s o 50 % väčšou sieťovou šírkou pásma ako jej najbližší konkurent.
Spoločnosť AMD konečne dobehla aj v oblasti škálovania. NVLink je už roky poprednou technológiou GPU fabric a počas dvoch generácií to bol jediný spôsob, ako dosiahnuť špičkový výkon na modeloch MoE s technológiou WideEP. UALoE túto medzeru v jedinej generácii zmenšuje: s rýchlosťou 3.6 TB/s sa MI455X vyrovná Rubin NVLink 6. NVIDIA si stále drží jasný náskok v oblasti hostiteľského prepojenia. Jeden procesor Vera napája dve grafické karty Rubin C2C s rýchlosťou viac ako 1.8 TB/s, zatiaľ čo každý MI455X komunikuje so svojím hostiteľom Venice cez prepojenie Infinity Fabric s rýchlosťou 256 GB/s. Tento rozdiel formuje, ako sa tieto dve rackové architektúry ďalej v tomto článku odlišujú.
V surových výpočtoch MI455X vedie na všetkých úrovniach, s jednou poznámkou pod čiarou: formáty OCP MX od AMD a NVFP4 od NVIDIA sa škálujú odlišne, takže ich berte ako inzerované špičky; poskytovaný výkon je samostatná otázka.
| tvoril | AMD MI455X | NVIDIA Rubín | AMD MI355X | NVIDIA B300 |
|---|---|---|---|---|
| MXFP4 / NVFP4 | 40.26 PF | 35 PF | 10.1 PF | 15 PF |
| MXFP6 / FP6 | 20.13 PF | 17.5 PF | 10.1 PF | 5 PF |
| MXFP8 / FP8 | 20.13 PF | 17.5 PF | 5 PF | 5 PF |
| FP16 / BF16 | 5.03 PF | 4 PF | 2.5 PF | 2.5 PF |
| FP32 | 315 XNUMX XNUMX TF | 130 XNUMX XNUMX TF | 157.3 XNUMX XNUMX TF | 75 XNUMX XNUMX TF |
V porovnaní s MI355X poskytuje MI455X štvornásobok priepustnosti MXFP4 a MXFP8 a dvojnásobok rýchlostí FP16/BF16 a FP32. Porovnanie s NVIDIA sa delí na dve časti. V porovnaní s B300 poskytuje MI455X 2.7-násobok priepustnosti FP4 a štvornásobok rýchlostí FP6 a FP8. Rubin je zmysluplným benchmarkom a oproti nemu má MI455X konzistentnú výhodu: 15 % pri FP4, 15 % pri FP6 a FP8 a 26 % pri FP16/BF16. Najväčší rozdiel sa objavuje pri FP32, kde je TF 315 MI455X zhruba 2.4-násobok TF 130 Rubin a viac ako štvornásobok TF 75 B300. Toto číslo pochádza z HPC línie spoločnosti Instinct a stále je dôležité pre prácu s umelou inteligenciou, pretože hlavné váhy, vysoko presná akumulácia a vedecké pracovné zaťaženie naďalej prevyšujú nízkobitové formáty.
Vnútri CDNA 5
Pozrime sa dvakrát na architektúru a pozrime sa, čo v skutočnosti poháňa tento špičkový výkon.
Z XCD na SIMD
Prechádzanie hierarchiou od balíka nadol ukazuje, koľko bolo prestavaných vecí, pretože CDNA 4 organizovala výpočtový čip veľmi odlišne. Na MI355X každý XCD niesol 32 aktívnych výpočtových jednotiek a súkromnú 4 MB L2 vyrovnávaciu pamäť, ktorá zhromažďovala prevádzku čipu predtým, ako dosiahla Infinity Fabric. CDNA 5 si ponecháva osem XCD, ale prestavuje to, čo sa v nich nachádza, pričom si požičiava štruktúru a terminológiu z grafickej rady RDNA od AMD. Každý XCD MI455X sa teraz rozdelí na dva Shader Enginey. Každý Shader Engine fyzicky obsahuje 17 Work Group procesorov, pričom 16 je zapnutých a jeden je rezervný pre výťažnosť. L2 procesor na XCD je úplne preč, vybratý z výpočtového čipu a umiestnený do základných čipov pod ním, do ktorých sa vracia pamäťová sekcia.
Dôležitá aritmetika je to, čo sa nezmenilo. XCD stále prispieva 32 aktívnymi jednotkami a GPU má stále celkovo 256, čo je rovnaký počet výpočtových jednotiek, aký mal MI355X. Žiadne zo štvornásobného nárastu priepustnosti s nízkou presnosťou, ktorý bol zaznamenaný počas generácie, nepochádza z pridania vykonávacích jednotiek; všetko pochádza z toho, že každý WGP vykonáva viac práce za cyklus, a práve WGP je miestom, kde sa redizajn sústreďuje.
WGP je zostavený zo štyroch 32-pruhových SIMD jednotiek a štyroch skalárnych jednotiek zdieľajúcich konštantnú vyrovnávaciu pamäť. Najväčšou zmenou je spôsob, akým ním prechádzajú vlákna: prechod z Wave64 na Wave32. Vlna je zväzok vlákien, ktoré SIMD beží v súlade. CDNA 4 používala Wave64, pričom každú 64-vláknovú vlnu presúvala cez 16-pruhový SIMD počas štyroch hodinových cyklov. CDNA 5 úplne ruší podporu Wave64, ako prvá architektúra Instinct, ktorá to urobila, a natívne spúšťa Wave32. 32-vláknová vlna mapuje jeden k jednému na každú zo štyroch 32-pruhových SIMD jednotiek WGP, vydáva inštrukcie v jednom cykle a umožňuje každému SIMD spustiť novú inštrukciu v každom hodinovom cykle.
Užšie a rýchlejšie vlny menia spôsob, akým sa práca pohybuje strojom. Latencia inštrukcií klesá, pretože vlna končí skôr. Divergencia vetiev stojí menej, pretože rozdelenie typu „prevzaté alebo nie“ teraz zastaví maximálne 32 vlákien namiesto 64. Tlak na registre sa znižuje, takže zostáva viac vĺn, až 64 na WGP oproti polovici predtým. To dáva plánovaču viac menších, nezávislých častí práce, za ktorými sa dá skryť latencia pamäte. Wave32 tiež uľahčuje mapovanie rôznych veľkostí dlaždíc pre tenzorové operácie na hardvér, čím zjednodušuje vývoj jadra.
Single-cycle issue is only the start of the throughput story. The SIMDs co-execute, starting new instructions while earlier multi-cycle operations drain underneath, and packed vector instructions carry 64 threads' worth of work in a single issue, details AMD's architects confirmed in the post-briefing Q&A. The vector pipeline also gains native BF16 support and a set of new data-conversion instructions for moving tensors between formats. The transcendental units double their throughput over the MI355X and add a native tanh instruction, so the softmax and activation math inside attention keeps pace with the tensor hardware around it. That path is becoming a habit: CDNA 4 doubled the transcendental rates to accelerate attention, and CDNA 5 doubles them again.
Hierarchia pamäte
Za vykonávacími jednotkami sa nachádza hierarchia prestavaná zhora nadol a najzreteľnejší spôsob, ako ju vidieť, je úroveň po úrovni v porovnaní s MI355X.
| Úroveň | MI455X (CDNA 5) | MI355X (CDNA 4) |
|---|---|---|
| Vektorové registre | 128 kB na SIMD; 1 024 na vlákno; 2× šírka pásma | 128 kB na SIMD; 256 na vlákno |
| Miestna predajňa WGP / CU | 384 KB (320 KB LDS + 64 KB vektorová vyrovnávacia pamäť); 2× šírka pásma | 192 kB (160 kB LDS + 32 kB L1) |
| Vyrovnávacia pamäť inštrukcií / konštant | 64 kB + 16 kB na WGP | 64 kB zdieľaných na dve CU + 16 kB |
| L2 | 2 × 96 MB na diskoch FCD; 54 TB/s | 8 × 4 MB, jeden na XCD |
| Vyrovnávacia pamäť na strane pamäte | Eliminovaný | 256 MB nekonečnej vyrovnávacej pamäte |
| HBM | 432 GB HBM4; 12 × 2 048-bitové zásobníky; 23.3 TB/s | 288 GB HBM3E; 8 × 1 024-bitové zásobníky; 8 TB/s |
Riadky vyrovnávacej pamäte sú miestom, kde sa architektúra zmenila. CDNA 4 používala trojúrovňový dizajn: súkromná 4MB L2 pamäť každého XCD zlúčila prevádzku daného čipu predtým, ako dosiahla Infinity Fabric, a zdieľaná 256MB Infinity Cache v I/O čipoch sa nachádzala na strane pamäte pred radičmi HBM. CDNA 5 obe vrstvy odstránila a nahradila ich dvoma nezávislými 96MB L2 vyrovnávacími pamäťami, jednou na Fabric a Cache Die, pričom každá bola zostavená ako 96 blokov s veľkosťou jedného megabajtu. Rozloženie je vertikálne: štyri XCD alebo osem Shader Engines je hybridne prepojených na vrchu každého FCD, ktorý tiež obsahuje šesť z dvanástich lokalít HBM4, a tieto dva FCD sa stretávajú v centrálnej Infinity Fabric v strede puzdra, pričom I/O čipy uzatvárajú oba konce. Ktorákoľvek L2 môže obsahovať ľubovoľnú adresu v pamäti GPU a Infinity Fabric udržiava tento pár koherentný. Uvedeným dôvodom spoločnosti AMD je šírka pásma: jedna z týchto vyrovnávacích pamätí sama o sebe poskytuje 1.5-násobok celkovej šírky pásma celej vyrovnávacej pamäte Infinity Cache čipu MI355X, dvojica poskytuje trikrát viac a žiadna z tejto prevádzky nemusí prekročiť hranicu medzi čipmi, ktorá obmedzovala staré rozloženie.
Vyrovnávacia pamäť preberá aj nové úlohy. Atomické dáta v rozsahu zariadenia, ktoré sa predtým vykonávali v rámci štruktúry (fabric), teraz bežia v rámci L2 s oveľa vyššími rýchlosťami, zatiaľ čo atomické dáta v rozsahu systému zostávajú v Infinity Fabric ako predtým. Nový arbiter vysielania to dopĺňa, pričom multicastuje tenzorové dlaždice každému WGP spolupracujúcemu na rovnakej matici. Preto váha načítaná raz obslúži všetky, čo zvyšuje efektívnu šírku pásma čítania až 4-násobne.
Vyššie uvedené úrovne sa prispôsobujú. Lokálne úložisko na WGP sa zdvojnásobuje na 384 KB, rozdelené ako 320 KB LDS a 64 KB vyrovnávacia pamäť pre vektorové dáta s dvojnásobnou šírkou pásma na čítanie. To je priestor pre FlashAttention na uchovávanie dotazov, kľúčov, hodnôt a čiastočných redukcií na čipe namiesto zápisu celej matice pozornosti. Podporuje tiež zlúčené jadrá MoE na uchovávanie stavu smerovania a akumulátorov. Súbor vektorových registrov si zachováva kapacitu 128 KB na SIMD, ale je reorganizovaný pre Wave32. To má za následok dvojnásobný počet vĺn, umožňuje jednému vláknu adresovať 1 024 registrov namiesto 256 a zdvojnásobuje šírku pásma registrov na napájanie širších SIMD a ich jednotiek na spoločné vykonávanie.
Skalárna strana je prepracovaná tak, aby zodpovedala 128 skalárnym registrom na vlnu a 32 KB na WGP. V základni sa HBM4 presúva z ôsmich 1 024-bitových zásobníkov na dvanásť 2 048-bitových zásobníkov, čím sa kapacita zvyšuje o 50 % na 432 GB a šírka pásma sa zvyšuje o 2.9 × na 23.3 TB/s cez 192-kanálové rozhranie.
To všetko zabezpečuje nový Tensor Data Mover, jeden na WGP, ktorý rozumie schémam tenzorových dlaždíc až do piatich dimenzií a asynchrónne streamuje dlaždice medzi DRAM a lokálnym úložiskom bez medziľahlého pridávania registrov. Prenosy sú opísané deskriptormi načítanými zo skalárnych registrov a hardvérovo kontrolovanými hranicami z dôvodu bezpečnosti. Podporované sú multicastové načítania, takže jednotky SIMD sa nikdy nezastavia pri čakaní na kopírovanie alebo napaľovanie registrov, ktoré pridávajú jeden. Je to odpoveď CDNA 5 na akcelerátory tenzorovej pamäte na nedávnych produktoch NVIDIA. Sada funkcií využitia dopĺňa prednú časť stroja: klastre pracovných skupín dávajú jadrám explicitnú kontrolu nad umiestnením a súbežnosťou pre pracovné zaťaženie zdieľania údajov, rozdelené a pomenované bariéry umožňujú producentovi signalizovať dokončenie a pokračovať bez čakania na odpoveď spotrebiteľa, predbežné načítanie na každej úrovni hierarchie pripravuje dáta smerom k ich bodu spotreby a prepracovaný príkazový front-end skracuje latenciu spustenia a odosielania jadra pre krátke jadrá, ktoré dominujú inferencii.
Systém DMA bol prestavaný na rovnakej filozofii. Softvér plánuje prenosy proti DMA front-endom, zatiaľ čo fyzicky zodpovedné back-endy, ktoré sa nachádzajú vedľa liniek UALoE, rozdeľujú každú pracovnú položku, vyrovnávajú ju medzi všetky dostupné linky a vyťahujú vyrovnávacie pamäte z pamäte priamo von, namiesto toho, aby prenášali dáta cez čip do vzdialeného enginu. Back-endy tiež reagujú na spätný tlak preťaženia zo strany škálovateľnej siete a obchádzajú zaťažené cesty, takže komunikačné knižnice dostávajú vyváženú prevádzku v sieti bez toho, aby vôbec rozumeli topológii, ktorá sa nachádza pod nimi.
Rozdelenie GPU: NPS a SR-IOV
Dvojúrovňové fyzické rozloženie prináša druhú výhodu v spôsobe rozdelenia GPU. V NPS1 je celý čip jednou doménou NUMA: adresy sa prekladajú cez všetkých dvanásť HBM stackov a obe polovice pre jednotnú šírku pásma, jednoduchý režim pre portovanie a rovnomerne rozložené prístupové vzory. NPS2 rozdeľuje GPU na dve domény NUMA, pričom každá vlastní šesť HBM stackov, jeden Fabric a Cache Die a XCD na nej naskladané. Každý odkaz na pamäť potom zostáva vo svojej vlastnej polovici a každá doména efektívne získa súkromných 96 MB L2. To viac než len skracuje fyzickú cestu. Bez zdieľaných liniek vyrovnávacej pamäte medzi polovicami koherentná prevádzka Infinity Fabric medzi dvoma L2 do značnej miery mizne a AMD tvrdí, že výsledkom je nižšia latencia a lepšia efektivita pre aplikácie s podporou NUMA. CDNA 4 ponúkala rovnaký široký kompromis, pričom NPS2 udržiavala prevádzku v jednom I/O chipe, ale CDNA 5 ju vylepšuje, pretože lokalizovaná vec je teraz celá L2 vyrovnávacia pamäť, a nie len časť vyrovnávacej pamäte na strane pamäte.
Navrchu sú zásobníky rozdelenia výpočtov. Osem XCD umožňuje GPU bootovať ako jeden, dva, štyri alebo osem priestorových oddielov, čím sa 432 GB HBM rozdelí na rovnomerné segmenty s veľkosťou 432, 216, 108 alebo 54 GB, pričom každá z nich má osem až jeden XCD. Párovanie oddielov s doménami NUMA umožňuje runtime dispečingu pracovať a umiestňovať alokácie priestorovo, takže úloha pristane na XCD najbližšie k jej pamäti. SR-IOV potom virtualizuje oddiely až do ôsmich hardvérovo izolovaných virtuálnych počítačov, pričom izolácia sa vynúti v samotnom pamäťovom systéme, nezávisle od toho, ktorý režim NUMA beží. MI355X ponúkal rovnaké možnosti oddielov od jedného do ôsmich, takže granularita nie je nová; CDNA 5 pridáva pod ním správanie privátnej úrovne 2 a nad ním virtuálne pody na úrovni racku, ktoré pokrýva sekcia Helios.
AMD Helios
Jeden MI455X je rýchly. Ale s týmto uvedením na trh sa AMD pripája ku klubu rackových a rozsiahlych doménových systémov.
Fyzicky Helios upúšťa od tradičných 19-palcových a 21-palcových rackov v prospech Open Rack Wide, formátu, ktorý AMD pomohla vyvinúť so spoločnosťou Meta v OCP: skriňa so šírkou 1.2 metra a hĺbkou 1.3 metra so 44 OU vertikálneho priestoru. Vo vnútri je 72 GPU umiestnených v dvoch bankách s deviatimi výpočtovými zásuvkami, medzi ktorými je umiestnených šesť prepínačov. Každé prepojenie medzi GPU a prepínačom je medené a vedené štyrmi zaslepovacími káblovými kazetami v zadnej časti, takže zásuvky sa pri údržbe vysúvajú bez nutnosti manuálneho odpájania káblov.
Celý stojan odoberá 225 až 245 kW v závislosti od pracovného zaťaženia, dodávaného cez 50V kvapalinou chladenú zbernicu, pričom zadné rozdeľovače tlačia približne 385 litrov chladiacej kvapaliny za minútu zo slučky zariadenia. Samotné rozvádzače sú seriózny hardvér: každý váži približne 170 libier a uloženie 1 728 diferenciálnych párov pripojení rozvádzača vyžaduje približne 690 libier vkladacej sily, a preto jeho vačkové rukoväte prebiehajú takmer po celej šírke rozvádzača.
Stavebné bloky
Výpočtový zásobník
V referenčnom dizajne je každý výpočtový modul samostatným uzlom postaveným na 4 moduloch MI455X a vysokofrekvenčnom 96-jadrovom procesore Venice SP7 s frekvenciou 5 GHz. Jeho 16 DIMM socketov obsahuje 1 TB DRAM ako 16 × 64 GB DDR5 ECC RDIMM moduly s kapacitou 64 GB a 5 slotmi E1.S NVMe visiacich mimo procesora. Platforma je dimenzovaná na oveľa viac: 16 pamäťových kanálov Venice podporuje šírku pásma až 1.6 TB/s a s 256 GB RDIMM modulmi, ktoré sú dnes na vrchole radu DDR5, dosahuje 16-kanálový socket s 1 DIMM na kanál maximum 4 TB.
V šľapajach spoločnosti NVIDIA sa CPU pripája ku koherentnej pamäťovej doméne cez Infinity Fabric namiesto toho, aby sedel za GPU ako obyčajný hostiteľ PCIe, a spoločnosť AMD tvrdí, že pomer CPU k GPU 1:4 je zámerný: samotné jadro predbieha konkurenciu, pričom odhady AMD umiestňujú 5GHz jadro Zen 6 o približne 20 % pred jadrom NVIDIA Vera vo výkone na jadro, a keďže socket je štandardný SP7, zákazníci, ktorí chcú viac hostiteľských výpočtov, môžu osadiť akýkoľvek model Venice až po vlajkovú loď s 256 jadrami. Jeden socket Venice tiež nesie oveľa väčšiu kapacitu DDR5 ako hostiteľský dizajn LPDDR a jeho šírka pásma pamäte sa saturuje na všetky 4 GPU cez prepojenia Infinity Fabric.
Toto prepojenie Infinity Fabric stojí za bližšie preskúmanie. V rozhovore s Georgeom Cozmom z Chips and Cheese o prepojení Venice-MI455X navrhol, aby koherentné prepojenie fungovalo na PCIe linkách CPU, podobne ako EPYC už roky prenáša svoje socketové prepojenia xGMI cez PCIe PHY. Čísla túto teóriu potvrdzujú. PCIe Gen 6 signály dosahujú rýchlosť 64 Gb/s na linku a prepojenie x16 s touto rýchlosťou dosahuje 128 GB/s v každom smere, čo je presne 256 GB/s obojsmerne, ktoré AMD udáva na GPU. Bloková schéma v bielej knihe CDNA 5 označuje hostiteľské rozhranie Infinity Fabric rýchlosťou 64 Gb/s na linku, čo je presná rýchlosť signalizácie Gen 6. Táto teória tiež vysvetľuje, prečo sa objavuje akákoľvek SKU Venice: 4 GPU spotrebúvajú 64 zo 128 liniek CPU Gen 6, pričom zvyšok zostáva voľný pre DPU, úložisko a ďalšie systémové potreby.
Cez každý výpočtový modul prechádzajú tri samostatné siete a každá slúži na inú úlohu. Najkonvenčnejšia je front-end: jeden Pensando Salina 400G DPU pripája uzol k bežnej sieti dátového centra, ktorú podrobnejšie preskúmame neskôr.
Druhým je škálovanie, sieť, ktorá spája racky do klastrov, a najčistejším spôsobom, ako to pochopiť, je počítať SerDess. Škálovanie MI455X môže používať buď PCIe Gen 6 s rýchlosťou 64 Gb/s na linku, alebo UALink128 s rýchlosťou 128 Gb/s a sieťová karta Vulcano 800 potrebuje približne 128 Gb/s pripojenia v každom smere, aby udržala napájanie svojho 800 GbE portu. Pri rýchlostiach Gen 6 to vyžaduje plné prepojenie x16 na sieťovú kartu, takže GPU prenáša 2 sieťové karty; pri zdvojnásobenej rýchlosti signalizácie UALink128 vykonáva prepojenie x8 rovnakú prácu na polovici SerDes, takže GPU prenáša 3, čo je konfigurácia, ktorú dodáva Helios. V oboch prípadoch nie je prepojenie UALink128 ničím iným ako súkromným káblom medzi GPU a sieťovou kartou; samotná sieť začína vo Vulcane. Každá sieťová karta riadi 800GbE port, na ktorom bežia transporty kompatibilné s UEC, vrátane MRC, viaccestného protokolu OpenAI vyvinutého v spolupráci s AMD a ďalšími partnermi. Fyzicky sú sieťové karty umiestnené na 2 vlastných doskách v každej zásuvke, pričom každá nesie 4 alebo 6 čipov Vulcano ASIC, čo zodpovedá konfiguráciám 2 na GPU a 3 na GPU. V plnej konfigurácii to znamená 12 sieťových kariet na zásuvku a šírku pásma 2 400 Gb/s na škálovateľnú grafickú kartu. A pretože sieťové karty sú pripojené k grafickým kartám, pričom CPU nie je nikde v ceste, prevádzka medzi rackmi sa nikdy nedotkne hostiteľského prepojenia.
Treťou je škálovateľnosť, teda štruktúra, vďaka ktorej je Helios skutočne rackový systém. Každá grafická karta (GPU) nesie 36 liniek UALoE, ktoré prevádzkujú sémantiku pamäte UALink cez ethernet ESUN, pričom každá linka dosahuje rýchlosť 400 Gb/s, čo predstavuje až 3.6 TB/s obojsmernej šírky pásma na jednu GPU. Tieto linky vychádzajú zo zadnej časti priehradky smerom k prepínačom a prenášajú prevádzku načítavania a ukladania, ktorá spája 72 GPU do jedného podu so zdieľanou pamäťou.
Prepínač zásobníka
Ďalej sú na rade prepínacie priehradky a najpozoruhodnejšia vec na nich je, aký obyčajný je ich kremík. Každá zo 6 priehradiek obsahuje 2 Broadcom Tomahawk 6 ASIC, rovnaké čipy pre prepínače Ethernet pre obchodníkov, ktoré hyperscalery nasadzujú vo svojich sieťach typu leaf-spine, pričom každá nesie 512 liniek s rýchlosťou 200 G.
Každá grafická karta (GPU) odosiela 3 linky UALoE (každá linka UALoE má 2 linky s rýchlosťou 200 Gb/s) do každého z 12 prepínačov, pričom 144 liniek opúšťa každú výpočtovú priehradku cez zadné káblové kazety. Každá karta Tomahawk teda ukončuje 216 liniek s rýchlosťou 400 Gb/s, čím prenáša obojsmernú šírku pásma 21.6 TB/s, zatiaľ čo každá grafická karta si zachováva plných 36 liniek (72 liniek s rýchlosťou 200 Gb/s) a rýchlosť 3.6 TB/s. Prepínače na to nepotrebujú nič exotické: zapuzdrenie UALoE je jednoduchý protokol L2, presmerovanie sa spolieha na statické programovanie MAC adries, ktoré ethernetový kremík ponúka už dve desaťročia, a riadenie toku je štandardné prioritné riadenie toku.
S jednou vrstvou nikdy nevznikajú celé triedy problémov s preťažením dátových centier: nedochádza k viacvrstvovému incastovaniu a každá GPU je od ostatných vzdialená presne jeden skok s pevnou latenciou. V porovnaní s priamou sieťou umožňuje prepínaný prístup aj tomu, aby si jeden tok nárokoval šírku pásma celej cesty, keď ju pracovná záťaž potrebuje, a udržiava každú GPU v rovnakej vzdialenosti. Plánovanie teda nikdy nemusí myslieť na lokalitu a poskytuje každému spojeniu rovnakú ochranu pred chybami.
Odolnosť proti chybám
Helios považuje zlyhanie hardvéru za vstupný faktor návrhu. V tomto rozsahu sa vždy niečo pokazí: nestabilný kábel, stratený paket, prepínač vytiahnutý kvôli aktualizácii firmvéru, výpočtový modul, ktorý úplne zlyhá. Fabric je navrhnutý tak, aby žiadna z týchto udalostí nezastavila úlohu. Stratené pakety sa obnovia opätovným prenosom a keď zlyhá prepojenie, kábel alebo prepínač, prevádzka sa po krátkej pauze automaticky presmeruje okolo neho, pričom pracovná záťaž pokračuje na zostávajúcej šírke pásma namiesto reštartu z kontrolného bodu.
12-rovinná topológia robí degradáciu plynulou a 3-cestné prekladanie určuje veľkosť kroku. Strata jedného z troch spojení, ktorými GPU vedie k prepínaču, a táto rovina si ponechá dve tretiny svojej šírky pásma. Strata celého Tomahawku a každé GPU stratí 1/12 svojej škálovateľnej šírky pásma, zatiaľ čo systém typu „všetko ku všetkým“ pokračuje v práci na ostatných 11 rovinách. Dokonca aj strata celého prepínača, teda 2 z 12 prepínačov, stojí každé GPU šestinu jeho šírky pásma bez prerušenia konektivity, pretože žiadne GPU nie je závislé od žiadneho jednotlivého prepínača, aby sa dostalo k inému. Pre porovnanie, Vera Rubin NVL72 rozdeľuje každé GPU na 36 ASIC NVSwitch 6 v 9 prepínačoch, takže zlyhanie prepínača v tomto prípade stojí bližšie k deviatej časti. NVIDIA nakupuje menšie kroky degradácie s 3× väčším počtom ASIC pre prepínače; AMD namieta, že 12 prepínačov s vyšším radixom znamená menej komponentov, káblov a konektorov, ktoré by mohli v prvom rade zlyhať. Pri tréningovom behu meranom v týždňoch je rozdiel medzi stratou šestiny šírky pásma siete Fabric a stratou úlohy celkovou ekonomickou hodnotou racku.
Virtuálne pody
To isté zariadenie, ktoré rozdeľuje infraštruktúru okolo porúch, ju môže rozdeliť aj zámerne. Spoločnosť AMD nazýva tento konštrukt Virtuálne pody alebo vPody a jednotkou je výpočtový uzol: akúkoľvek kombináciu 18 uzlov racku so 4 GPU je možné ohradiť do izolovaného podu, od 1 uzla pre malého nájomníka až po väčšinu racku pre veľkú tréningovú úlohu. Izolácia je vynútená v hardvéri infraštruktúry, pod čímkoľvek, čo rozhodne plánovač. VPod je viazaný na svojho nájomníka; ostatné pody nemajú prístup k jeho pamäti ani k jeho prevádzke a šifrovanie AES-256-GCM s rýchlosťou linky na každom prepojení UALoE s podporou klastrových kľúčov vlastnených zákazníkom udržiava tenzory jedného nájomníka nepriehľadné pre ďalšieho. Hosťovský virtuálny počítač, ktorý sa rozprestiera cez niekoľko GPU, má svoju bezpečnostnú doménu transparentne rozšírenú cez ne, bez nutnosti dôverovať hostiteľskému operačnému systému. NVIDIA rieši rovnaký problém na svojich rackoch NVL72 rozdelením domény NVLink na oddiely, pričom jej služba IMEX sprostredkúva, ktoré uzly si môžu navzájom exportovať a importovať pamäť; vPody sú ekvivalentom UALoE vo svete, takže prevádzkovatelia z flotíl GB200 alebo GB300 budú mať tento koncept povedomý.
Ak sa výpočtový modul zrúti, polomer zlyhania sa zastaví na jeho vPod: táto pracovná záťaž sa reštartuje od kontrolného bodu, zatiaľ čo všetky ostatné pody bežia bez zmeny, pričom hranica nájomníka slúži aj ako hranica zlyhania. Príbeh rozdelenia sa tiež vnoruje až nadol, pretože jeden MI455X sa môže rozdeliť až na 8 virtuálnych počítačov SR-IOV, takže ten istý rack môže obsluhovať jedného zákazníka so všetkými 72 GPU ako jeden pod alebo až 576 nájomníkov GPU-slice s hardvérovou izoláciou na každej úrovni tejto hierarchie.
Rovina riadenia
Toto všetko prevádzkuje špecializovaný softvérový balík, ktorý sa riadi rovnakou tézou otvorenosti ako hardvér. AMD Fabric Manager (AFM) je riadiaca rovina: vyhľadáva a poskytuje 72-GPU fabric s bezkontaktným spúšťaním, takže zapnutie racku stačí na to, aby sa všetkých 72 GPU zapojilo, potom overuje zapojenie káblových kaziet proti chybám pri montáži, rozdeľuje rack na vPody a koordinuje presmerovanie a obnovu opísanú vyššie. Neexistuje žiadna vyhradená riadiaca platforma. AFM beží na vlastných procesoroch správy prepínačov, pretože 3 redundantné inštancie sú rozmiestnené po 6 rackoch s distribuovanou databázou medzi nimi, takže strata prepínača nič neovplyvní riadiacu rovinu a rozhranie REST API smerujúce na sever sprístupňuje fabric klastrovým radičom spravujúcim mnoho rackov.
Pod kapotou si AFM požičiava svoje rozhranie z cloudového sveta, je postavené na štandardných ovládačoch štýlu Kubernetes s agentmi na každom zásobníku a spracováva detaily o štruktúre, ktoré používatelia nikdy nechcú vidieť, až po priradenie ID akcelerátora, ktoré UALink používa na adresovanie každej GPU. Je to tiež vrstva pozorovateľnosti racku. Jeden dashboard sleduje využitie GPU a štruktúry, stav prepojenia a zlyhania; keď sa niečo pokazí, zobrazí sa prebiehajúca náprava a vygenerujú sa upozornenia, ktoré môžu operátori pripojiť k svojim vlastným nástrojom. Na snímke obrazovky vyššie je AFM, ktorý sleduje klaster Helios vo vlastných laboratóriách spoločnosti AMD. Správa funguje v rámci pásma alebo mimo pásma, takže diagnostika a konfigurácia nikdy nenarúšajú bežiace pracovné zaťaženie. Prepínače pod AFM prevádzkujú sieťový operačný systém postavený na SONiC, open-source NOS, a AMD tvrdí, že jeho prírastky UALoE budú prenášané a sprístupňované prostredníctvom štandardných API gNMI. Nad rackom sa nachádza správca infraštruktúry racku, ktorý zabezpečuje životný cyklus uzlov a prepínačov, napájanie a detekciu únikov a kontrolér klastra pripája Helios ku Kubernetes a Slurm na účely plánovania.
Helios vs. NVIDIA Vera Rubin NVL72
Pozrime sa teda na to, ako si to stojí v porovnaní s ponukou NVIDIA, s ktorou sa Helios na trhu skutočne stretne: Vera Rubin NVL72.
| Metrika stojana | AMD Helios | Vera Rubínová NVL72 |
|---|---|---|
| GPU | 72 MI455X | 72 Rubín |
| procesory | 18 Benátky | 36 Veru |
| Kapacita HBM | 31TB | 20.7TB |
| Šírka pásma HBM | 1.7 PB/s | 1.58 PB/s |
| Škálovanie na GPU | 3.6 TB/s | 3.6 TB/s |
| Rozšírenie racku | 260 TB/s | 260 TB/s |
| Škálovanie na GPU | 2,400 Gb/s | 1,600 Gb/s |
| Prepínače škálovania | 12 Tomahawk 6 | 36 NVSwitch 6 |
| Formát racku | Dvojitá šírka ORW | Jednoduchý MGX |
Na papieri sa skóre nakláňa v prospech AMD: o 50 % viac HBM, rovnakých 3.6 TB/s škálovania na GPU z tretiny menšieho počtu prepínacích ASIC a o 50 % väčšia škálovateľná šírka pásma na GPU. Interné testy spoločnosti AMD premieňajú tieto špecifikácie na tvrdenie o výkone, pričom dosahujú o 10 až 15 % viac tokenov za sekundu na GPU na platforme Kimi K2 Thinking a až o 30 % viac tokenov na dolár. Toto sú čísla AMD v porovnaní s publikovanými číslami spoločnosti NVIDIA, nie nezávislé merania, ale stanovujú latku, podľa ktorej AMD očakáva, že bude posudzovaná. Zaujímavejšie rozdiely sa skrývajú v tom, ako každý dizajn prepája svoje GPU s vonkajším svetom.
Začnite so škálovaním. Sieťové karty MI455X sú pripojené priamo k GPU. Podľa SemiAnalysis to nie je pravda: podľa SemiAnalysis chýba PCIe na napájanie oboch sieťových kariet ConnectX-9, takže sú pripojené k CPU Vera a prevádzka GPU prebieha dlhšou cestou: z Rubinu do NVLink-C2C do Very, potom k PCIe do ConnectX-9. Táto obchádzka si vyžaduje značnú latenciu a dvojitú prevádzku C2C linky. Keďže výpočtová, hostiteľská a sieťová prevádzka sú pripojené súčasne, časť šírky pásma C2C Very ide na prenos dát sieťovej karty a efektívna šírka pásma hostiteľa, ktorú GPU vidí, klesá pod bežných 1.8 TB/s.
Matematika šírky pásma to ešte zhoršuje. Každý MI455X dosahuje škálovateľnosť 2 400 Gbit/s oproti 1 600 Gbit/s u Rubina, takže Helios prenáša viac siete na FLOP. Simulácie AMD s 8 000 GPU tréningovým behom pripisujú tretej sieťovej karte približne o 13 % rýchlejšie dokončenie úloh.
Rubin útočí na úložisko a dôvodom je opäť miesto, kde sa nachádza sieťová karta. ConnectX-9 má vstavaný prepínač PCIe, takže NVMe môže byť pripojené priamo k sieťovej karte a GPU môže sťahovať dáta cez úložisko GPUDirect bez dotyku s CPU. MI455X nemá ekvivalent: jeho úložisko je pripojené k hostiteľovi Venice, takže všetko v tvare GPUDirect musí prejsť cez CPU a vrátiť sa cez prepojenie Infinity Fabric. AMD optimalizovala sieťovú cestu a zaplatila za ňu na ceste k úložisku; NVIDIA urobila opačný kompromis. To, čo je dôležitejšie, závisí od toho, či je pracovná záťaž viazaná na presun aktivácií medzi GPU alebo streamovanie dát z disku.
Čo môžu zákazníci zmeniť
Stručne povedané, všetko vyššie uvedené opisuje referenčný dizajn AMD a niekoľko čísel predstavuje úrovne, ktoré môžu zákazníci prekročiť. Najzrejmejším prípadom je hostiteľský procesor. Rubin Vera prichádza v jednej pevnej konfigurácii; Venice v pätici Helios je štandardný päticový diel SP7 a AMD potvrdilo, že akýkoľvek model Venice sa objaví bez akejkoľvek úpravy špecifickej pre Helios. Referenčný pätica používa 96-jadrový 5GHz diel, pretože rýchlosť jedného vlákna udržiava GPU zásobované. Napriek tomu nič nebráni zákazníkovi v nakonfigurovaní si verzie s 256-jadrovou vlajkovou loďou alebo Venice-X s 1 152 MB naskladanej L3 pamäte pre predspracovanie náročné na vyrovnávaciu pamäť.
Pamäť a sieťové pripojenie sa riadia rovnakou logikou socket-and-slot. Referenčný 1 TB DRAM je 16 skromných 64 GB RDIMM; hustejšie DIMM moduly rozširujú kapacitu na 4 TB a MRDIMM-12800 odomyká plných 1.6 TB/s pre Venice. Na strane siete sa môže zostavenie znížiť z 3 sieťových kariet na GPU na 2 cez obyčajné PCIe Gen 6; každý port Vulcano môže bežať ako 1x800G, 2x400G, 4x200G alebo 8x100G v porovnaní s Tomahawk 5 alebo Tomahawk 6 fabrics a P4 pipeline ponecháva transport, RoCEv2, MRC alebo niečo proprietárne, na volanie operátora. Dokonca aj rovina správy je vymeniteľná, pretože prepínací NOS je open-source SONiC a AFM sprístupňuje celú fabricu prostredníctvom svojho severného API.
Aj rozpočet na energiu kopíruje päticu. Superčipy od NVIDIA majú jeden spoločný rozmer: Vera je 450W súčiastka s obmedzeným výdajom energie a posledné generácie pri zaťažení presúvajú energiu smerom k GPU. Spoločnosť AMD neuviedla, či referenčný dizajn obmedzuje alebo posúva výkon hostiteľa, ale pri dizajne od AMD je táto otázka na zákazníkovi a ten si môže prispôsobiť systém s vyššou spotrebou energie bez prebytku energie.
Základy PCIe hostiteľského prepojenia, rozbalené späť v sekcii výpočtového zásobníka, otvárajú posledné dvere, tieto otvorene špekulatívne. Venice podporuje 2P konfigurácie a vybrané hostiteľské platformy AI môžu prevádzkovať 2P s až 160 použiteľnými PCIe linkami výmenou šírky xGMI medzi soketmi za I/O. Zákazník by si mohol predstaviť vytvorenie dvojsoketového zásobníka, ktorý by zodpovedal pomeru CPU k GPU 1:2 od NVIDIA, alebo preladiť prepojenia xGMI, aby sa zvýšila efektívna šírka pásma CPU k GPU. Nič nenaznačuje, že by niekto niečo také staval dnes, a nič z toho nepreklenuje hrubú medzeru oproti NVLink-C2C s rýchlosťou 1.8 TB/s. Skutočným bodom je, kto drží pero: na Heliose je hostiteľ, jeho pamäť, jeho výkon a potenciálne aj jeho topológia rozhodnutím zákazníka a superčip od NVIDIA zákazníkovi neposkytne vôbec žiadne pero.
Salina DPU
A teraz späť k front-endovej sieti, ktorú sme predtým odložili. Salina, procesor Pensando DPU 3. generácie od spoločnosti AMD, je karta s kapacitou 400 GB s plne programovateľnou dátovou cestou P4, čo znamená, že nové zapuzdrenie, telemetrický hook alebo transport je aktualizácia firmvéru, ktorá sa aplikuje naživo bez straty prevádzky. Dopravné služby už pokrývajú kontrolný zoznam pre front-end: SDN s VXLAN alebo NVGRE, stavový firewall škálovateľný na milióny pravidiel, IPsec s linkovou rýchlosťou, PSP, DTLS alebo vlastné šifrovanie, NAT a vyvažovanie záťaže. Je to tiež najviac overený kremík v racku. Pensando DPU používajú hyperscalery od roku 2019; Salina dnes vedie nasadenia v spoločnostiach Microsoft, Oracle a IBM; Oracle pripisuje tejto linke 5-násobný zisk SDN a jeden hyperscaler získal späť 22 jadier CPU na server tým, že naň presunul I/O.
Druhým aktom je úložisko. Salina sprístupňuje zariadenia NVMe-over-Fabrics hostiteľovi a virtualizuje vzdialené SSD fondy cez TCP alebo RDMA so šifrovaním, výpismi a kompresiou vykonanou na karte. V systéme Helios pridáva trik z agentickej éry: engine kontextovej pamäte prezentuje emulované KV zariadenie, takže preplnená KV vyrovnávacia pamäť sa preleje do CPU DRAM, lokálneho SSD alebo vzdialeného úložiska a streamuje späť do HBM rýchlosťou linky namiesto toho, aby sa prepočítavala. Ako je uvedené v porovnaní s Rubinom, MI455X nemá úložisko GPUDirect; toto odľahčenie KV je čiastočnou odpoveďou AMD na prevádzku, na ktorej sa najviac stará obsluha.
A práve tu máme výhrady. Rozdiel v šírke pásma je zrejmý: Salina je karta s kapacitou 400 GB a BlueField-4 dodávaná do rackov Vera Rubin zdvojnásobuje túto kapacitu na 800 GB so 64-jadrovým procesorom Grace a spoločne dodávaným rozhraním ConnectX-9. Rozdiel v softvéri je diskutabilnejší, ale reálny. DOCA od NVIDIA poskytuje vývojárom kontajnerizované, predpripravené služby programovateľné v bežnom jazyku C a C++; P4 je špecializovaný jazyk pre dátovú rovinu, ktorého sa väčšina tímov nikdy nedotkla. Porovnanie nie je „katalóg DOCA verzus holý P4“, pretože Salina dodáva svoje hlavné služby kompletné a hyperškálovatelia, ktorí ho nasadzujú, si ho vybrali čiastočne preto, že P4 umožňuje novým protokolom, ako je MRC, dostať sa do firmvéru pred akýmkoľvek kremíkovým cyklom. Skutočný rozdiel spočíva v tom, komu programovateľnosť slúži. Flexibilita Salina je zbraňou pre hyperškálovateľné tímy AMD a P4, ktoré plynule ovládajú P4; DOCA je sada nástrojov, ktorú si môže osvojiť bežný podnikový vývojár. Pre široký trh je zavádzanie softvéru od NVIDIA jednoduchšie a AMD si to uvedomuje.
ROCm.AI
Keď už hovoríme o softvéri, AMD si jedno zo svojich väčších oznámení nechalo pre samotný stack. ROCm.AI, ktorý príde v auguste, je pokusom spoločnosti AMD urobiť platformu GPU agentickou od základov. AI Skills zapája ROCm do kódovacích agentov, ktoré vývojári už používajú, Claude, Codex, Cursor a Gemini, takže inštalácia, poskytovanie a ladenie na Instinct prebieha v jednoduchej angličtine. Hyperloom je odvážnejší kúsok: optimalizátor bez ľudskej interakcie, ktorý profiluje pracovnú záťaž, ladí jej konfiguráciu poskytovania, prepisuje jadrá GPU a overuje výsledky, zatiaľ čo operátor spí. AMD uvádza, že dnes nepretržite optimalizuje približne 14 000 modelov a živá ukážka vyťažila z MiniMax M3 o 38 % vyššiu priepustnosť. Pod agentmi prináša FlyDSL do Pythonu kontrolu takmer na úrovni assembly, ROCm prechádza na pevnú 6-týždňovú kadenciu vydávania a AMD tvrdí, že ROCm.AI poskytuje priemerný 3.3-násobný zisk inferencie a 2.4-násobný zisk tréningu oproti ROCm 7 na identickom hardvéri. ROCm 7 už zaznamenal skutočné zlepšenie; teraz AMD vsádza na umelú inteligenciu, aby zrýchlila tempo.
Pravdepodobne najdôležitejší slajd softvérovej sekcie sa venoval hardvéru. Spoločnosť AMD dôrazne zdôraznila, že každé číslo na ňom bolo zmerané, pričom podtextom bolo, že kremík MI455X je dnes v ROCm funkčný, beží a je rýchly. Čísla: 20 TB/s v dekódovaní FP8 MLA, 20 PFLOPS výpočtov FP4, 3.2 TB/s šírky pásma pri škálovaní a 190 GB/s pri škálovaní. V otázkach a odpovediach spoločnosť AMD uznala, že výsledok FP4 je meraním maximálne dosiahnuteľných matmulFLOPS (MAMF), vykonaným s tvarom matice, ktorý zariadeniu najviac lichotí, čo je štandardná prax pre túto triedu benchmarkov. Je to tiež odvážne odhalenie: AMD otvorene pripúšťa, že MI455X si udržiava približne 50 % svojho maximálneho hodnotenia MXFP4 40.26 PFLOPS, čo je číslo, ktoré by väčšina predajcov zamlčala.
AMD to nazýva najvyšším preukázaným výpočtovým výkonom zo všetkých akcelerátorov na trhu a tu prichádza na rad zrnko soli. FP4 od AMD je OCP MXFP4; NVIDIA je NVFP4. Sú to odlišné recepty: NVFP4 aplikuje zlomkovú škálu FP8 na každý 16-prvkový blok plus navrchu škálu na úrovni tenzora, zatiaľ čo základný MXFP4 používa hrubšiu škálu mocniny dvoch na 32 prvkov, takže FLOP NVFP4 prenesie viac práce ako FLOP MXFP4. CDNA 5 dokáže aplikovať zlomkové škálovanie aj na MXFP4, ale AMD neuviedla, aký recept meranie použilo. Beh Rubin MAMF a beh MI455X MAMF nemerajú rovnakú matematiku, takže porovnania FP4 od rôznych dodávateľov sa ustália iba na úrovni aplikácie: tokeny za sekundu s porovnateľnou presnosťou. Namerané beaty sa predpokladali, ale tieto čísla sú najpravdivejšie v porovnaní s predchádzajúcou generáciou AMD, kde sú 3× až 4× zisky jednoznačné.
V prospech AMD je aj protiváha. Toto sú skoré výsledky ROCm.AI na úplne novom kremíku, takže ak vôbec niečo, podceňujú to, čo dosiahne ručne ladené produkčné nasadenie. Skutočný verdikt príde, keď sa tieto stojany dostanú na úroveň hyperscalerov.
Záverečné myšlienky
Helios je najkompletnejší systém, aký kedy spoločnosť AMD dodala, a prvý, ktorý sa priamo stretáva s NVIDIA v rackovom meradle namiesto čipu po čipe. Hodnotiaca tabuľka ukazuje cestu AMD v oblastiach, ktoré dnes rozhodujú o kapacite AI: o 50 % viac HBM na GPU, parita škálovania s Rubinom, o 50 % väčšia šírka pásma škálovania a podľa vlastného modelovania AMD až o 30 % viac tokenov na dolár. Rovnako dôležité je, ako sa tam dostala: prepínače Tomahawk pre obchodníkov, otvorené štandardy od číselných formátov až po rozvádzač a hostiteľ so socketom, ktorý ponecháva konečnú konfiguráciu v rukách zákazníka. NVIDIA si ponecháva skutočné výhody v prepojení hostiteľa C2C, DPU a jeho softvéri na začiatku, ale po prvýkrát celkový hardvérový argument na papieri zvýhodňuje AMD.
A kupujúci súhlasia. Medzi spoločnosti, ktoré podľa AMD zavádzajú Helios, patria OpenAI, Meta, Anthropic, Microsoft a Oracle, pričom AMD zdôrazňuje, že tieto stojany sú už vo výrobe. V šľapajach spoločnosti NVIDIA je plán teraz každoročnou kadenciou: séria MI500 založená na CDNA 6 príde v roku 2027 s HBM novej generácie plus medeným a optickým prepojením a séria MI600 je už vo vývoji na rok 2028.
Čo ponecháva softvér a po prvýkrát po rokoch nekončíme príbeh AMD GPU touto výhradou. ROCm 7 vyplnil skutočné medzery, ROCm.AI prichádza v auguste s meranými ziskami a kadencia vydávania je teraz pevne stanovená na šesť týždňov. Záleží aj na tom, kto kupuje. Laboratóriá a hyperscaleri, ktoré podpísali tieto zmluvy, navrhujú spoločne s AMD a zamestnávajú dostatok inžinierov na opravu akýchkoľvek problémov, s ktorými sa stretnú. Podniky, ktoré potrebujú komplexné riešenia, sú iný príbeh a tento trh zatiaľ zostáva pre NVIDIA. Helios bol však vytvorený pre hyperscalery a laboratóriá umelej inteligencie a pre nich je hardvér pripravený, softvér drží krok a racky sa dodávajú. AMD nikdy nebola v silnejšej pozícii.





Amazonka