StorageReview.com

AMD Instinct MI355X uppnår MLPerf Inference v6.0-vinster med över 1 miljon tokens per sekund och stöder skalbar ROCm-stack

AI  ◇  Företag

AMD har släppt sina MLPerf Inference v6.0-resultat, som positionerar Instinct MI355X GPU som en skalbar inferensplattform för distributioner med en enda nod, flera noder och heterogena enheter. Resultatet sträcker sig bortom stegvisa vinster genom att lägga till nya arbetsbelastningar, demonstrera ett dataflöde i klusterskala som överstiger 1 miljon tokens per sekund och validera reproducerbarhet över ett växande partnerekosystem.

CDNA 4-arkitekturen riktar sig mot högkapacitetsinferens

Instinct MI355X GPU är baserad på AMD:s CDNA 4- arkitektur byggd på en TSMC 3nm | 6nm FinFET-process (den använder en dubbelprocess-chipletdesign: beräkningskretsarna (XCD) använder TSMC:s 3nm-nod medan I/O-kretsarna använder 6nm), integrerar 185 miljarder transistorer och stöder FP4- och FP6-dataformat. Det är värt att notera att detta gäller hela multichiplet-paketet, inte en monolitisk krets. Varje GPU innehåller upp till 288 GB HBM3E-minne, vilket möjliggör stöd för modeller upp till 520 miljarder parametrar på en enda enhet. AMD positionerar denna kombination av beräkningstäthet och minneskapacitet som avgörande för stormodellinferens utan överdriven modellpartitionering.

Plattformen finns tillgänglig i UBB8-konfigurationer med både luftkylda och direktvätskekylda alternativ, vilket anpassar sig till kraven för datacenterimplementering.

Multinodgenomströmning överstiger 1 miljon tokens per sekund

Ett viktigt resultat från den här rundan är att AMD överträffar 1 miljon tokens per sekund på klusternivå. Med hjälp av Instinct MI355X GPU:er uppnådde AMD denna tröskel på Llama 2 70B i både server- och offline-scenarier, och på GPT-OSS-120B i offline-scenarier.

AMD MLPerf 1M tokens per sekund grafik

Dessa resultat återspeglar en förskjutning mot att utvärdera inferensprestanda på klusternivå snarare än per accelerator. Aggregerad dataflöde och time-to-serv används i allt högre grad för att fastställa produktionsberedskap för storskaliga AI-distributioner.

AMD demonstrerade också effektiv skalning. På Llama 2 70B nådde en konfiguration med 11 noder och 87 GPU:er över 1 miljon tokens per sekund i offline-, server- och interaktiva scenarier, med en skalningseffektivitet från 93 % till 98 %. På GPT-OSS-120B uppnådde ett kluster med 12 noder och 94 GPU:er liknande dataflöde med en skalningseffektivitet på över 90 %. Dessa resultat indikerar att prestandavinster effektivt översätts när distributioner expanderar bortom ett enda system.

Generationsvinster och konkurrenskraftig prestanda för en enda nod

AMD rapporterade en prestandaökning på 3.1 gånger på Llama 2 70B Server jämfört med den tidigare generationen av Instinct MI325X, och nådde 100 282 tokens per sekund. Förbättringen återspeglar både arkitekturförändringar och ROCm-programvaruoptimeringar. Offline-poäng förbättrades med 4.4 gånger och serverpoäng förbättrades med 4.8 gånger jämfört med tidigare omgångar. Dessa vinster tillskrivs främst kvantisering i FP4.

AMD Inferensresultat jämfört med grafik från föregående generation

I jämförelser med enskilda noder visade MI355X konkurrenskraftig positionering gentemot NVIDIAs plattformar. På Llama 2 70B matchade AMD NVIDIA B200 i offline-genomströmning, nådde nästan paritet i serverprestanda och överträffade interaktiv prestanda. Jämfört med Nvidias B300 levererar AMDs GPU 92 % i offline-läge, 93 % i serverläge och överträffar det med 104 % i interaktivt läge.

Förstagångsmodellaktivering utökar täckningen

MLPerf Inference v6.0 innehåller flera nya arbetsbelastningar, och AMD använde denna runda för att demonstrera snabb modellaktivering. GPT-OSS-120B, en expertblandningsmodell, introducerades för första gången och uppnådde konkurrenskraftiga resultat jämfört med NVIDIA-system i både offline- och serverscenarier.

AMD skickade även in resultat för Wan-2.2 text-till-video-generering, vilket markerar deras inträde inom multimodal och generativ videoinferens. Medan den officiella inlämningen fokuserade på Single Stream-latens, var resultaten konkurrenskraftiga med resultaten från befintliga plattformar. Justering efter inlämningen förbättrade prestandan ytterligare, vilket indikerar utrymme för optimering allt eftersom programvaran mognar.

Dessa tillägg belyser AMDs fokus på att expandera bortom traditionella LLM-riktmärken för att stödja nya AI-arbetsbelastningar.

ROCm-programvara möjliggör skalning och heterogen inferens

AMD tillskriver mycket av prestandan och skalbarheten till sin ROCm-programvarustack. Förbättringarna inkluderar optimerad FP4-exekvering, förbättrad GPU-till-GPU-kommunikation för distribuerad inferens och stöd för dynamisk arbetsbelastningsfördelning över heterogena miljöer.

AMD MLPerf inferensresultat instinct mI355x grafik

Den initiala heterogena MLPerf-inlämningen utvecklades med tre AMD Instinct GPU-modeller: MI300X, MI325X och MI355X. Konfigurationen, som skickades in av Dell och MangoBoost, uppnådde 141 521 tokens per sekund på Llama 2 70B Server och 151 843 tokens per sekund på Llama 2 70B Offline.

Värt att notera är att AMD Instinct MI355X-plattformen var placerad i Dells laboratorium i USA, medan Instinct MI300X- och MI325X-plattformarna fanns i Korea. Detta visar förmågan att koordinera system över olika geografiska platser.

Ekosystemtillväxt och reproducerbarhet

AMDs partnerekosystem expanderade i denna MLPerf-runda, med nio företag som lämnade in resultat från flera generationer av Instinct GPU. Deltagande leverantörer inkluderade Cisco, Dell, Giga Computing, HPE, MangoBoost, MiTAC, Oracle, Supermicro och Red Hat.

Partnerbidragen stämde väl överens med AMD:s interna resultat, vanligtvis inom 4 % och i vissa fall inom 1 %. Denna konsekvens indikerar att prestandan är reproducerbar över OEM- och molnplattformar, vilket minskar distributionsrisken och ökar förtroendet för verkliga resultat.

Engagera dig med StorageReview

Nyhetsbrev | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | RSS-flöde

Harold Fritts

Jag har varit i teknikbranschen sedan IBM skapade Selectric. Min bakgrund är dock att skriva. Så jag bestämde mig för att lämna pre-sales-branschen och återvända till mina rötter, skriva lite men fortfarande vara involverad i teknik.