StorageReview.com

MLPerf Inference v5.1: NVIDIA Blackwell Ultra vs. AMD Instinct-plattformar

AI  ◇  Företag

MLPerf Inference v5.1 erbjuder rigorösa riktmärken för AI-inferens för LLM, vision och multimodala uppgifter. Här är den tekniska analysen av NVIDIAs Blackwell Ultra-resultat och AMDs Instinct MI300X/MI325X/MI355X-inlämningar. Den innehåller detaljerade riktmärkesdata, programvaruoptimeringar, arkitekturstrategier och implikationer för hyperskalare och företag.

MLPerf Benchmarking Framework

MLPerf Inference-riktmärken fungerar som resultattavla för AI-acceleratorer och tillhandahåller en standardiserad, äpple-till-äpple-metod för att mäta prestanda inom bildklassificering, språkmodeller och rekommendationssystem. För företag som driftsätter GPU:er i stor skala vägleder dessa siffror ofta omfattande köpbeslut.

MLPerf-inferens styrs av MLCommons och definierar regler för stängd kontra öppen division. Scenarier inkluderar:

  • Off-lineDataflödescentrerad (batchar så många frågor som möjligt).
  • serverLatenskompatibel multiströmsinferens.
  • InteractiveStrikt TTFT (Time-to-First-Token) och TPS (tokens per sekund @ 99:e percentilen).

Arbetsbelastningssviten v5.1 inkluderade:

  • DeepSeek-R1: En 671B-expertmixmodell (stresstest för resonemangs-inferens).
  • Llama-3.1-405B och 8BNyaste LLM:erna över flera inferensmetoder.
  • ViskaASR ersätter RNN-T.
  • Stabil diffusion XL (SD-XL)Text-till-bild-generativ AI.
  • Mixtral, DLRMv2, plus äldre arbetsbelastningar som ResNet-50.

När diagram över dataflöde (tokens/sek eller samples/sek) visas, belyser de vanligtvis NVIDIAs fortsatta dominans i absoluta tal, särskilt per GPU. AMDs framsteg inom relativ effektivitet och skalningsjämnhet visar dock att de minskar gapet varv efter varv, särskilt i serverscenarier och distributioner med flera noder.

NVIDIA Blackwell Ultra-resultat

Blackwell Ultra-system uppnådde rekordhög dataflödeshastighet för alla nya arbetsbelastningar. Viktiga möjliggörare:

  • NVFP4-precision: anpassad 4-bitars flyttal, accelererande DeepSeek och Llama.
  • FP8 KV-cache: minnesbesparingar för uppmärksamhetslager.
  • Disaggregerad servering: delad kontext kontra generationsfaser över 72 GPU:er via 1,800 XNUMX GB/s NVLink.
  • Programvara: CUDA-grafer, TensorRT-LLM, ADP-balans.

Stapeldiagrammet nedan, som jämför Hopper med Blackwell Ultra per GPU, visar en nästan 5× ökning av dataflödet på DeepSeek-R1, vilket validerar att finkorniga dataformat (NVFP4) och rackbred bandbredd skalas linjärt för massiva inferensarbetsbelastningar. En annan figur inramad kring rekordresultaten från interaktiva Llama-405B visar hur NVIDIA använder NVLink-struktur och disaggregerad servering för att bibehålla latens-SLA:er samtidigt som tidigare dataflödesgränser bryts. Slutsatsen: NVIDIA är fortfarande branschledande för ren rå hastighet och latenskänsliga arbetsbelastningar.

Resultat för AMD Instinct MI300X/MI325X/MI355X

AMD riktade in sig på effektivitet och flexibilitet:

  • FP4 på MI355X: levererar 2.7× mer Llama-2-70B-genomströmning jämfört med MI325X FP8.
  • Strukturerad beskärningPå Llama-405B minskade beskärningen med 21–33 % FLOP utan att påverka noggrannheten, vilket ökade genomströmningen med ~82–90 %.
  • Förkalkning Jämn linjär skalning bevisad upp till 8 noder; det första heterogena klustret (4 × MI300X + 2 × MI325X) uppnådde 94 % skalningseffektivitet.
  • Reproducerbarhet av ROCm-ekosystemetPartnerbidrag ligger konsekvent inom 1–3 % av AMD:s egna resultat.

Diagrammet ovan som visar MI325X FP8 jämfört med MI355X FP4 illustrerar banbrytande FP4-fördelar, högre tokens/sekund med minimal noggrannhetsförlust, vilket bevisar att FP4 inte är experimentell utan redo för driftsättning.

Detta diagram över skalningskurvan (1 8 noder) belyser nästan linjär skalning, något som hyperskalare värdesätter eftersom det leder till förutsägbara expansionskostnader. Samtidigt visar schemat för strukturerad beskärning att AMD:s fokus inte bara ligger på hårdvarubaserad brute force utan även på algoritmisk effektivitet, vilket är avgörande för verkliga inferenskluster begränsade av kraft och utrymme.

Jämförelse mellan AMD och NVIDIA

metrisk

NVIDIA Blackwell Ultra

AMD MI355X

Anmärkningar

Vinnare

Tokens/sek per GPU

5842 (DeepSeek-R1)

~2200 (skalad FP4)

Högre NVIDIA råprestanda

NVIDIA

Minne per GPU

192 GB HBM3e

288 GB HBM3e

AMD passar 520B-modellen med en enda GPU

AMD

Precisionsstöd

FP16, FP8, NVFP4

FP16, FP8, FP4

Båda 4-bitars ledningarna

Binda fast

Skalningstyg

72 GPU NVLink

Linjär nodskalning till 8

Olika skalningsstrategier

Binda fast

Sida-vid-sida-visualiseringar betonar avvägningarna.

  • NVIDIA dominerar genomströmningen per GPU, vilket gör den idealisk för AI-fabriker där floptätheten är viktig.
  • AMD, med större minne (288 GB) och FP4-beskärning, lyser där kostnad per token och distributionsflexibilitet är av största vikt.

Industrins konsekvenser

  • HyperscalersNVIDIA är fortfarande det verktyg AI-fabriker väljer som jagar topprestanda. AMD:s växande effektivitetsinnovationer låser dock upp kostnadsoptimerad skalning, vilket är tilltalande för att balansera arbetsbelastningar över olika nivåer.
  • MolnleverantörerFörvänta dig heterogena erbjudanden, högpresterande NVIDIA-nivåer kontra kostnadseffektiva AMD Kubernetes-podar.
  • företagStrukturerad beskärning, FP4 och stöd för heterogena kluster gör det möjligt för AMD att leverera modellinferens på över 405 miljarder dollar till lägre total ägandekostnad. NVIDIAs innovationer (disaggregerad servering och Dynamo) är fortfarande fördelaktiga för latenskänsliga appar (t.ex. LLM-chattrobotar i realtid).
  • FramtidsutsikterFörvänta dig universellt införande av 4-bitarsinferens som baslinje, bredare användning av heterogena GPU-pooler och nya systemdesigner inklusive NVIDIAs Rubin CPX för långa sekvenser och AMDs ROCm-expansion för att täcka fler ramverk.

NVIDIA fortsätter att sätta takten inom rå dataöverföring, med H200-GPU:er som leder inferens i ResNet-50 och BERT över stängda divisionstester. Med det sagt halkar AMDs MI300 inte långt efter, och visar konkurrenskraftiga siffror i server- och offline-scenarier samtidigt som de visar starka vinster i energieffektivitet. Den verkliga historien här är inte bara att NVIDIA ligger kvar i toppen, utan att AMD har minskat gapet avsevärt jämfört med bara en MLPerf-runda sedan. För köpare betyder det att dagarna då man bara tittade på gröna GPU:er kan vara över – ROCm mognar, och MI300 är gångbar i verkliga inferensimplementeringar.

Engagera dig med StorageReview

Nyhetsbrev | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | RSS-flöde

Harold Fritts

Jag har varit i teknikbranschen sedan IBM skapade Selectric. Min bakgrund är dock att skriva. Så jag bestämde mig för att lämna pre-sales-branschen och återvända till mina rötter, skriva lite men fortfarande vara involverad i teknik.