Vid OCP Global Summit 2025 betonade Intel AI-inferens genom att presentera två viktiga framsteg: en ny GPU för datacenter kallad "Crescent Island" och en rackskalig referensdesign för Gaudi 3. Båda utvecklingarna ligger i linje med den växande övergången från modellträning till utbredd inferens i realtid, där faktorer som latens, minnesbandbredd, effektivitet och enkelhet i drift nu är avgörande.
Från statisk träning till genomgripande inferens i realtid
Intels tekniska chef, Sachin Katti, sammanfattade övergången med att notera att i takt med att agentisk AI blir mer utbredd blir inferens kontinuerlig, kontextrik och alltmer systemintensiv. För att hantera de växande tokenvolymerna, komplexa modalitetskombinationerna och strikta SLA-kraven blir en heterogen infrastruktur som kombinerar optimal kisel med en öppen, utvecklarcentrerad programvarustack nödvändig. I denna miljö erbjuder Intels Xe-arkitektur för datacenter-GPU:er den kapacitet och tillförlitlighet som behövs i takt med att sekvenslängder och tokenhastigheter ökar, medan Gaudi 3 stöder ett öppet, skalbart inferensekosystem med förutsägbar total ägandekostnad (TCO).
Den viktigaste slutsatsen är inte bara "snabbare chip". Framgång med inferens hänger på systemintegration: topologimedvetet minne, flexibla sammankopplingar, strömförsörjning och kylning som matchar användningsprofiler, och orkestrering som behandlar modeller, tokens och strömmar som förstklassiga medborgare. Företag vill inte låsa sig in just i det ögonblick de behöver iterera över modeller, ramverk och serverstackar.
Omfattande PC, Edge och datacenter
Intel hävdar att de är unikt positionerade för att leverera heltäckande resurser, med AI-datorer, industriella edge- och datacenterrack baserade på Xeon 6-processorer, Gaudi 3-acceleratorer och Intel GPU:er. De gemensamma nämnarna inkluderar:
- PCIe-flexibilitet i mångfald möjliggör återanvändning av befintliga fotavtryck när det är lämpligt och möjliggör skalning till fabric-centrerade rack vid behov.
- Rackskaliga designer säkerställer förutsägbar prestanda per watt och inkluderar vätskekylningsalternativ när hög densitet och temperaturkrav kräver det.
- En omfattande, integrerad mjukvaruplattform som syftar till att säkerställa sömlös utveckling över olika kiseltyper och distributionsnivåer.
Samarbetet med OCP stöder företagets preferens för öppna, refererbara designer, som är enklare att anskaffa, validera och skala upp i verksamheten.
Crescent Island: En GPU för datacenter anpassad för inferensekonomi
Crescent Island är Intels kommande GPU för datacenter, designad för luftkylda företagsservrar som behöver hög token-genomströmning utan att kräva avancerade ström- eller kyllösningar. Fokus är praktiskt: prioritera kostnadseffektivitet och energiprestanda samtidigt som den levererar den minneskapacitet och bandbredd som är avgörande för moderna inferensuppgifter.
Highlights zählen:,en
- Xe3P-mikroarkitekturen fokuserar på prestanda per watt. Detta överensstämmer väl med stationär inferens, där utnyttjandet är bibehållet och kostnadskänsligheten är hög.
- 160 GB LPDDR5X-minne på kortet. För LLM/RAG-servering, sammanfattningar med lång kontext och multimodala pipelines styr minneskapacitet och bandbredd ofta QPS och svansfördröjning mer än råa TOPS.
- Brett stöd för datatyper, utformat med "tokens-as-a-service"-leverantörer i åtanke. Flexibilitet med blandad precision/kvantisering är avgörande för att pressa dataflödet samtidigt som noggrannheten för produktionsslutpunkter bibehålls.
- Programvaruförberedd via Intels öppna, enhetliga stack. Tidig optimering av Arc Pro B-seriens grafikkort syftar till att effektivisera utvecklarnas arbetsflöden och minimera portningsfriktion.
- Tidslinje: Kundprovtagning för Crescent Island förväntas under andra halvan av 2026. För köpare som planerar uppdateringscykler 2026–2027 ger det ett praktiskt fönster för att testa programvarustacken och modellvisningsmönstren nu.
Crescent Island handlar om inferensekonomi i stor skala. Den är luftkyld, kapacitetsorienterad och prestanda-/W-fokuserad. Anta att dina arbetsbelastningar domineras av token-tung servering med strikta latens-SLO:er. I så fall bör de inbyggda 160 GB och effektiva datatyperna leda till fler samtidiga sessioner per watt och färre klusteröverraskningar allt eftersom sekvenslängderna ökar.
Gaudi 3: Refererbar rackskala för stora modeller och realtidsinferens
Gaudi 3 sträcker sig från PCIe-distributioner till kompletta rackkonfigurationer och erbjuder en skalningsväg utan att tvinga fram en allt-i-ett-arkitektursatsning. Den nya rackskaliga referensdesignen riktar sig till företag som standardiserar stora modellinferenser och latenskritiska realtidssystem.
Nyckelelement:
- PCIe-till-rack-sekvensen börjar med PCIe-kort i befintliga servrar och sträcker sig till rack, beroende på modellstorlekar, samtidighet och SLA-profiler. Denna metod, en vanlig företagsstrategi, hjälper till att minimera projektrisken.
- Stöder upp till 64 acceleratorer per rack med 8.2 TB högbandbreddsminne. Den viktigaste funktionen, minnesdomänen (HBD), möjliggör fler parametrar och längre minneskontexter, vilket resulterar i färre prestandaförluster och mer konsekvent svansfördröjning.
- Vätskekylningsalternativ är viktiga vid acceleratordensiteter där luftkylning ensam begränsar hållbar inferens.
- Orkestrering innebär en öppen programvarustack, såsom Kubernetes, standardmodellservrar och populära ramverk, vilket förenklar integrationen med befintliga MLOps och service-mesh-arkitekturer.
Vid produktionsinferens överträffar faktorer som minnestopologi och konsekvent värmehantering den teoretiska topprestandan. Gaudi 3-racket, som har 8.2 TB HBM fördelat på 64 acceleratorer, tillgodoser praktiska behov som att ladda flera stora varianter, hantera långa prompter och hantera bursts utan att orsaka thrashing. Vätskekylning är inte bara valfritt vid dessa densiteter; det är avgörande för att bibehålla QPS och latens under värmestress.
tidslinje
- MjukvaraIntels enhetliga, öppna programvarustack förbereds på Arc Pro B-seriens grafikprocessorer för att ge utvecklare ett tidigt fönster för optimering och CI/CD-integration.
- Crescent IslandKundurval beräknas för andra halvåret 2026. Planera utvärderingar kring programvaruberedskap, minnesdrivna serverprofiler och begränsningar för luftkylda datacenter.
- Gaudi 3 hyllorReferensdesigner specificerar upp till 64 acceleratorer/rack, 8.2 TB HBM och vätskekylning, och anpassar anläggningar och kraft-/kylhöljen tidigt med era DC/colo-team.




Amazon