Projekt Battlematrix od spoločnosti Intel predstavuje presvedčivú ponuku pre prístupnú infraštruktúru umelej inteligencie a prináša značnú pamäťovú kapacitu grafických procesorov (GPU) do šasi pracovných staníc prostredníctvom dizajnu s viacerými GPU. Táto platforma, postavená na profesionálnom GPU s kódovým označením Battlemage Arc Pro B60, je zameraná na organizácie, ktoré chcú lokálne nasadiť rozsiahle jazykové modely bez nákladov na cloudové predplatné alebo obáv o ochranu súkromia údajov. S až 192 GB VRAM na ôsmich GPU v jednom systéme sa Battlematrix prezentuje ako relatívne nákladovo efektívna alternatíva k iným profesionálnym ekosystémom GPU pre úlohy inferencie umelej inteligencie.
Zobraziť tento príspevok na Instagram
Čo odlišuje Battlematrix od tradičných konfigurácií pracovných staníc, je dizajn karty s dvoma grafickými procesormi od spoločnosti Intel, ktorý umiestňuje dve plnohodnotné grafické karty B60 na jednu dosku plošných spojov vyžadujúcu podporu rozdvojenia PCIe. Tento prístup optimalizovaný na hustotu umožňuje konfigurácie, ktoré by inak vyžadovali základné dosky serverov, zatiaľ čo 24 GB pamäte GDDR6 na grafickú kartu v Arc Pro B60 ju robí obzvlášť vhodnou pre transformátorové modely s vysokou pamäťou. Prvé testovanie odhaľuje sľubný potenciál, hoci optimalizácia softvéru stále zaostáva za schopnosťami hardvéru.
prezradenia
Testovanie sa uskutočnilo s prvými verziami softvéru a ovládačov vrátane vývojových vetiev Intel LLM Scaler. Naša testovacia platforma navyše využíva procesory AMD EPYC namiesto platformy Intel Xeon. Spoločnosť Intel prezentuje Battlematrix ako plne Intel riešenie s procesormi Xeon 6 a produkčné systémy s procesormi Intel môžu vykazovať vyšší výkon, ako naznačujú naše výsledky. Čitatelia by mali tieto výsledky považovať za predbežné s vedomím, že vyspelosť softvéru a optimalizácia platformy by sa mali v priebehu roka 2026 zlepšiť.
Špecifikácie a architektúra
| špecifikácia | detail |
|---|---|
| Zbierka produktov | Grafická karta Intel® Arc™ Pro radu B |
| Kódové meno | Battlemage |
| Architektúra GPU | Xe2 (TSMC N5) |
| xe-farby | 20 |
| Vykresliť rezy | 5 |
| Jednotky sledovania lúčov | 20 |
| Motory XMX | 160 |
| Vektorové motory Xe | 160 |
| Grafické hodiny | 2400 MHz |
| Grafické hodiny (režim LP) | 2000 MHz |
| Výkon grafického procesora FP32 | 12.28 TFLOPS |
| Vrcholové hodnoty GPU (INT8) | 197 |
| Celkový výkon dosky (TBP) | 200 W |
| Memory Masážne stoly | 24 CZ GDDR6 |
| Pamäťové rozhranie | 192-bit |
| Šírka pamäte | 456 GB / s |
| rýchlosť pamäte | 19 Gbps |
| Rozhranie PCIe | PCIe 5.0 x8 |
| Podporované displeje | 4 |
| Grafický výstup | HDMI 2.1 | DP2.1 (UHBR 13.5) | DP2.1 (UHBR 10) |
| Maximálne rozlíšenie (HDMI) | 7680 x 4320 @ 120Hz |
| Maximálne rozlíšenie (DP) | 7680 x 4320 @ 60Hz |
| Variabilná obnovovacia frekvencia HDMI | Áno |
| Adaptívna synchronizácia VESA | Áno |
| Kódovanie/dekódovanie H.264 / H.265 / AV1 | Áno |
| Podpora sledovania lúčov | Áno |
| Podpora oneAPI | Áno |
| Podpora OpenVINO | Áno |
| Podpora Intel IPEX | Áno |
| Podpora Intel XeSS | Áno |
Intel ArcPro B60 zdieľa svoj kremíkový základ s herným dizajnom Intel Arc B580, pričom oba využívajú rovnaký čip vyrobený 5nm procesom spoločnosti TSMC. Tento čip s rozmermi 272 mm² obsahuje 19.6 miliardy tranzistorov a integruje 20 jadier Xe2, pričom sa uvádza, že na jeden grafický procesor poskytuje 12.28 TFLOPS výpočtového výkonu FP32 a 197 TOPS výkonu INT8 AI. Rozhodujúci rozdiel spočíva v konfigurácii pamäte: zatiaľ čo B580 sa dodáva s 12 GB pamäte GDDR6, B60 zdvojnásobuje kapacitu na 24 GB.
Každá grafická karta B60 pracuje na frekvencii 2 400 MHz cez 192-bitové pamäťové rozhranie, čo poskytuje šírku pásma 456 GB/s na jednu grafickú kartu. Architektúra obsahuje 160 enginov umelej inteligencie XMX (Xe Matrix Extensions) na každú grafickú kartu, ktoré sú špeciálne vytvorené na urýchlenie maticových operácií v inferencii umelej inteligencie.
Dizajn s dvojitým grafickým procesorom a rozdvojenie PCIe
Maxsun Arc Pro B60 Dual 48G Turbo je príkladom stratégie hustoty spoločnosti Intel: dve kompletné grafické karty namontované na jednej dvojslotovej karte, nezávisle pripojené cez rozhrania PCIe 5.0 x8. Na rozdiel od tradičných duálnych grafických kariet, ktoré premosťujú čipy a fungujú ako jedna grafická karta, každá grafická karta B60 sa prezentuje ako samostatné zariadenie systému, ktoré vyžaduje podporu základnej dosky pre rozdvojenie PCIe x8/x8. Jeden slot x16 sa elektricky rozdeľuje na dve x8 pripojenia, pričom každá grafická karta dostáva vyhradenú šírku pásma.
PCIe 5.0 x8 poskytuje obojsmernú šírku pásma 128 GB/s na GPU, čo zodpovedá PCIe 4.0 x16. Konfigurácia s dvoma kartami meria dĺžku 300 mm, zaberá dva sloty s chladením typu blower a odoberá celkový výkon 400 W cez jeden konektor 12V-2×6 s výkonom 600 W.
Každá duálna karta poskytuje štyri zobrazovacie výstupy: dva porty DisplayPort 2.1 UHBR20 a dva porty HDMI 2.1a, jeden port na grafickú kartu, čo umožňuje konfigurácie samostatného video výstupu pre virtualizované desktopové prostredia alebo systémy s viacerými používateľmi. Dôležité je poznamenať, že pre každú grafickú kartu je možné naraz použiť iba jeden z dvoch zobrazovacích výstupov.
Zobraziť tento príspevok na Instagram
Konfigurácia Battlematrix s ôsmimi grafickými procesormi
Referenčná špecifikácia Battlematrix od spoločnosti Intel podporuje až osem grafických procesorov Arc Pro B60 v šasi pracovnej stanice, čo sa dosahuje použitím štyroch kariet s dvoma grafickými procesormi. Táto konfigurácia poskytuje:
- Celková systémová pamäť VRAM 192 GB (8 × 24 GB)
- 1 280 XMX AI motorov
- 1,576 INT8 VRCH agregátny výpočet
- 3.6 TB/s kombinovaná šírka pásma pamäte
Platforma vyžaduje základné dosky so štyrmi slotmi PCIe 5.0 x16 s podporou rozdvojenia a špecifikácia Battlematrix bude obsahovať aj procesor Xeon 6; ďalšie informácie o konfigurácii Battlematrix však momentálne nie sú k dispozícii.
Prípady použitia a hodnotová ponuka
Cieľové publikum
Projekt Battlematrix od spoločnosti Intel sa zameriava na tri segmenty trhu: tímy vývojárov umelej inteligencie, ktoré vyžadujú lokálnu infraštruktúru, softvérové inžinierske organizácie implementujúce pracovné postupy s podporou umelej inteligencie s citlivými kódovými základňami a organizácie hľadajúce nákladovo efektívne alternatívy ku cloudovým inferenčným službám. Hlavná hodnotová ponuka platformy sa zameriava na dátovú suverenitu a výhody celkových nákladov na vlastníctvo oproti viacročným cloudovým predplatným.
Vývoj súkromnej umelej inteligencie a agentov
Hlavnou silnou stránkou platformy Battlematrix je podpora vývojových pracovných postupov pre rozsiahle jazykové modely, ktoré vyžadujú rozsiahle kontextové okná a značný počet parametrov.
Vývojové tímy, ktoré budujú agentické systémy, profitujú najmä z dostupnej pamäťovej kapacity. Implementácie agentov RAG zvyčajne udržiavajú viacero komponentov súčasne v pamäti GPU: model základného jazyka, vkladacie modely pre vektorové vyhľadávanie a modely preraďovania. Okrem toho agentické pracovné postupy vykonávajú viackrokové uvažovanie, používanie nástrojov a autokorekciu, čím generujú značné kontextové okná prostredníctvom iterácie. Kódovací agent analyzujúci rozsiahlu kódovú základňu môže počas svojho operačného životného cyklu nahromadiť viac ako 100 000 tokenov.
Budúce VDI a virtualizované hranie
Plán spoločnosti Intel zahŕňa povolenie podpory SR-IOV (Single Root I/O Virtualization) na grafických procesoroch Arc Pro B60, čím sa hardvér premení na grafickú platformu pre viacerých používateľov. SR-IOV umožňuje rozdelenie fyzickej grafickej karty na viacero virtuálnych grafických procesorov, z ktorých každú je možné priradiť k samostatným virtuálnym počítačom s priamym prístupom k hardvéru a izolovanými pamäťovými priestormi.
Táto funkcia odomyká scenáre infraštruktúry virtuálnych desktopov bez licencií, v ktorých jeden systém Battlematrix s ôsmimi grafickými procesormi podporuje desiatky súbežných používateľov s vyhradenou akceleráciou grafického procesora pre CAD aplikácie, strih videa alebo stredne náročné hry. Tradičné riešenia VDI vyžadujú okrem nákladov na hardvér aj vysoké licenčné poplatky, čo často vyžaduje drahšie profesionálne grafické procesory alebo grafické procesory pre dátové centrá. Záväzok spoločnosti Intel k virtualizácii bez licencií eliminuje tieto prevádzkové náklady.
Cena a návrh hodnoty
Spoločnosť Intel oznámila, že cena Arc Pro B60 bude okolo 600 dolárov za GPU. Pre počiatočné testovanie a vývoj ponúkajú konfigurácie s jednou alebo dvoma grafickými kartami (600 až 1 200 dolárov) prístupné vstupné body. Jedna karta s dvoma grafickými kartami a 48 GB VRAM poskytuje dostatočnú kapacitu pre kvantizované modely a pokrýva podstatnú časť populárnych open-source LLM aplikácií.
Testovaná konfigurácia Maxsun Dual Arc Pro B60 Dual 48G Turbo stojí priamo od spoločnosti Maxsun 1 200 dolárov, čo je v súlade s pôvodným oznámením spoločnosti Intel. Nedávne výkyvy cien pamätí však môžu túto cenu ovplyvniť.
Výnimočná hodnota za vstupné ceny
Konfigurácie s jednou a dvoma kartami ponúkajú pre malé tímy, individuálnych vývojárov a domácich laboratórií atraktívne ekonomické výhody. S cenou 600 dolárov za 24 GB pamäte GPU a 1 200 dolárov za 48 GB je táto platforma výrazne lacnejšia ako profesionálne alternatívy s grafickými kartami, ktoré zvyčajne stoja najmenej dvakrát toľko.
Táto hodnotová ponuka je obzvlášť vhodná pre organizácie, ktoré skúmajú integráciu umelej inteligencie bez toho, aby viazali rozsiahle podnikové rozpočty.
Výkonnosť online servingového benchmarku vLLM
vLLM je najpopulárnejší vysokokapacitný inferenčný a obslužný engine pre LLM. Online benchmark vLLM je nástroj na hodnotenie výkonu, ktorý meria reálny výkon obsluhy pri súbežných požiadavkách. Simuluje produkčné pracovné zaťaženie odosielaním požiadaviek na bežiaci server vLLM s konfigurovateľnými parametrami, ako je frekvencia požiadaviek, dĺžka vstupu/výstupu a počet súbežných klientov. Benchmark meria kľúčové metriky vrátane priepustnosti (tokeny za sekundu), času do prvého tokenu (TTFT) a času na výstupný token (TPOT), čo pomáha používateľom pochopiť, ako vLLM funguje pri rôznych podmienkach zaťaženia.
Testovacia platforma:
- Server: Supermicro AS-4125GS-TNRT
- Procesory: AMD EPYC 9374F
- Pamäť: 512 GB Samsung 4800 MT/s DDR5
- GPU: 4x Maxsun MS-Intel ARC Pro B60 Dual 48G Turbo
Podpora a obmedzenia kvantizácie
Tieto GPU by mali vynikať v inferencii s nízkou presnosťou zameranej na kvantizáciu INT4 pre optimálny výkon. Avšak kvôli veľmi ranej vývojovej verzii Intel LLM Scaler, ktorú sme testovali, správne fungovali iba modely GPT OSS, ktoré boli pôvodne trénované s mikroškálovacím formátom MXFP4. Iné kvantizačné formáty, vrátane štandardných INT4, FP8 a AWQ, sa úplne nespustili. Toto obmedzenie výrazne obmedzilo našu schopnosť dôkladne otestovať tieto GPU, hoci očakávame širšiu podporu pre kvantizáciu s vývojom softvérového balíka.
Väčšinu modelov sme testovali s dvoma konfiguráciami: s plnou osemnásobnou grafickou kartou Battlematrix a s minimálnym počtom grafických kariet potrebných na umiestnenie modelu v pamäti. Toto porovnanie odhaľuje zaujímavé charakteristiky škálovania, najmä pokiaľ ide o komunikačnú réžiu pri nižších veľkostiach dávok.
Mikroškálovanie dátových typov
Mikroškálovanie predstavuje pokročilý prístup ku kvantizácii, ktorý aplikuje jemnozrnné škálovacie faktory na malé bloky váh namiesto rovnomernej kvantizácie naprieč veľkými skupinami parametrov. Formát MXFP4 implementuje túto techniku pomocou blokovanej reprezentácie s pohyblivou rádovou čiarkou, kde každý blok mikroskopickej mierky zdieľa spoločný exponent ako škálovací faktor, čím sa zachováva numerická presnosť a zároveň dosahuje 4-bitová presnosť. Kľúčovou výhodou dátového typu MXFP4 je, že kvantizácia modelov na INT4 výrazne neznižuje kvalitu odozvy, na rozdiel od kvantizácie z formátov s vyššou presnosťou, ako je BF16. Modely GPT OSS sa na B60 spúšťajú s kvantizáciou INT4, pretože natívne nepodporujú MXFP4.
OpenAI GPT-OSS 20B
Model parametrov 20B jasne demonštruje fenomén komunikačnej réžie. Pri veľkosti dávky 1 poskytuje jedna grafická karta (GPU) 49.22 tok/s na používateľa v porovnaní s iba 22.83 tok/s pri rozdelení medzi všetkých osem GPU. Konfigurácia s jednou grafickou kartou dosahuje viac ako 2-násobný výkon. Nastavenie s ôsmimi GPU však vyniká vyššou súbežnosťou a dosahuje celkovú priepustnosť 511.99 tok/s pri veľkosti dávky 16.

OpenAI GPT-OSS 120B
Väčší model 120B vyžaduje aspoň 4 GPU, čím sa eliminuje porovnávanie s jedným GPU. Výkon medzi konfiguráciami so štyrmi a ôsmimi GPU sa viac zbližuje, pričom priepustnosť na používateľa je takmer identická pri veľkosti dávky 1 (16.28 taktov/s pre obe). Konfigurácia s ôsmimi GPU poskytuje mierne zisky pri vyšších veľkostiach dávok vďaka paralelizmu dát.
Zmes expertov: Qwen3 Coder 30B-A3B
Riedke architektúry MoE si udržiavajú veľký počet parametrov, pričom počas inferencie aktivujú iba podmnožinu. Qwen3 Coder 30B-A3B aktivuje približne 3 miliardy parametrov na token z celého svojho 30-bitového fondu parametrov, vďaka čomu je obľúbený pre lokálne nasadenie kódovacích asistentov.
Pri testovaní s presnosťou BF16 konfigurácia so štyrmi GPU opäť preukazuje výhody pri nižších veľkostiach dávok. Priepustnosť na používateľa dosahuje 15.34 tok/s s TP=4 oproti 14.15 tok/s s TP=8 pri veľkosti dávky 1.
Husté modely
Husté modely sa riadia konvenčnou architektúrou LLM, kde sa všetky parametre a aktivácie používajú počas inferencie, čo vedie k výpočtovo náročnejšiemu spracovaniu ako ich riedke náprotivky. Bez použitia kvantizácie INT4 počas nášho testovacieho obdobia tieto modely bežali s presnosťou BF16.
Lama 3.1 8B Inštrukt
Kompaktný model 8B sa pohodlne zmestí na jednu grafickú kartu (GPU), ale bol testovaný naprieč konfiguráciami, aby sa charakterizovalo správanie pri škálovaní. Výsledky potvrdzujú tento vzorec: štyri GPU poskytujú celkovú priepustnosť 240.48 takt/s pri veľkosti dávky 8 v porovnaní s 227.90 takt/s s ôsmimi GPU pri rovnakej veľkosti dávky. Priepustnosť na používateľa pri veľkosti dávky 1 zostáva takmer rovnaká (22.37 takt/s oproti 22.83 takt/s).
Mistral Small 3.1 24B Inštrukt
Model Mistral s parametrom 24B predstavuje náročnejšie pracovné zaťaženie. Pri presnosti BF16 dosahuje model silné škálovanie priepustnosti pri vyšších veľkostiach dávok, pričom dosahuje 574.16 taktov/s pri veľkosti dávky 256 na všetkých ôsmich GPU.
Findings
Vo všetkých testovaných modeloch sa objavuje konzistentný vzorec: pri nízkych veľkostiach dávok s našou konfiguráciou 256 vstupno-výstupných tokenov poskytuje použitie minimálneho počtu GPU potrebného na prispôsobenie modelu lepší výkon na používateľa ako rozdelenie medzi všetkých osem GPU . Réžia komunikácie medzi GPU cez PCIe, a to aj pri rýchlostiach PCIe 5.0, zavádza latenciu, ktorá prevyšuje výhody paralelizácie pre scenáre s jedným používateľom alebo nízkou súbežnosťou.
Toto zistenie má praktické dôsledky pre plánovanie nasadenia. Organizácie, ktoré prevádzkujú asistentov kódovania s jedným používateľom alebo pracovné postupy agentov s nízkou súbežnosťou, si môžu vystačiť s menšími konfiguráciami GPU a stále dosiahnuť prijateľný výkon. Plná konfigurácia Battlematrix s ôsmimi GPU je najvýhodnejšia pre dávkové inferenčné úlohy, generovanie syntetických údajov alebo scenáre s vysokou súbežnosťou, kde je celková priepustnosť dôležitejšia ako latencia na požiadavku, najmä pri použití väčších modelov, ktoré vyžadujú viac pamäte.
Skúsenosti s Arc Pro B60s
V obmedzenom testovaní, ktoré sme vykonali, bol celý proces pozoruhodne bezproblémový. Spustenie kariet a ich prevádzka boli jednoduché a nastavenie LLM-Scalera, vývojovej vetvy vLLM s podporou Battlemage, sa ukázalo ako rovnako jednoduché. Softvér je však stále vo veľmi skorom štádiu vývoja. Keď sme začali s testovaním, nedokázali sme získať žiadne štatistiky GPU a okrem tenzorového paralelizmu sme nemali šťastie ani s inými stratégiami paralelizmu, ako je expertný paralelizmus alebo pipeline paralelizmus, na škálovanie naprieč viacerými systémami. Napriek tomu sme tieto obmedzenia očakávali vzhľadom na predbežný stav softvérového balíka.
Chladenie vyvolalo po našom prvom krátkom príspevku na YouTube značnú diskusiu , pričom mnohí komentujúci vyjadrili obavy, že by sa karty mohli na našom otvorenom testovacom počítači prehriať. Keďže nebolo k dispozícii monitorovanie teploty, nakoniec sme karty premiestnili do serverového šasi, aby sme zabezpečili dostatočné prúdenie vzduchu. Pre našu kompletnú recenziu máme v úmysle otestovať výkon chladenia v konfigurácii pracovnej stanice, pretože finálna zostava Battlematrix, ako je znázornené na marketingových renderoch spoločnosti Intel vyššie, umiestňuje tieto karty do šasi pracovnej stanice blízko seba.
Čo sa týka tvaru, tieto karty sú o niečo dlhšie ako štandardné grafické karty pre pracovné stanice, čo môže spôsobiť problémy s kompatibilitou skríň. Bez problémov sa však zmestia do serverových šasi, pretože väčšina serverových skríň poskytuje viac miesta smerom k prednej hrane karty pre podporné konzoly.
Plány budúceho testovania
Po úplnom vydaní a všeobecnej dostupnosti čipov B60 plánujeme znova preskúmať Intel Battlematrix a vykonať rozsiahlejšiu recenziu. Výkon inferencie LLM vyhodnotíme prostredníctvom dodatočného testovania vLLM v širokej škále modelov a konfigurácií nasadenia. Hoci to nie je v tejto ukážke uvedené, pozorovali sme, že tieto grafické procesory (GPU) v ich aktuálnom softvérovom stave dosahujú lepší výkon pri operáciách predbežného napĺňania ako pri dekódovaní. Úplná recenzia sa hlbšie ponorí do inferenčných úloh s vysokou mierou predbežného napĺňania a dekódovania, aby sme toto správanie charakterizovali.
Komunita domácich laboratórií prejavila záujem o použitie týchto GPU pre jednu z najpopulárnejších úloh domácich laboratórií: mediálne servery. Tieto by sme chceli otestovať s Plexom a možno aj Jellyfinom s členmi nášho Discordu . Na našom radare sú aj profesionálne úlohy vrátane SolidWorks a Autodesk na testovanie výkonu CAD. Taktiež plánujeme preskúmať SR-IOV s Proxmoxom na nasadenie viacpoužívateľského VDI servera pre členov Discordu na vyhodnotenie súbežnej hustoty pracovných staníc a cloudového hrania.
Záver
Intel Arc Pro B60 Battlematrix je vzrušujúca platforma, ktorá sprístupňuje vysokokapacitnú pamäť GPU za ceny pracovných staníc. Dizajn karty s dvoma GPU rieši obmedzenia hustoty, alokácia 24 GB na GPU vyhovuje úlohám inferencie LLM a cenová štruktúra vytvára presvedčivé alternatívy k zavedeným profesionálnym ekosystémom GPU. Pre organizácie, ktoré uprednostňujú dátovú suverenitu a nákladovú efektívnosť pred najmodernejším výkonom, si táto platforma zaslúži pozornosť.
Hlavným obmedzením zostáva vyspelosť softvéru. Investície spoločnosti Intel do optimalizácie frameworku prostredníctvom LLM Scaler a neustáleho zdokonaľovania ovládačov naznačujú záväzok udržiavať grafické procesory radu Arc ako značnú hodnotu.
Nie je známe, aká populárna bude konfigurácia Battlematrix s ôsmimi grafickými procesormi v porovnaní s neuveriteľným výkonom, ktorý poskytuje NVIDIA DGX Spark . Skutočným príbehom môžu byť konfigurácie s jednou a dvoma grafickými kartami, kde vstupné body 600 – 1 200 dolárov dramaticky znižujú bariéry pre prieskum súkromnej infraštruktúry umelej inteligencie.
Budeme naďalej rozširovať naše testovanie s pribúdajúcimi aktualizáciami ovládačov a dozrievaním softvérových frameworkov. Ak si ich chcete vyskúšať sami, pripojte sa k nášmu Discord serveru , kde máme komunitný server s obmedzeným prístupom B60.







Amazonka