Lenovo ThinkSystem SR650 V4 je flexibilní a výkonný 2socketový rackový server o výšce 2U, navržený pro potřeby odvětví, jako jsou cloudové služby, telekomunikace a vysoce výkonné výpočty (HPC). Ať už optimalizujete pro škálovatelné úlohy nebo připravujete své datové centrum na budoucnost pomocí vysoce hustých výpočetních systémů, SR650 V4 nabízí oproti svému předchůdci SR650 V3 smysluplná vylepšení.
Rozdíly mezi Lenovo SR650 V4 a SR650 V3
Procesory
Výkon procesorů představuje jedno z nejvýznamnějších vylepšení SR650 V4. Zatímco SR650 V3 se spoléhal na škálovatelné procesory Intel Xeon 4. generace, SR650 V4 představuje platformu Intel Xeon 6 (dříve s kódovým označením „Granite Rapids“). Naše recenze se zaměřuje na architekturu P-core (Performance-core), která je navržena speciálně pro výpočetně náročné úlohy. V4 podporuje jeden nebo dva procesory s až 86 P-jádry na socket (až 172 vláken), což poskytuje vyšší rychlosti jader (až 4 GHz) a TDP až 350 W.
Tento přechod umožňuje organizacím zpracovávat náročnější aplikace na server a snižuje jejich fyzickou zátěž. Architektura vytváří robustní základ pro virtualizaci a náročné databázové operace. Architektura V4 navíc podporuje masivní šířku pásma PCIe s až 88 linkami PCIe 5.0 na procesor, což je nezbytné pro napájení moderních vysokorychlostních síťových adaptérů a úložných polí NVMe bez úzkých hrdel.
| Model CPU | Jádra / vlákna | Base Freq | Max Turbo | L3 Cache | TDP |
|---|---|---|---|---|---|
| 6787P | 86 / 172 | 2.0 GHz | 3.8 GHz | 336 MB | 350 W |
| 6781P | 80 / 160 | 2.0 GHz | 3.8 GHz | 336 MB | 350 W |
| 6767P | 64 / 128 | 2.4 GHz | 3.9 GHz | 336 MB | 350 W |
| 6761P | 64 / 128 | 2.5 GHz | 3.9 GHz | 336 MB | 350 W |
| 6760P | 64 / 128 | 2.2 GHz | 3.8 GHz | 320 MB | 330 W |
| 6747P | 48 / 96 | 2.7 GHz | 3.9 GHz | 288 MB | 330 W |
| 6745P | 32 / 64 | 3.1 GHz | 4.3 GHz | 336 MB | 300 W |
| 6741P | 48 / 96 | 2.5 GHz | 3.8 GHz | 288 MB | 300 W |
| 6740P | 48 / 96 | 2.1 GHz | 3.8 GHz | 288 MB | 270 W |
| 6737P | 32 / 64 | 2.9 GHz | 4.0 GHz | 144 MB | 270 W |
| 6736P | 36 / 72 | 2.0 GHz | 4.1 GHz | 144 MB | 205 W |
| 6732P | 32 / 64 | 3.8 GHz | 4.3 GHz | 144 MB | 350 W |
| 6731P | 32 / 64 | 2.5 GHz | 4.1 GHz | 144 MB | 245 W |
| 6730P | 32 / 64 | 2.5 GHz | 3.8 GHz | 288 MB | 250 W |
| 6724P | 16 / 32 | 3.6 GHz | 4.3 GHz | 72 MB | 210 W |
| 6714P | 8 / 16 | 4.0 GHz | 4.3 GHz | 48 MB | 165 W |
| 6530P | 32 / 64 | 2.3 GHz | 4.1 GHz | 144 MB | 225 W |
| 6527P | 24 / 48 | 3.0 GHz | 4.2 GHz | 144 MB | 255 W |
| 6521P | 24 / 48 | 2.6 GHz | 4.1 GHz | 144 MB | 225 W |
| 6520P | 24 / 48 | 2.4 GHz | 4.0 GHz | 144 MB | 210 W |
| 6517P | 16 / 32 | 3.2 GHz | 4.2 GHz | 72 MB | 190 W |
| 6515P | 16 / 32 | 2.3 GHz | 3.8 GHz | 72 MB | 150 W |
| 6511P | 16 / 32 | 2.3 GHz | 4.2 GHz | 72 MB | 150 W |
| 6507P | 8 / 16 | 3.5 GHz | 4.3 GHz | 48 MB | 150 W |
| 6505P | 12 / 24 | 2.2 GHz | 4.1 GHz | 48 MB | 150 W |
Memory
Pokud jde o paměť, SR650 V4 výrazně vylepšuje možnosti V3 a maximalizuje výkon subsystému. Podporuje paměti DDR5 s rychlostí až 6400 MHz (1 DIMM na kanál), což je podstatný skok oproti limitu 4800 MHz u předchozí generace. Systém je vybaven 32 sloty DIMM (16 na procesor) uspořádanými v osmi paměťových kanálech na procesor. Podporuje standardní RDIMM, 3DS RDIMM a nové Multiplexed Rank DIMM (MRDIMM), které mohou pracovat rychlostí až 8000 MHz pro aplikace náročné na šířku pásma. S 256GB 3DS RDIMM server podporuje masivních 8 TB celkové systémové paměti.
V4 dále zavádí podporu pro rozšíření paměti CXL 2.0 (Compute Express Link). Administrátoři mohou do pozic pro disky E3.S (konkrétně do formátu E3.S 2T) nainstalovat až 12 paměťových modulů CXL. To umožňuje systému škálovat kapacitu paměti a šířku pásma nad rámec tradičních limitů připojených k procesoru, čímž se snižuje výpočetní latence pro úlohy nové generace a snižují se celkové náklady na vlastnictví (TCO) díky menšímu množství paměti.
Skladování
Úložné kapacity Lenovo SR650 V4 demonstrují posun směrem k vysoce výkonným NVMe diskům s vysokou hustotou a flexibilním tvarovým faktorům. V4 sice podporuje starší 3.5palcové a 2.5palcové disky, ale zároveň zavádí masivní podporu pro tvarový faktor E3.S NVMe. Systém pojme až 32 disků E3.S 1T nebo 12 disků E3.S 2T, což ve srovnání s tradičními SSD disky U.2 přináší vyšší hustotu a lepší tepelný management.
Důležité je, že V4 podporuje přímou konektivitu NVMe bez nadměrného množství požadavků (1:1), což zajišťuje, že vysokorychlostní úložiště není omezeno sdílením linek PCIe. Možnosti zavádění M.2 hot-swap disků dále zvyšují servisovatelnost.
networking
Pro síťové funkce je SR650 V4 vybaven dvěma vyhrazenými sloty OCP 3.0, oba s podporou PCIe Gen 5 x16. Jedná se o klíčové vylepšení, které umožňuje redundantní, vysokorychlostní síťové připojení (např. dvouportové 200GbE nebo jednoportové 400GbE) bez spotřeby standardních slotů pro rozšiřující karty PCIe. Přechod na PCIe 5.0 zdvojnásobuje teoretickou šířku pásma (32 GT/s oproti 16 GT/s), takže V4 je schopen zvládat i nejnáročnější cloudový a AI síťový provoz.
Napájení a chlazení
SR650 V4 nabízí vylepšené možnosti napájení v rozmezí od 800 W do 3200 W, dostupné v úrovních účinnosti Titanium a Platinum. Systém také podporuje možnosti -48 V DC a HVAC/HVDC pro splnění specifických požadavků datových center.
Pro zvládání tepla z procesorů a pamětí s vysokým TDP představuje Lenovo možnosti kapalinového chlazení Neptune. „Compute Complex Neptune Core Module“ využívá kapalinové chlazení s otevřenou smyčkou k odvodu tepla z procesorů, pamětí a regulátorů napětí, které je schopné zachytit více než 80 % tepla ze serverů a výrazně snížit náklady na chlazení datových center.
Celkově vzato, SR650 V4 přináší solidní skok vpřed ve výkonu, hustotě a tepelné účinnosti pro moderní podniková prostředí.
Specifikace Lenovo ThinkSystem SR650 V4
| Specifikace | Detaily |
|---|---|
| Specifikace systému | |
| Form Factor | 2U stojan |
| Procesor | Až 2x Intel Xeon řady 6700/6400 (jádra P); až 86 jader na CPU; TDP až 350 W |
| Memory | 32 slotů DIMM (16 na procesor); podporuje TruDDR5 RDIMM až do 6400 MHz a MRDIMM až do 8000 MHz |
| Rozšíření paměti | Podporuje paměťové moduly CXL 2.0 v provedení E3.S 2T (až 12x DIMM) |
| Maximální paměť | Až 8 TB systémové paměti (s 256GB moduly 3DS RDIMM) |
| Pozice pro diskové jednotky | Přední: Až 24x 2.5″ NVMe/SAS/SATA, 16x 3.5″ SAS/SATA nebo 32x E3.S NVMe Střední: Až 8x 2.5″ s jednoduchou výměnou Zadní: Až 8x 2.5″ nebo 4x 3.5″ hot-swap |
| Řadič úložiště | Až 36 integrovaných portů NVMe (konektivita 1:1); podpora RAID/HBA |
| Síťová rozhraní | Dva sloty OCP 3.0 SFF s hostitelským rozhraním PCIe 5.0 x16 |
| Rozšiřující sloty PCI | Až 10 slotů PCIe 5.0 (vzadu); volitelné přední sloty PCIe |
| Podpora GPU | Až 10x GPU s jednoduchou šířkou nebo 2x GPU s dvojitou šířkou |
| porty | Přední: Externí diagnostický port, volitelný USB a Mini-DP Zadní: 2x USB 3.0, 1x VGA, 1x RJ-45 pro správu, volitelný sériový port |
| Chlazení | Až 6 ventilátorů vyměnitelných za provozu (redundance N+1); Volitelné moduly kapalinového chlazení Neptune |
| napájení | Až dva redundantní zdroje AC/DC s možností výměny za provozu (800 W–3 200 W) |
| Správa systémů | Ovladač XClarity 3 (XCC3); volitelný XCC3 Premier |
| Funkce zabezpečení | TPM 2.0, PFR Root of Trust (NIST SP800-193), detekce vniknutí do šasi, uzamykatelný kryt |
| Operační systémy | Microsoft Windows Server, RHEL, SLES, Ubuntu Server |
| Záruka | 3letá základní záruka (konfigurovatelná) |
| Rozměry | 87 mm (3.4 palce) V x 440 mm (17.3 palce) Š x 800 mm (31.5 palce) H |
| Hmotnost | Maximální hmotnost: 38.8 kg (85.5 liber) |
Návrh a sestavení Lenovo ThinkSystem SR650 V4
Lenovo ThinkSystem SR650 V4 je standardní 2U platforma, která efektivně využívá svůj fyzický objem a vyvažuje hustotu komponent s prouděním vzduchu a snadnou údržbou. Šasi měří na výšku 3.4 cm, na šířku 17.3 cm a do hloubky 31.5 cm s maximální konfigurovanou hmotností 85.5 kg. Tyto rozměry jej řadí do kategorie ostatních 2U podnikových serverů a zároveň poskytují dostatečnou hloubku pro vysoce výkonné procesory, konfigurace s vysokou hustotou paměti a flexibilní úložné propojovací desky.
Zavedený průmyslový design systému Lenovo ThinkSystem je okamžitě rozpoznatelný, s pevnou ocelovou šasi a jasným, funkčním označením. Vnitřní uspořádání je čisté a účelné, s důrazem na přímé proudění vzduchu, modulární zóny komponent a beznástrojový přístup pro běžný servis. Celková konstrukce působí robustně a dobře navrženě, což odráží platformu navrženou spíše pro nepřetržitý provoz v prostředí datových center než pro estetickou přitažlivost.
Přední panel
Přední panel je vysoce konfigurovatelný. Náš testovací systém je vybaven 8pozicovou základní deskou pro 2.5palcové disky, ale šasi lze s minimálním úsilím snadno škálovat na 16 nebo dokonce 24 pozic. Zákazníci si mohou také zvolit 3.5palcové pozice pro vyšší hrubou kapacitu nebo novější varianty základní desky E3.S pro vysoce výkonnou hustotu NVMe. Podpora AnyBay umožňuje koexistenci disků SAS, SATA a NVMe v rámci jedné klece, což poskytuje značnou flexibilitu pro nasazení smíšených úložišť.
Přední panel obsahuje základní ovládací prvky pro obsluhu: tlačítko napájení, tlačítko ID a stavové LED diody indikující stav systému a aktivitu sítě. Výsuvná informační záložka poskytuje rychlý přístup k štítku síťového přístupu XCC a sériovému číslu. Volitelné lokální připojení zahrnuje porty Mini DisplayPort a USB pro přístup k havarijnímu vozíku, což je neocenitelné při řešení problémů v datových centrech s poruchami.
Zadní panel
Zadní strana šasi je navržena pro maximální hustotu I/O. V závislosti na konfiguraci rozšiřujících karet může pojmout až 10 slotů PCIe Gen 5. Začlenění dvou slotů OCP 3.0 uvolňuje standardní rozšiřující karty PCIe pro další rozšiřující karty, jako jsou grafické karty nebo řadiče úložišť.
Kromě rozšiřujících portů se na zadním panelu nachází integrovaný síťový port pro správu BMC, dva porty USB-A a výstup VGA pro přístup k lokální konzoli. Vzadu jsou namontovány dva hot-swap napájecí zdroje, které zajišťují snadnou údržbu bez ovlivnění proudění vzduchu nebo rozložení rozšiřujících modulů.
Interní
Vnitřní uspořádání je čisté a optimalizované pro proudění vzduchu. Po stranách duálních paticí CPU je 32 slotů DIMM, které jsou uspořádány tak, aby zajistily nerušené chlazení zepředu dozadu pomocí šesti vysoce výkonných ventilátorů vyměnitelných za provozu v přední části šasi. Ventilátory jsou zcela beznástrojové a snadno vyměnitelné, přičemž celý zásobník ventilátorů je možné vyjmout bez použití nástrojů. Vyjmutí zásobníku poskytuje nerušený přímý přístup k úložnému prostoru AnyBay, což zjednodušuje servis, upgrady a změny v základní desce.
Kabeláž úložiště je úhledně vedena po stranách šasi, aby se neblokovalo proudění vzduchu k procesorům a pamětím. U konfigurací s kapalinovými chladicími moduly Neptune se vnitřní uspořádání mírně mění, aby se přizpůsobily chladicím smyčkám, ale údržba jádra zůstává vysoká. Modul spouštěcího disku M.2 je namontován na vzduchovém cloně nebo na kleci disku, což umožňuje snadný přístup bez nutnosti demontáže dalších komponent.
Ovladač XClarity 3
SR650 V4 je vybaven novým řídicím systémem XClarity Controller 3 (XCC3). Tento systém pro správu nabízí oproti předchozím generacím výrazné zvýšení výkonu, s rychlejším spouštěním a responzivnějším rozhraním HTML5. Správce zdrojů platformy poskytuje podrobnou telemetrii o stavu napájení a teploty, což pomáhá správcům optimalizovat efektivitu datového centra.
XCC3 podporuje širokou škálu funkcí vzdálené správy, včetně vzdáleného ovládání (KVM), připojení virtuálních médií a aktualizací firmwaru. Rozhraní je intuitivní a poskytuje přehled o stavu systému, aktivních událostech a inventáři hardwaru. Pro automatizaci XCC3 plně podporuje REST API Redfish.
Lenovo ThinkSystem SR650 V4 Performance
Tato část zkoumá výsledky benchmarků z Blenderu, y-cruncheru, vLLM a Phoronixu. Počáteční testování bylo provedeno na systému Lenovo ThinkSystem SR650 V4 vybaveném procesory Intel Xeon 6740P, což nám umožnilo vyhodnotit architekturu P-core platformy zaměřenou na výkon a celkovou propustnost při zatížení omezeném na CPU. V polovině recenze jsme upravili konfiguraci systému, abychom umožnili testování akcelerované GPU. Přechod byl přímočarý, k čemuž přispěla sada pro upgrade GPU od Lenovo, která zahrnuje vysoce výkonné ventilátory, vylepšené chladiče, přepracovaný kryt proudění vzduchu a rozšiřující karty s podporou GPU určené pro podporu akcelerátorů s vyšším výkonem. Instalace nevyžadovala žádné významné změny v šasi a čistě se integrovala do stávajícího rozložení systému.
Po instalaci vylepšených komponent pro chlazení a proudění vzduchu jsme na platformu přidali jednu grafickou kartu NVIDIA L40S. To nám umožnilo rozšířit testování o úlohy akcelerované GPU, jako je vykreslování GPU v Blenderu a benchmarky zaměřené na inferenci, a zároveň zachovat stabilní teplotu a konzistentní chování systému. Modulární povaha upgradu zdůrazňuje flexibilitu SR650 V4 a umožňuje snadný přechod z konfigurace CPU orientované na efektivitu na vyváženou platformu CPU+GPU vhodnou pro smíšené výpočetní úlohy.
Konfigurace Lenovo ThinkSystem SR650 V4:
- CPU: 2x Intel Xeon 6740P
- Paměť: 1TB RAM
- Skladování: 4 x 960GB SSD disky
- GPU: NVIDIA L40S
Blender 4.5
Blender je open-source 3D modelovací aplikace. Tento benchmark byl spuštěn pomocí utility Blender Benchmark. Skóre se měří ve vzorcích za minutu, přičemž vyšší hodnoty znamenají lepší výkon.
V benchmarku Blender CPU poskytuje Lenovo ThinkSystem SR650 V4 solidní renderovací výkon napříč všemi scénami, s 1136.99 vzorky za minutu v režimu Monster, 707.60 v režimu Junkshop a 562.53 v režimu Classroom. Výsledky odrážejí silné vícevláknové škálování z duálních procesorů Intel Xeon 6740P s konzistentním výkonem i s rostoucí složitostí scény.
| CPU Blenderu (vzorky za minutu; vyšší je lepší) | Lenovo ThinkSystem SR650 V4 (2x Intel Xeon 6740P, 1TB RAM) |
|---|---|
| Netvor | 1136.99 |
| Veřejné haraburdí | 707.60 |
| Třída | 562.53 |
V benchmarku Blender CPU no SMT vykazuje SR650 V4 výrazné zvýšení propustnosti renderování, když v režimu Monster dosáhl 4686.40 vzorků za minutu, v režimu Junkshop 2223.96 a v režimu Classroom 2385.98. Výsledky GPU zdůrazňují schopnost systému akcelerovat komplexní renderovací úlohy a dosáhnout podstatně vyšší propustnosti ve srovnání s renderováním pouze s využitím CPU.
| CPU Blenderu (bez SMT) (vzorky za minutu; vyšší je lepší) | Lenovo ThinkSystem SR650 V4 (2x Intel Xeon 6740P, 1TB RAM) |
|---|---|
| Netvor | 4686.40 |
| Veřejné haraburdí | 2223.96 |
| Třída | 2385.98 |
y-cruncher
y-cruncher je vícevláknový, škálovatelný program, který počítá pí a další matematické konstanty na biliony číslic. Od svého uvedení na trh v roce 2009 se stal populární aplikací pro benchmarking a zátěžové testování pro overclockery a hardwarové nadšence.
V testu y-cruncher se Lenovo čistě škáluje s rostoucí velikostí problému, což zdůrazňuje silný vícevláknový výpočetní výkon a šířku pásma paměti platformy. Díky duálním procesorům Intel Xeon 6740P a 1 TB RAM systém dokončí výpočet pí s 1 miliardou číslic za něco málo přes 20 sekund a udržuje si konzistentní efektivitu až do 25 miliard číslic, což trvá 362 sekund. Výsledky ukazují předvídatelné škálování při trvalém zatížení CPU a paměti, díky čemuž je SR650 V4 vhodný pro náročné matematické úlohy a zátěžové testy.
| Y-Cruncher (celkový výpočetní čas) | Lenovo ThinkSystem SR650 V4 (2x Intel Xeon 6740P, 1TB RAM) |
|---|---|
| 1 miliard | 20.715 s |
| 2.5 miliard | 44.412 s |
| 5 miliard | 81.937 s |
| 10 miliard | 152.743 |
| 25 miliard | 362.566 |
vLLM Online Serving LLM Inference Performance
vLLM je nejoblíbenější vysoce výkonný inferenční a obslužný engine pro LLM. Online serving benchmark vLLM je nástroj pro hodnocení výkonu, který měří reálné obslužné schopnosti tohoto inferenčního enginu za souběžných požadavků. Simuluje produkční zátěž odesíláním požadavků na běžící server vLLM s konfigurovatelnými parametry, včetně rychlosti požadavků, délky vstupů/výstupů a počtu souběžných klientů. Benchmark měří klíčové metriky, včetně propustnosti (tokeny za sekundu), doby do prvního tokenu a doby na výstupní token (TPOT), což pomáhá uživatelům pochopit, jak si vLLM vede za různých podmínek zátěže.
Testovali jsme výkon inference napříč komplexní sadou modelů zahrnujících různé architektury, škály parametrů a strategie kvantizace a vyhodnotili jsme propustnost za různých profilů souběžnosti.
Výkon hustého modelu
Husté modely se řídí konvenční architekturou LLM, ve které se všechny parametry a aktivace používají během inference, což má za následek výpočetně náročnější zpracování než jejich řídké protějšky. Pro komplexní vyhodnocení výkonnostních charakteristik napříč škálami modelu a kvantizačními strategiemi jsme porovnali několik konfigurací hustých modelů z rodiny Llama 3.1 8B.
Lama 3.1 8B Precision FP8
Model Llama 3.1 8B běžící v režimu FP8 Precision vykazuje odlišný profil škálování než konfigurace se standardní přesností, přičemž upřednostňuje efektivitu při středních úrovních souběžnosti a zároveň obchoduje s propustností mimo špičku při vyšších velikostech dávek. Při souběžnosti jednoho uživatele (BS=1) model poskytuje 67.8 tok/s na uživatele s celkovou propustností 135.6 tok/s a TPOT přibližně 3.1 ms, což představuje nižší základní hodnotu pro jeden stream ve srovnání s plnou přesností.
S rostoucí velikostí dávky se celková propustnost rychle škáluje, zatímco propustnost na uživatele kontrolovaným způsobem klesá. Při BS=2 se propustnost zvyšuje na celkem 271 toků/s, což představuje 66.8 toků/s na uživatele. Při BS=4 dosahuje celková propustnost 523 toků/s a při BS=8 model poskytuje 1 017 toků/s, což představuje 63.6 toků/s na uživatele. Latence zůstává stabilní i přes tyto nižší úrovně souběžnosti, díky čemuž je FP8 vhodný pro nenáročné scénáře víceuživatelské inference.
Škálování pokračuje až do BS=16, kde model udržuje celkovou propustnost 1 918 tok/s s 60.0 tok/s na uživatele. Při BS=32 se celková propustnost ustálí na přibližně 1 920 tok/s, přičemž propustnost na uživatele klesá na 30.0 tok/s. Tato hodnota naznačuje, že konfigurace FP8 dosahuje bodu saturace dříve než standardní přesnost, což upřednostňuje efektivitu a předvídatelnost před maximální agregovanou propustností.
Celkově FP8 dosahuje zhruba 14násobného nárůstu celkové propustnosti z BS=1 na vrchol BS=16-32. Latence zůstává konzistentní až do BS=16, poté se při vyšší souběžnosti zplošťuje spolu s propustností, což zdůrazňuje FP8 jako praktickou volbu pro vyvážené, na latenci citlivé inferenční úlohy spíše než pro extrémní dávkové škálování.
Lama 3.1 8B Standardní přesnost
Při standardní přesnosti model Llama 3.1 8B vykazuje předvídatelné chování škálování na nižších úrovních souběžnosti, se silným výkonem na uživatele při malých velikostech dávek a stabilně rostoucí agregovanou propustností s rostoucí souběžností. V provozu s jedním uživatelem (BS=1) model poskytuje přibližně 45.8 tok/s na uživatele, což vede k celkové propustnosti 91.6 tok/s a vytváří solidní základ pro úlohy citlivé na latenci.
S rostoucí souběžností se celková propustnost efektivně škáluje, zatímco propustnost na uživatele postupně klesá. Při BS=2 se celková propustnost zvýší na 176 tok/s, což představuje 44.0 tok/s na uživatele, a při BS=4 dosáhne propustnost 344 tok/s, což představuje 43.0 tok/s na uživatele. Toto chování pokračuje až do BS=8, kde model udržuje celkovou propustnost 672 tok/s, což představuje 42.0 tok/s na uživatele, což naznačuje dobré využití bez výrazného snížení propustnosti na uživatele.
Škálování pokračuje až do BS=16, kde celková propustnost dosahuje vrcholu přibližně 1 280 tok/s, s 40.0 tok/s na uživatele. Při BS=32 zůstává celková propustnost prakticky stabilní na přibližně 1 280 tok/s, zatímco propustnost na uživatele klesá na 20.0 tok/s, což signalizuje nasycení prováděcího kanálu. Tato plató naznačuje, že při standardní přesnosti model dosahuje svého optimálního provozního bodu kolem BS=16, čímž vyvažuje propustnost a odezvu.
Celkově dosahuje standardní přesnost zhruba 14násobného zvýšení celkové propustnosti z BS=1 na vrchol, se stabilním výkonem na uživatele i při střední úrovni souběžnosti. Díky tomuto profilu je standardní přesnost vhodná pro nasazení, která upřednostňují konzistentní latenci a předvídatelné škálování před agresivním dávkovým rozšiřováním.
Výkon řídkého modelu
Řídké modely, zejména architektury Mixture of Experts (MoE), představují nový přístup k efektivnímu škálování jazykových modelů. Tyto architektury udržují vysoký celkový počet parametrů, ale zároveň aktivují pouze podmnožinu parametrů na token, což potenciálně nabízí lepší výkon na aktivní parametr.
Výkon Qwen3-Coder-30B-A3B FP8
Model Qwen3-Coder-30B-A3B běžící s přesností FP8 vykazuje škálovací profil optimalizovaný pro střední souběžnost, který poskytuje silný výkon na uživatele a zároveň dosahuje saturace dříve než menší modely. V režimu jednoho uživatele (BS=1) dosahuje model přibližně 98 tok/s na uživatele s celkovou propustností 196 tok/s, což představuje vysokou základní hodnotu pro jeden stream, která odráží optimalizaci modelu pro úlohy generování kódu.
S rostoucí souběžností se celková propustnost efektivně škáluje, zatímco propustnost na uživatele kontrolovaným způsobem klesá. Při BS=2 se celková propustnost zvyšuje na 317 tok/s, tj. 79 tok/s na uživatele, a při BS=4 model poskytuje celkovou propustnost 477 tok/s, tj. 59 tok/s na uživatele. Tyto výsledky ukazují efektivní využití dostupných výpočetních zdrojů prostřednictvím nízkého až středního dávkování, bez náhlého snížení odezvy na uživatele.
Model dosahuje své maximální agregované propustnosti při BS=8, přičemž celková propustnost je přibližně 905 tok/s, s 56 tok/s na uživatele. Škálování pokračuje nepatrně až do BS=16, kde se celková propustnost mírně zvyšuje na 920 tok/s, zatímco propustnost na uživatele klesá na 29 tok/s, což naznačuje nasycení inferenčního kanálu. Za tímto bodem poskytuje další souběžnost minimální zisky v celkové propustnosti a zároveň významně ovlivňuje výkon na uživatele.
Celkově Qwen3-Coder-30B-A3B FP8 dosahuje zhruba 4.7× nárůstu celkové propustnosti z BS=1 na vrchol BS=16. Charakteristiky latence a propustnosti naznačují, že tato konfigurace je nejvhodnější pro středně velké úlohy kódování s více uživateli, které vyžadují vysoký výkon na požadavek. Extrémní dávkové škálování však není primárním cílem.
Výkon datových typů s mikroškálováním
Mikroškálování představuje pokročilý kvantizační přístup, který aplikuje jemnozrnné škálovací faktory na malé bloky vah, spíše než rovnoměrnou kvantizaci napříč velkými skupinami parametrů. Formát NVFP4 od společnosti NVIDIA implementuje tuto techniku prostřednictvím blokované reprezentace s plovoucí desetinnou čárkou, kde každý mikroškálový blok s 8–32 hodnotami sdílí typický exponent jako škálovací faktor. Tento granulární přístup zachovává numerickou přesnost a zároveň dosahuje 4bitové reprezentace, čímž se udržuje dynamický rozsah kritický pro transformátorové architektury. Formát se integruje s architekturou Tensor Core od společnosti NVIDIA, což umožňuje efektivní výpočet se smíšenou přesností s dekompresí za chodu během maticových operací.
Výkon GPT-OSS-20b
Model gpt-oss-20b vykazuje silné škálovatelné vlastnosti napříč rostoucími úrovněmi souběžnosti, s obzvláště vysokou agregovanou propustností při větších velikostech dávek. Při souběžnosti jednoho uživatele (BS=1) model poskytuje přibližně 138 tok/s na uživatele, což vede k celkové propustnosti 276 tok/s, což vytváří silnou základnu pro inferenci s jedním proudem.
S rostoucí souběžností se celková propustnost agresivně škáluje, zatímco propustnost na uživatele klesá podle očekávání. Při BS=2 se celková propustnost zvyšuje na 420 tok/s, což představuje 105 tok/s na uživatele, a při BS=4 dosahuje propustnost celkem 690 tok/s, což představuje 86 tok/s na uživatele. Tento stabilní vývoj naznačuje efektivní využití dostupných výpočetních zdrojů prostřednictvím nízkého až středního dávkového zpracování.
Škálování pokračuje až do BS=8, kde model dosahuje celkové propustnosti přibližně 1 120 tok/s při rychlosti 70 tok/s na uživatele, a do BS=16, kde se celková propustnost zvyšuje na 1 900 tok/s s rychlostí 60 tok/s na uživatele. Tyto výsledky ukazují, že gpt-oss-20b si udržuje relativně vysoký výkon na uživatele i při rostoucí souběžnosti, což ho činí vhodným pro scénáře obsluhy více uživatelů.
Model dosahuje své maximální agregované propustnosti při BS=32, což je celková propustnost přibližně 3 250 toků/s, přičemž propustnost na uživatele klesá na 50 toků/s. To představuje 11.8násobné zvýšení celkové propustnosti ve srovnání s výkonem pro jednoho uživatele. I když propustnost na uživatele s vyššími velikostmi dávek nadále klesá, celková efektivita škálování zůstává silná, což naznačuje, že model těží z vyšší souběžnosti, aniž by narazil na časný bod nasycení.
Celkově vzato, gpt-oss-20b vykazuje vyvážený profil škálování, který kombinuje vysoký výkon pro jednoho uživatele se silným dávkovým škálováním. Díky tomu je přesvědčivou volbou pro nasazení, která vyžadují jak responzivní individuální inferenci, tak vysokou agregovanou propustnost při větším zatížení více uživatelů.
Benchmarky Phoronixu
Phoronix Test Suite je open-source automatizovaná benchmarkingová platforma, která podporuje přes 450 testovacích profilů a více než 100 testovacích sad prostřednictvím OpenBenchmarking.org. Zajišťuje vše od instalace závislostí až po spouštění testů a sběr výsledků, takže je ideální pro porovnávání výkonu, validaci hardwaru a průběžnou integraci.
Šířka pásma paměti streamu
SR650 V4 poskytoval paměťovou propustnost 369.6 GB/s, což prokazuje silnou propustnost pro datově náročné úlohy a potvrzuje zdravý výkon vícekanálové paměti.
7-zipová komprese
S 584 499 MIPS systém dosáhl vynikajícího kompresního a dekompresního výkonu, což odráží solidní vícejádrovou efektivitu a silné celočíselné výpočetní schopnosti.
Kompilace jádra
Server dokončil sestavení jádra allmod za 256.175 sekund, což je úctyhodný výsledek, který zdůrazňuje jeho schopnost efektivně zvládat paralelní kompilaci a vývojářské pracovní postupy.
Apache Web Server
S rychlostí 61 654 R/s vykazoval SR650 V4 silný výkon při webovém obsluze a udržoval si vysokou propustnost požadavků vhodnou pro front-end hosting nebo lehké virtualizační stacky.
Ověření OpenSSL
Platforma dosáhla rychlosti 712.6 miliardy bajtů za sekundu a prokázala robustní výkon kryptografického ověřování, což potvrdilo schopnost CPU provádět bezpečné operace s vysokým obsahem certifikátů.
| Benchmarky Phoronixu | Lenovo Think System SR650 V4 |
|---|---|
| Domů | 369,58.3 MB/s |
| 7-ZIP | 584,499 MIPS |
| Kompilace jádra (allmod) | 256.175 sekund |
| Apache (požadavky za sekundu) | 48 729,63 R/s |
| Otevřený SSL | 712 633 776 990 bajtů/s |
Závěr
ThinkSystem SR650 V4 je typem aktualizace platformy, na které záleží, protože se nejedná jen o výměnu CPU. Lenovo využilo tuto generaci k prosazování smysluplných vylepšení v oblastech, které omezují reálné nasazení: šířka pásma paměti, dostupnost linek PCIe, hustota úložiště a schopnost přizpůsobit konfiguraci měnícím se potřebám. Přechod na Intel Xeon 6 přináší více možností jader a větší prostor pro I/O na socket a související platformní práce, včetně rychlejší DDR5 s podporou MRDIMM a volitelného rozšíření CXL, dává SR650 V4 cestu k udržení relevance i v době, kdy se pracovní zátěže stávají náročnějšími na paměť.
Co se týče úložiště, i přes naši omezenou konfiguraci s U.2, kterou jsme recenzovali, nabízí Lenovo vyšší hustotu NVMe s konektivitou 1:1 a čistšími tepelnými charakteristikami, což odpovídá tomu, jak se buduje moderní infrastruktura, zejména pro virtualizační stacky, které vyžadují více lokální flash paměti, a pro pipeliney s umělou inteligencí, kde je napájení GPU stejně důležité jako hrubý výpočetní výkon. Dva sloty OCP 3.0 Gen5 x16 se také jeví jako praktický upgrade: můžete nasadit seriózní síťové připojení, aniž byste obětovali sloty PCIe, které byste raději rezervovali pro akcelerátory, úložiště nebo speciální adaptéry.
Pokud používáte SR650 V3 a cítíte se omezeni rychlostí paměti, kapacitou PCIe nebo hustotou NVMe, SR650 V4 je přesvědčivým krokem vpřed. Zachovává si provozuschopnost a konfigurovatelnost, díky nimž byla řada SR650 populární, a zároveň přidává platformu, která pomáhá IT týmům vyhnout se zahnání do kouta. Ať už budujete virtualizační cluster, modernizujete škálovatelné služby nebo sestavujete vyvážený uzel CPU/GPU, SR650 V4 splňuje všechna důležitá kritéria a ponechává prostor pro to, co přijde později.





Amazon