OpslagReview. com

Lenovo ThinkSystem SR650 V4 Review: Veelzijdig 2U-werkpaard

Enterprise  ◇  Server

De Lenovo ThinkSystem SR650 V4 is een flexibele en krachtige 2-socket, 2U rackserver die is ontworpen om te voldoen aan de behoeften van sectoren zoals cloudservices, telecommunicatie en high-performance computing (HPC). Of u nu optimaliseert voor schaalbare workloads of uw datacenter toekomstbestendig maakt met rekenkracht met hoge dichtheid, de SR650 V4 biedt aanzienlijke verbeteringen ten opzichte van zijn voorganger, de SR650 V3.

Lenovo SR650 V4 Voorkant

Verschillen tussen Lenovo SR650 V4 en SR650 V3

Processoren

De processormogelijkheden vormen een van de belangrijkste upgrades in de SR650 V4. Waar de SR650 V3 gebruikmaakte van Intel Xeon Scalable-processors van de 4e generatie, introduceert de SR650 V4 het Intel Xeon 6-platform (voorheen codenaam "Granite Rapids"). Onze review richt zich op de P-core (Performance-core) architectuur, die specifiek is ontworpen voor rekenintensieve taken. De V4 ondersteunt één of twee processors met maximaal 86 P-cores per socket (tot 172 threads), wat hogere kloksnelheden (tot 4 GHz) en een TDP tot 350 W oplevert.

Deze overgang stelt organisaties in staat om per server veeleisendere applicaties te verwerken, waardoor hun fysieke voetafdruk kleiner wordt. De architectuur creëert een robuuste basis voor virtualisatie en zware databasebewerkingen. Bovendien ondersteunt de V4-architectuur een enorme PCIe-bandbreedte, met maximaal 88 PCIe 5.0-lanes per processor, wat essentieel is voor het probleemloos voeden van moderne, snelle netwerkadapters en NVMe-opslagarrays.

CPU Model Kernen / draden Basisfreq Maximale Turbo L3 Cache TDP
6787P 86 / 172 2.0 GHz 3.8 GHz 336 MB 350w
6781P 80 / 160 2.0 GHz 3.8 GHz 336 MB 350w
6767P 64 / 128 2.4 GHz 3.9 GHz 336 MB 350w
6761P 64 / 128 2.5 GHz 3.9 GHz 336 MB 350w
6760P 64 / 128 2.2 GHz 3.8 GHz 320 MB 330w
6747P 48 / 96 2.7 GHz 3.9 GHz 288 MB 330w
6745P 32 / 64 3.1 GHz 4.3 GHz 336 MB 300w
6741P 48 / 96 2.5 GHz 3.8 GHz 288 MB 300w
6740P 48 / 96 2.1 GHz 3.8 GHz 288 MB 270w
6737P 32 / 64 2.9 GHz 4.0 GHz 144 MB 270w
6736P 36 / 72 2.0 GHz 4.1 GHz 144 MB 205w
6732P 32 / 64 3.8 GHz 4.3 GHz 144 MB 350w
6731P 32 / 64 2.5 GHz 4.1 GHz 144 MB 245w
6730P 32 / 64 2.5 GHz 3.8 GHz 288 MB 250w
6724P 16 / 32 3.6 GHz 4.3 GHz 72 MB 210w
6714P 8 / 16 4.0 GHz 4.3 GHz 48 MB 165w
6530P 32 / 64 2.3 GHz 4.1 GHz 144 MB 225w
6527P 24 / 48 3.0 GHz 4.2 GHz 144 MB 255w
6521P 24 / 48 2.6 GHz 4.1 GHz 144 MB 225w
6520P 24 / 48 2.4 GHz 4.0 GHz 144 MB 210w
6517P 16 / 32 3.2 GHz 4.2 GHz 72 MB 190w
6515P 16 / 32 2.3 GHz 3.8 GHz 72 MB 150w
6511P 16 / 32 2.3 GHz 4.2 GHz 72 MB 150w
6507P 8 / 16 3.5 GHz 4.3 GHz 48 MB 150w
6505P 12 / 24 2.2 GHz 4.1 GHz 48 MB 150w

Geheugen

Wat het geheugen betreft, biedt de SR650 V4 aanzienlijke verbeteringen ten opzichte van de V3, waardoor de prestaties van de subsystemen worden gemaximaliseerd. Het systeem ondersteunt DDR5-geheugensnelheden tot 6400 MHz (1 DIMM per kanaal), een aanzienlijke sprong ten opzichte van de limiet van 4800 MHz van de vorige generatie. Het systeem beschikt over 32 DIMM-slots (16 per processor) verdeeld over acht geheugenkanalen per processor. Het ondersteunt standaard RDIMM's, 3DS RDIMM's en de nieuwe Multiplexed Rank DIMM's (MRDIMM's), die snelheden tot 8000 MHz kunnen halen voor bandbreedte-intensieve toepassingen. Met 256 GB 3DS RDIMM's ondersteunt de server een enorme totale systeemgeheugencapaciteit van 8 TB.

Lenovo SR650 V4 bovenaanzicht achterkant

Bovendien biedt de V4 ondersteuning voor CXL 2.0 (Compute Express Link) geheugenuitbreiding. Beheerders kunnen tot 12 CXL-geheugenmodules installeren in de E3.S-schijfcompartimenten (specifiek de E3.S 2T-vormfactor). Hierdoor kan het systeem de geheugencapaciteit en bandbreedte schalen tot voorbij de traditionele limieten die aan de processor zijn gekoppeld, waardoor de rekenlatentie voor workloads van de volgende generatie wordt verlaagd en de totale eigendomskosten (TCO) dalen doordat er minder geheugen ongebruikt blijft.

Opslag

De opslagmogelijkheden van de Lenovo SR650 V4 laten een verschuiving zien naar een hoge NVMe-dichtheid en flexibele vormfactoren. Naast de ondersteuning voor traditionele 3.5-inch en 2.5-inch schijven, biedt de V4 nu ook uitgebreide ondersteuning voor de E3.S NVMe-vormfactor. Het systeem kan tot 32 E3.S 1TB-schijven of 12 E3.S 2TB-schijven bevatten, wat resulteert in een hogere dichtheid en een betere warmteafvoer in vergelijking met traditionele U.2 SSD's.

Lenovo SR650 V4 front storage

Cruciaal is dat de V4 directe NVMe-connectiviteit ondersteunt zonder overabonnement (1:1), waardoor snelle opslag niet wordt beperkt door het delen van PCIe-lanes. De toevoeging van M.2 hot-swap opstartschijfopties verbetert het onderhoudsgemak verder.

Netwerken

Voor netwerkfunctionaliteit beschikt de SR650 V4 over twee speciale OCP 3.0-slots, die beide PCIe Gen 5 x16 ondersteunen. Dit is een belangrijke upgrade die redundante, snelle netwerkverbindingen mogelijk maakt (bijvoorbeeld dual-port 200GbE of single-port 400GbE) zonder standaard PCIe-riser-slots te gebruiken. De overstap naar PCIe 5.0 verdubbelt de theoretische bandbreedte (32 GT/s versus 16 GT/s), waardoor de V4 de meest veeleisende cloud- en AI-netwerkverkeer aankan.

Achteraanzicht van de Lenovo SR650 V4

Stroom en koeling

De SR650 V4 biedt verbeterde voedingsopties, variërend van 800W tot 3200W, beschikbaar in Titanium- en Platinum-efficiëntieniveaus. Het systeem ondersteunt tevens -48V DC- en HVAC/HVDC-opties om te voldoen aan specifieke eisen van datacenters.

Lenovo SR650 V4 voedingen

Om de warmte van processoren en geheugen met een hoog TDP te beheersen, introduceert Lenovo Neptune-vloeistofkoelingsopties. De "Compute Complex Neptune Core Module" maakt gebruik van open-loop vloeistofkoeling om warmte af te voeren van processoren, geheugen en spanningsregelaars. Deze module kan meer dan 80% van de warmte van de server opvangen en de koelkosten van datacenters aanzienlijk verlagen.

Al met al biedt de SR650 V4 een aanzienlijke verbetering op het gebied van prestaties, compactheid en thermische efficiëntie voor moderne bedrijfsomgevingen.

Lenovo ThinkSystem SR650 V4 Specificaties

Specificaties Details
Systeem Specificaties
Form Factor 2U rek
Gegevensverwerker Tot 2x Intel Xeon 6700/6400-serie (P-cores); tot 86 cores per CPU; tot 350W TDP
Geheugen 32 DIMM-slots (16 per processor); ondersteunt TruDDR5 RDIMM's tot 6400 MHz en MRDIMM's tot 8000 MHz.
Geheugenuitbreiding Ondersteunt CXL 2.0-geheugenmodules in E3.S 2T-vormfactor (tot 12 DIMM's).
Geheugen Maximaal Tot 8 TB systeemgeheugen (met 256 GB 3DS RDIMM's)
Schijfstationsleuven Voor: Tot 24x 2.5″ NVMe/SAS/SATA, 16x 3.5″ SAS/SATA of 32x E3.S NVMe
Mid: Tot 8x 2.5″ eenvoudig te verwisselen
Achter: Tot 8x 2.5″ of 4x 3.5″ hot-swap
Opslagcontroller Tot 36 ingebouwde NVMe-poorten (1:1-connectiviteit); RAID/HBA-ondersteuning
Netwerkinterfaces Twee OCP 3.0 SFF-slots met PCIe 5.0 x16 hostinterface
PCI-uitbreidingsslots Tot 10 PCIe 5.0-slots (achterzijde); optionele PCIe-slots aan de voorzijde.
GPU-ondersteuning Tot 10x GPU's met enkele breedte of 2x GPU's met dubbele breedte
poorten Voor: Externe diagnosepoort, optionele USB en Mini-DP
Achter: 2x USB 3.0, 1x VGA, 1x RJ-45 management, optionele seriële poort
Koelen Tot 6 hot-swap ventilatoren (N+1 redundantie); optionele Neptune vloeistofkoelingsmodules
Laboratoriumvoedingen Tot twee hot-swap redundante AC/DC-voedingen (800W–3200W)
Systems management XClarity Controller 3 (XCC3); Optionele XCC3 Premier
Veiligheids kenmerken TPM 2.0, PFR Root of Trust (NIST SP800-193), chassis-inbraakdetectie, vergrendelbaar frontpaneel
Besturingssystemen Microsoft Windows Server, RHEL, SLES, Ubuntu Server
Garantie 3 jaar basisgarantie (configureerbaar)
Afmetingen 87 mm (3.4 inch) H x 440 mm (17.3 inch) B x 800 mm (31.5 inch) D
Gewicht Maximaal gewicht: 38.8 kg (85.5 lb)

Lenovo ThinkSystem SR650 V4 ontwerp en bouw

De Lenovo ThinkSystem SR650 V4 is een standaard 2U-platform dat de beschikbare ruimte efficiënt benut, waarbij een goede balans wordt gevonden tussen componentdichtheid, luchtstroom en onderhoudsgemak. De behuizing is 3.4 cm hoog, 17.3 cm breed en 31.5 cm diep, met een maximaal geconfigureerd gewicht van 85.5 kg. Deze afmetingen passen perfect bij andere 2U-servers voor zakelijke toepassingen, terwijl de diepte voldoende ruimte biedt voor krachtige CPU's, een hoge geheugencapaciteit en flexibele opslagbackplanes.

Het beproefde ThinkSystem-ontwerp van Lenovo is direct herkenbaar, met een robuust stalen chassis en duidelijke, functionele labels. Intern is de lay-out overzichtelijk en doelgericht, met de nadruk op een rechte luchtstroom, modulaire componentzones en gereedschaploze toegang voor routineonderhoud. De algehele constructie voelt robuust en degelijk aan, wat wijst op een platform dat is ontworpen voor continu gebruik in datacenteromgevingen in plaats van voor esthetische aantrekkingskracht.

Voorpaneel

Het frontpaneel is zeer configureerbaar. Ons testsysteem is uitgerust met een backplane met 8 2.5-inch schijven, maar de behuizing kan met minimale inspanning eenvoudig worden uitgebreid naar 16 of zelfs 24 schijven. Klanten kunnen ook kiezen voor 3.5-inch schijven voor een hogere opslagcapaciteit of de nieuwere E3.S backplane-opties voor een hoge NVMe-dichtheid. AnyBay-ondersteuning maakt het mogelijk om SAS-, SATA- en NVMe-schijven in dezelfde schijfbehuizing te gebruiken, wat aanzienlijke flexibiliteit biedt voor gemengde opslagoplossingen.

Lenovo SR650 V4 front-IO

Het voorpaneel bevat essentiële bedieningselementen: een aan/uit-knop, een ID-knop en status-LED's die de systeemstatus en netwerkactiviteit aangeven. Een uittrekbaar informatiepaneel biedt snelle toegang tot het XCC-netwerktoegangslabel en het serienummer. Optionele lokale connectiviteit omvat een Mini DisplayPort en USB-poorten voor toegang via een crashcart, wat van onschatbare waarde is voor het oplossen van problemen in datacenters waar geen personeel aanwezig is.

Achter paneel

De achterkant van de behuizing is ontworpen voor maximale I/O-dichtheid. Afhankelijk van de riserconfiguratie biedt deze ruimte aan maximaal 10 PCIe Gen 5-slots. De aanwezigheid van twee OCP 3.0-slots maakt de standaard PCIe-risers vrij voor andere uitbreidingskaarten, zoals GPU's of opslagcontrollers.

Naast uitbreidingsmogelijkheden biedt het achterpaneel onderdak aan de ingebouwde BMC-managementnetwerkpoort, twee USB-A-poorten en een VGA-uitgang voor lokale consoletoegang. Aan de achterzijde zijn twee hot-swap voedingen gemonteerd, waardoor onderhoud mogelijk blijft zonder de luchtstroom of uitbreidingsmogelijkheden te belemmeren.

Intern

De interne lay-out is strak en geoptimaliseerd voor luchtstroom. 32 DIMM-slots flankeren de twee CPU-sockets en zijn zo geplaatst dat de koeling van voor naar achter onbelemmerd blijft dankzij een rij van zes krachtige, hot-swap ventilatoren aan de voorkant van de behuizing. De ventilatoren zijn volledig gereedschaploos en eenvoudig te vervangen, en de complete ventilatorlade kan zonder gereedschap worden verwijderd. Door de lade te verwijderen, krijgt u direct toegang tot de AnyBay-opslagruimte, wat onderhoud, upgrades en het wisselen van backplanes vereenvoudigt.

De bekabeling voor de opslagcomponenten is netjes langs de zijkanten van de behuizing geleid om te voorkomen dat de luchtstroom naar de CPU's en het geheugen wordt geblokkeerd. Bij configuraties met Neptune vloeistofkoelingsmodules verandert de interne lay-out enigszins om de koelcircuits te kunnen plaatsen, maar de onderhoudbaarheid van de kern blijft hoog. De M.2 opstartschijfmodule is gemonteerd op de luchtgeleider of schijfkooi, waardoor deze gemakkelijk toegankelijk is zonder andere componenten te hoeven verwijderen.

XClarity-controller 3

De SR650 V4 is voorzien van de nieuwe XClarity Controller 3 (XCC3). Deze beheermodule biedt een aanzienlijke prestatieverbetering ten opzichte van eerdere generaties, met snellere opstarttijden en een responsievere HTML5-interface. De Platform Resource Manager levert gedetailleerde telemetrie over de stroom- en temperatuurstatus, waardoor beheerders de efficiëntie van het datacenter kunnen optimaliseren.

XCC3 ondersteunt een breed scala aan functies voor beheer op afstand, waaronder afstandsbediening (KVM), virtuele media-montage en firmware-updates. De interface is intuïtief en biedt een dashboardweergave van de systeemstatus, actieve gebeurtenissen en hardware-inventaris. Voor automatisering biedt XCC3 volledige ondersteuning voor Redfish REST API's.

Lenovo ThinkSystem SR650 V4 Prestaties

In dit gedeelte worden benchmarkresultaten van Blender, y-cruncher, vLLM en Phoronix onderzocht. De eerste tests werden uitgevoerd op de Lenovo ThinkSystem SR650 V4, uitgerust met Intel Xeon 6740P-processors. Hierdoor konden we de prestatiegerichte P-core-architectuur en de algehele doorvoer onder CPU-intensieve workloads evalueren. Halverwege de review hebben we de systeemconfiguratie aangepast om GPU-versnelde tests mogelijk te maken. De overgang verliep probleemloos dankzij Lenovo's GPU-upgradekit, die bestaat uit krachtige ventilatoren, verbeterde koelplaten, een herziene luchtstroomkap en GPU-compatibele risers die ontworpen zijn om krachtigere accelerators te ondersteunen. De installatie vereiste geen ingrijpende aanpassingen aan de behuizing en integreerde naadloos met de bestaande systeemindeling.

Met de verbeterde koel- en luchtstroomcomponenten hebben we een enkele NVIDIA L40S GPU aan het platform toegevoegd. Hierdoor konden we de tests uitbreiden met GPU-versnelde workloads zoals Blender GPU-rendering en inferentiegerichte benchmarks, terwijl we stabiele temperaturen en consistent systeemgedrag behielden. Het modulaire karakter van de upgrade benadrukt de flexibiliteit van de SR650 V4, waardoor deze gemakkelijk kan overschakelen van een op efficiëntie gerichte CPU-configuratie naar een gebalanceerd CPU+GPU-platform dat geschikt is voor gemengde rekenworkloads.

Lenovo ThinkSystem SR650 V4 configuratie:

  • CPU: 2x Intel Xeon 6740P
  • Geheugen: 1 TB RAM-geheugen
  • Opslag: 4 x 960GB SSD's
  • GPU: NVIDIA L40S

Blender 4.5

Blender is een open-source 3D-modelleringsapplicatie. Deze benchmark is uitgevoerd met behulp van de Blender Benchmark-tool. De score wordt gemeten in samples per minuut, waarbij hogere waarden betere prestaties aangeven.

In de Blender CPU-benchmark levert de Lenovo ThinkSystem SR650 V4 solide renderingprestaties in alle scènes, met een score van 1136.99 samples per minuut in Monster, 707.60 in Junkshop en 562.53 in Classroom. De resultaten tonen de sterke schaalbaarheid van multithreading door de twee Intel Xeon 6740P-processors aan, met consistente prestaties naarmate de complexiteit van de scène toeneemt.

Blender CPU (Samples per minuut; hoe hoger, hoe beter) Lenovo ThinkSystem SR650 V4 (2x Intel Xeon 6740P, 1TB RAM)
Monster 1136.99
Junkshop 707.60
Klas 562.53

In de Blender CPU no SMT-benchmark laat de SR650 V4 een aanzienlijke verbetering zien in de renderingdoorvoer, met 4686.40 samples per minuut in Monster, 2223.96 in Junkshop en 2385.98 in Classroom. De GPU-resultaten benadrukken het vermogen van het systeem om complexe renderingtaken te versnellen, met een aanzienlijk hogere doorvoer in vergelijking met rendering op alleen de CPU.

Blender CPU (geen SMT) (Samples per minuut; hoger is beter) Lenovo ThinkSystem SR650 V4 (2x Intel Xeon 6740P, 1TB RAM)
Monster 4686.40
Junkshop 2223.96
Klas 2385.98

y-cruncher

Y-Cruncher is een multithreaded, schaalbaar programma dat Pi en andere wiskundige constanten tot triljoenen decimalen berekent. Sinds de lancering in 2009 is het een populaire benchmark- en stresstesttoepassing geworden voor overklokkers en hardwareliefhebbers.

In de y-cruncher-test schaalt de Lenovo soepel mee met de toenemende probleemgrootte, wat de sterke multithreaded rekenkracht en geheugenbandbreedte van het platform benadrukt. Met twee Intel Xeon 6740P-processors en 1 TB RAM voltooit het systeem een ​​Pi-berekening met 1 miljard cijfers in iets meer dan 20 seconden en behoudt het een consistente efficiëntie tot 25 miljard cijfers, waarbij het 362 seconden duurt. De resultaten tonen voorspelbare schaalbaarheid onder aanhoudende CPU- en geheugenbelasting, waardoor de SR650 V4 zeer geschikt is voor zware wiskundige taken en stresstests.

Y-Cruncher (totale rekentijd) Lenovo ThinkSystem SR650 V4 (2x Intel Xeon 6740P, 1TB RAM)
1 Miljard 20.715 s
2.5 Miljard 44.412 s
5 Miljard 81.937 s
10 Miljard 152.743
25 Miljard 362.566

vLLM Online Serving LLM Inference Performance

vLLM is de populairste high-throughput inferentie- en serverengine voor LLM's. De vLLM online serverbenchmark is een prestatie-evaluatietool die de real-world servercapaciteiten van deze inferentie-engine meet bij gelijktijdige aanvragen. De benchmark simuleert productieworkloads door aanvragen te versturen naar een actieve vLLM-server met configureerbare parameters, zoals de aanvraagsnelheid, invoer-/uitvoerlengtes en het aantal gelijktijdige clients. De benchmark meet belangrijke statistieken, waaronder doorvoer (tokens per seconde), tijd tot eerste token en tijd per uitvoertoken (TPOT), waardoor gebruikers beter begrijpen hoe vLLM presteert onder verschillende belastingsomstandigheden.

We hebben de inferentieprestaties getest aan de hand van een uitgebreide reeks modellen met verschillende architecturen, parameterschalen en kwantiseringsstrategieën, en de doorvoer geëvalueerd onder verschillende gelijktijdigheidsprofielen.

Dichte modelprestaties

Dichte modellen volgen de conventionele LLM-architectuur, waarbij alle parameters en activaties tijdens de inferentie worden gebruikt. Dit resulteert in een rekenintensievere verwerking dan bij hun spaarzame tegenhangers. Om de prestatiekarakteristieken over verschillende modelschalen en kwantiseringsstrategieën uitgebreid te evalueren, hebben we meerdere configuraties van dichte modellen uit de Llama 3.1 8B-familie getest.

Llama 3.1 8B Precision FP8

Het Llama 3.1 8B-model dat in FP8-precisie draait, vertoont een ander schaalprofiel dan de configuratie met standaardprecisie. Het model geeft prioriteit aan efficiëntie bij een gemiddeld aantal gelijktijdige gebruikers, terwijl de piekdoorvoer bij grotere batchgroottes wordt ingeperkt. Bij een enkele gebruiker (BS=1) levert het model 67.8 tok/s per gebruiker, met een totale doorvoer van 135.6 tok/s en een TPOT van ongeveer 3.1 ms. Dit resulteert in een lagere basislijn voor één enkele stream in vergelijking met volledige precisie.

Naarmate de batchgrootte toeneemt, schaalt de totale doorvoer snel op, terwijl de doorvoer per gebruiker op een gecontroleerde manier afneemt. Bij BS=2 stijgt de totale doorvoer naar 271 tok/s, met 66.8 tok/s per gebruiker. Bij BS=4 bereikt de totale doorvoer 523 tok/s, en bij BS=8 levert het model 1,017 tok/s, met 63.6 tok/s per gebruiker. De latentie blijft stabiel bij deze lagere gelijktijdigheidsniveaus, waardoor FP8 zeer geschikt is voor lichte scenario's met inferentie door meerdere gebruikers.

De schaalvergroting zet zich voort tot BS=16, waar het model een totale doorvoer van 1,918 tok/s handhaaft, met 60.0 tok/s per gebruiker. Bij BS=32 stabiliseert de totale doorvoer zich op ongeveer 1,920 tok/s, waarbij de doorvoer per gebruiker daalt tot 30.0 tok/s. Deze stabilisatie geeft aan dat de FP8-configuratie zijn verzadigingspunt eerder bereikt dan de standaardprecisie, waarbij efficiëntie en voorspelbaarheid de voorkeur krijgen boven maximale totale doorvoer.

Over het geheel genomen behaalt FP8 een ruwweg veertienvoudige toename in totale doorvoer van BS=1 tot zijn piek bij BS=16-32. De latentie blijft constant tot BS=16 en vlakt vervolgens af, samen met de doorvoer bij hogere gelijktijdigheid. Dit benadrukt dat FP8 een praktische keuze is voor evenwichtige, latencygevoelige inferentieworkloads in plaats van extreme batchschaling.

Llama 3.1 8B Standaard Precisie

Bij standaardprecisie vertoont het Llama 3.1 8B-model voorspelbaar schaalgedrag bij lagere gelijktijdigheidsniveaus, met sterke prestaties per gebruiker bij kleine batchgroottes en een gestaag toenemende totale doorvoer naarmate de gelijktijdigheid toeneemt. Bij gebruik door één gebruiker (BS=1) levert het model ongeveer 45.8 tok/s per gebruiker, wat resulteert in een totale doorvoer van 91.6 tok/s en een solide basislijn vormt voor latencygevoelige workloads.

Naarmate het aantal gelijktijdige processen toeneemt, schaalt de totale doorvoer efficiënt mee, terwijl de doorvoer per gebruiker geleidelijk afneemt. Bij BS=2 stijgt de totale doorvoer naar 176 tok/s, met 44.0 tok/s per gebruiker, en bij BS=4 bereikt de doorvoer 344 tok/s, met 43.0 tok/s per gebruiker. Dit gedrag zet zich voort tot BS=8, waar het model een totale doorvoer van 672 tok/s handhaaft, met 42.0 tok/s per gebruiker, wat wijst op een goede benutting zonder significante afname van de doorvoer per gebruiker.

De schaalvergroting zet zich voort tot BS=16, waar de totale doorvoer piekt op ongeveer 1,280 tok/s, met 40.0 tok/s per gebruiker. Bij BS=32 blijft de totale doorvoer vrijwel constant rond de 1,280 tok/s, terwijl de doorvoer per gebruiker daalt tot 20.0 tok/s, wat duidt op verzadiging van de uitvoeringspipeline. Dit plateau suggereert dat het model bij standaardprecisie zijn optimale werkingspunt bereikt rond BS=16, waarbij een balans wordt gevonden tussen doorvoer en responsiviteit.

Over het algemeen behaalt standaardprecisie een ongeveer 14-voudige toename in totale doorvoer van BS=1 tot de piekwaarde, met stabiele prestaties per gebruiker bij een gemiddeld aantal gelijktijdige gebruikers. Dit profiel maakt standaardprecisie zeer geschikt voor implementaties waarbij consistente latentie en voorspelbare schaalbaarheid prioriteit hebben boven agressieve batchuitbreiding.

Sparse Model Prestaties

Sparse modellen, met name Mixture of Experts (MoE)-architecturen, zijn een opkomende aanpak voor het efficiënt schalen van taalmodellen. Deze architecturen behouden een hoog totaal aantal parameters terwijl ze slechts een subset parameters per token activeren, wat potentieel betere prestaties per actieve parameter biedt.

Qwen3-Coder-30B-A3B FP8-prestaties

Het Qwen3-Coder-30B-A3B-model, dat draait op FP8-precisie, vertoont een schaalprofiel dat is geoptimaliseerd voor een gemiddelde gelijktijdigheid. Het levert sterke prestaties per gebruiker en bereikt eerder verzadiging dan kleinere modellen. Bij gebruik door één gebruiker (BS=1) behaalt het model ongeveer 98 tok/s per gebruiker, met een totale doorvoer van 196 tok/s. Dit is een hoge basislijn voor één stream, wat de optimalisatie van het model voor code-generatietaken weerspiegelt.

Naarmate de gelijktijdigheid toeneemt, schaalt de totale doorvoer efficiënt mee, terwijl de doorvoer per gebruiker op gecontroleerde wijze afneemt. Bij BS=2 stijgt de totale doorvoer naar 317 tok/s, met 79 tok/s per gebruiker, en bij BS=4 levert het model een totale doorvoer van 477 tok/s met 59 tok/s per gebruiker. Deze resultaten tonen een effectief gebruik van de beschikbare rekenkracht door middel van batchverwerking met een lage tot gemiddelde capaciteit, zonder abrupte afname van de responsiviteit per gebruiker.

Het model bereikt zijn maximale totale doorvoer bij BS=8, met een totale doorvoer van ongeveer 905 tok/s en 56 tok/s per gebruiker. De schaalbaarheid neemt nog enigszins toe tot BS=16, waar de totale doorvoer licht stijgt naar 920 tok/s, terwijl de doorvoer per gebruiker daalt naar 29 tok/s, wat wijst op verzadiging van de inferentiepipeline. Voorbij dit punt levert extra gelijktijdigheid slechts minimale winst op in de totale doorvoer, terwijl de prestaties per gebruiker aanzienlijk afnemen.

Over het geheel genomen levert Qwen3-Coder-30B-A3B FP8 een toename van de totale doorvoer van ongeveer 4.7 keer, van BS=1 tot de piek bij BS=16. De latentie- en doorvoereigenschappen suggereren dat deze configuratie het meest geschikt is voor gemiddelde codeerworkloads met meerdere gebruikers die hoge prestaties per aanvraag vereisen. Extreme batchschaling is echter niet het primaire doel.

 

Microschaling Datatype Prestaties

Microscaling is een geavanceerde kwantiseringsmethode die fijnmazige schaalfactoren toepast op kleine blokken gewichten in plaats van uniforme kwantisering over grote parametergroepen. NVIDIA's NVFP4-formaat implementeert deze techniek via een geblokte drijvende-kommaweergave, waarbij elk microscale-blok van 8-32 waarden een typische exponent als schaalfactor deelt. Deze granulaire aanpak behoudt de numerieke precisie en zorgt tegelijkertijd voor een 4-bits representatie, waardoor het dynamische bereik behouden blijft dat cruciaal is voor transformer-architecturen. Het formaat integreert met NVIDIA's Tensor Core-architectuur, waardoor efficiënte berekeningen met gemengde precisie mogelijk zijn, inclusief on-the-fly decompressie tijdens matrixbewerkingen.

GPT-OSS-20b Prestaties

Het gpt-oss-20b-model vertoont sterke schaalbaarheidseigenschappen bij toenemende gelijktijdigheidsniveaus, met name een hoge totale doorvoer bij grotere batchgroottes. Bij gelijktijdigheid met één gebruiker (BS=1) levert het model ongeveer 138 tok/s per gebruiker, wat resulteert in een totale doorvoer van 276 tok/s. Dit vormt een sterke basislijn voor inferentie met één datastroom.

Naarmate de gelijktijdigheid toeneemt, schaalt de totale doorvoer sterk mee, terwijl de doorvoer per gebruiker zoals verwacht afneemt. Bij BS=2 stijgt de totale doorvoer naar 420 tok/s, met 105 tok/s per gebruiker, en bij BS=4 bereikt de doorvoer 690 tok/s in totaal, met 86 tok/s per gebruiker. Deze gestage toename duidt op een efficiënt gebruik van de beschikbare rekenkracht door middel van batchverwerking met een lage tot gemiddelde intensiteit.

De schaalbaarheid zet zich voort tot BS=8, waar het model een totale doorvoer van ongeveer 1,120 tok/s behaalt bij 70 tok/s per gebruiker, en tot BS=16, waar de totale doorvoer toeneemt tot 1,900 tok/s, met 60 tok/s per gebruiker. Deze resultaten tonen aan dat gpt-oss-20b relatief hoge prestaties per gebruiker behoudt, zelfs bij een toenemende gelijktijdigheid, waardoor het zeer geschikt is voor scenario's met meerdere gebruikers.

Het model bereikt zijn maximale totale doorvoer bij BS=32, met een totale doorvoer van ongeveer 3,250 tok/s, waarbij de doorvoer per gebruiker daalt tot 50 tok/s. Dit vertegenwoordigt een 11.8-voudige toename van de totale doorvoer ten opzichte van de prestaties bij één gebruiker. Hoewel de doorvoer per gebruiker blijft dalen bij grotere batchgroottes, blijft de algehele schaalbaarheid sterk, wat aangeeft dat het model profiteert van een hogere gelijktijdigheid zonder vroegtijdig een verzadigingspunt te bereiken.

Over het algemeen vertoont gpt-oss-20b een evenwichtig schaalprofiel, waarbij hoge prestaties voor individuele gebruikers worden gecombineerd met sterke schaalbaarheid voor batchverwerking. Dit maakt het een aantrekkelijke optie voor implementaties die zowel responsieve individuele inferentie als een hoge totale doorvoer vereisen onder zwaardere belasting door meerdere gebruikers.

Phoronix-benchmarks

Phoronix Test Suite is een open-source, geautomatiseerd benchmarkplatform dat meer dan 450 testprofielen en meer dan 100 testsuites ondersteunt via OpenBenchmarking.org. Het platform regelt alles, van het installeren van afhankelijkheden tot het uitvoeren van tests en het verzamelen van resultaten, waardoor het ideaal is voor prestatievergelijkingen, hardwarevalidatie en continue integratie.

Streamgeheugenbandbreedte

De SR650 V4 leverde een geheugenbandbreedte van 369.6 GB/s, wat een sterke doorvoersnelheid aantoont voor data-intensieve workloads en de goede prestaties van het multi-channel geheugen bevestigt.

Compressie met 7 ritsen

Met 584,499 MIPS leverde het systeem uitstekende compressie- en decompressieprestaties, wat wijst op een solide efficiëntie van meerdere cores en een sterke capaciteit voor integerberekeningen.

Kernel compileren

De server voltooide de allmod-kernelcompilatie in 256.175 seconden, een respectabel resultaat dat aantoont dat de server parallelle compilatie en ontwikkelworkflows efficiënt kan verwerken.

Apache Web Server

Met 61,654 aanvragen per seconde liet de SR650 V4 sterke prestaties zien voor webservers en kon hij een hoge aanvraagdoorvoer aanhouden, geschikt voor front-end hosting of lichte virtualisatiestacks.

OpenSSL-verificatie

Met een snelheid van 712.6 miljard bytes per seconde demonstreerde het platform robuuste prestaties op het gebied van cryptografische verificatie, waarmee de capaciteit van de CPU voor veilige, certificaatintensieve bewerkingen werd bevestigd.

Phoronix-benchmarks Lenovo Think System SR650 V4
Stroom 369,58.3 MB / s
7-zip 584,499 MIPS
Kernel compileren (allmod) 256.175 seconden
Apache (verzoeken per seconde) 61,654.47 R/s
Open SSL 712,633,776,990 bytes/s

Conclusie

De ThinkSystem SR650 V4 is een platformvernieuwing die er echt toe doet, omdat het niet alleen een CPU-wissel betreft. Lenovo heeft deze generatie gebruikt om aanzienlijke verbeteringen door te voeren op gebieden die de praktijktoepassingen beperken: geheugenbandbreedte, beschikbaarheid van PCIe-lanes, opslagdichtheid en de mogelijkheid om de configuratie aan te passen aan veranderende behoeften. De overstap naar Intel Xeon 6 biedt meer core-opties en meer I/O-capaciteit per socket, en de omliggende platformverbeteringen, waaronder sneller DDR5-geheugen met MRDIMM-ondersteuning en optionele CXL-uitbreiding, zorgen ervoor dat de SR650 V4 relevant blijft naarmate workloads meer geheugen vereisen.

Lenovo SR650 V4 bovenaanzicht (achterkant)

Wat opslag betreft, biedt Lenovo's E3.S-architectuur, ondanks onze beperkte testconfiguratie met U.2, een hogere NVMe-dichtheid met 1:1-connectiviteit en betere thermische eigenschappen. Dit sluit aan bij de manier waarop moderne infrastructuren worden gebouwd, met name voor virtualisatiestacks die meer lokaal flashgeheugen vereisen, en voor AI-gerelateerde pipelines waar de GPU-prestaties net zo belangrijk zijn als de rekenkracht zelf. De twee OCP 3.0 Gen5 x16-slots vormen ook een praktische upgrade: je kunt serieuze netwerkoplossingen implementeren zonder PCIe-slots op te offeren die je liever reserveert voor accelerators, opslag of speciale adapters.

Als u de SR650 V3 gebruikt en merkt dat u wordt beperkt door de geheugensnelheid, de PCIe-capaciteit of de NVMe-dichtheid, dan is de SR650 V4 een aantrekkelijke stap voorwaarts. Het behoudt de onderhoudbaarheid en configureerbaarheid die de SR650-serie zo populair maakten, en biedt tegelijkertijd de nodige flexibiliteit om IT-teams te helpen voorkomen dat ze in een lastig parket terechtkomen. Of u nu een virtualisatiecluster bouwt, schaalbare services moderniseert of een gebalanceerde CPU/GPU-node samenstelt, de SR650 V4 voldoet aan alle belangrijke eisen en biedt ruimte voor toekomstige ontwikkelingen.

Product Page

Neem contact op met StorageReview

Nieuwsbrief | YouTube | Podcast | iTunes / Spotify | Instagram | Twitter | TikTok | RSS-feed

Conor Houser