StorageReview.com

Unternehmens-KI-Bewertungen

Unsere aktuellen KI-Systemtests konzentrieren sich auf Inferenz-Serving im Labor. Dabei werden Open-Weight-Modelle der Familien Llama, Qwen, DeepSeek und gpt-oss über vLLM oder SGLang ausgeführt und hinsichtlich Durchsatz und Latenz des ersten Tokens gemessen. Die Tests reichen vom Edge bis zum vollständigen GPU-Knoten: Die NVIDIA RTX PRO 4500 Server Edition lieferte im Vergleich zum Vorgängermodell L4, das sie ersetzen sollte, in einem HPE ProLiant DL145 Gen11 die durchschnittliche Ausgabemenge an Tokens pro Sekunde – bei einem um etwa 105 W höheren Stromverbrauch. Die Versionen von DGX Spark von Dell, GIGABYTE und HP führten verteilte Inferenz als Zwei-Knoten-Cluster über das 200-GbE-Fabric durch. Im Rahmen von Supermicro JumpStart konnten wir ein System mit NVIDIA HGX B200 und AMD Instinct MI350X praktisch testen. Der Speicher wird gleich behandelt, da der Datenpfad darüber entscheidet, wie stark die GPUs ausgelastet sind. Daher messen wir den GPUDirect Storage-Durchsatz mit GDSIO und testen die KV-Cache-Auslagerung in den Flash-Speicher für Workloads mit langem Kontext und agentenbasierte Anwendungen.

Wenn Sie Hardware für KI dimensionieren, finden Sie auf der Seite „Beste Server“ unsere aktuellen Empfehlungen für KI-Inferenz und Edge Computing auf Basis der Daten aus diesen Tests, auf der Seite „Beste Enterprise SSDs“ die Laufwerke, die die GPUs mit Strom versorgen, und auf der Seite „Beste Speicherarrays“ die KI-Speicherplattformen hinter Trainingsclustern und Neoclouds.

RTX PRO 4500 edge im Test: Draufsicht ins Innere des HPE ProLiant DL145 Gen11 mit der auf dem Riser in voller Höhe installierten RTX PRO 4500 Server Edition und angeschlossenem 16-Pin-Stromkabel.
AI  ◇  Unternehmen

NVIDIA RTX PRO 4500 Edge im Test: 2.7-fache Leistung im Vergleich zu L4 im HPE ProLiant DL145 Gen11

Die NVIDIA RTX PRO 4500 Blackwell Server Edition ist die von NVIDIA primär für den Einsatz als L4-Chip in Servern außerhalb von Rechenzentren entwickelte Karte: Single-Slot, PCIe Gen5, passiv gekühlt, 165 W, 32 GB GDDR7-Speicher und der volle Funktionsumfang der Blackwell-Architektur, einschließlich FP4-Tensor-Kernen und Multi-Instance-GPU. HPE hat uns einen ProLiant DL145 zur Verfügung gestellt.

AI  ◇  Unternehmen

Der tokeneffiziente Weg für Inferenz über lange Kontexte: KV-Cache-Auslagerung in den Flash-Speicher

Die KI-Infrastruktur in Unternehmen hat sich von der Optimierung von Trainingsmodellen hin zu deren Bereitstellung verlagert, was die Wirtschaftlichkeit verändert. Training ist ein Investitionsprojekt mit einem festgelegten Endpunkt. Inferenz hingegen ist eine Produktionslast, die so lange läuft, wie der Dienst verfügbar ist, und deren Output in Token gemessen wird. Dies ist das Tokenomics-Problem, mit dem KI-Betreiber nun konfrontiert sind: Sobald die

AI  ◇  Unternehmen

Wie Metrum AI und die Oregon State University den neuen Standard für akademische Bewertung setzen

Als wir im vergangenen November über die Plankton-Bildgebungsforschung der Oregon State University berichteten, stand die Wissenschaft im Vordergrund: KI-gestützte Infrastruktur an Bord von Forschungsschiffen verarbeitete Terabytes an Ozeandaten nahezu in Echtzeit, noch bevor das Schiff den Hafen erreichte. Doch in den darauffolgenden Wochen geschah im Stillen noch etwas anderes. Auf dem Campus sprach es sich herum, was für ein

Supermicro H14 Server mit AMD Instinct MI350X GPUs, Vorderansicht mit Lüfterwand und NVMe-Laufwerksschächten
AI  ◇  Unternehmen

Supermicro JumpStart Testbericht: H14 mit AMD Instinct MI350X

Supermicros JumpStart-Programm hat sich als eines der nützlichsten Tools im Evaluierungs-Toolkit für KI-Infrastruktur vor dem Kauf etabliert. Anstelle einer vorgefertigten Demo in einer gemeinsam genutzten Umgebung bietet JumpStart qualifizierten Nutzern kostenlosen, zeitlich begrenzten Bare-Metal-Zugriff auf reale Produktionsserver via SSH, IPMI und VNC. So können sie Workloads auf der tatsächlichen Hardware ausführen.