Dell H975i z serii kontrolerów RAID PERC13 to największy krok naprzód, jaki firma poczyniła w dziedzinie sprzętowego RAID od ponad dekady. Chociaż Dell regularnie wydawał aktualizacje swojej linii PERC, były one w dużej mierze przyrostowe, koncentrując się na dostrajaniu kontrolerów i poprawie przepustowości w miarę rozwoju generacji PCIe. Jednak podstawowa architektura pozostała związana z dziedzictwem SATA i SAS, które przez lata definiowały RAID korporacyjny. PERC H975i zdecydowanie przerywa ten cykl. Zbudowany na linii chipsetów SAS51xx firmy Broadcom, kontroler ten oznacza ostateczne przejście do konstrukcji opartej na pamięci flash i natywnej dla NVMe. Dzięki wyłącznej obsłudze dysków NVMe i wyeliminowaniu obsługi tradycyjnych technologii HDD i SATA, H975i wykorzystuje przyszłościowe podejście do infrastruktury pamięci masowej, zoptymalizowane pod kątem wymagań wysokiej wydajności i niskich opóźnień współczesnych obciążeń intensywnie przetwarzających dane i zorientowanych na sztuczną inteligencję.
Na wynos
- RAID NVMe oparty na technologii Flash: PERC13 H975i całkowicie rezygnuje z interfejsu SAS/SATA i opiera się na interfejsie Broadcom SAS51xx, zapewniając architekturę natywną dla NVMe i przygotowaną na potrzeby sztucznej inteligencji.
- Duży skok pokoleniowy: PCIe Gen5 x16 z maksymalnie 16 dyskami NVMe na kontroler (32 przy dwóch) zapewniło 52.5 GB/s i 12.5 mln IOPS na kontroler podczas testów, ze wzrostem w porównaniu z PERC12, obejmującym wzrost przepustowości odczytu o 88%, wzrost przepustowości zapisu o 318%, wzrost o 31% IOPS odczytu 4K i wzrost o 466% IOPS zapisu 4K.
- Dopasowanie serwera AI: Zintegrowana z przodu konstrukcja uwalnia tylne gniazda PCIe dla procesorów graficznych, skraca czas realizacji MCIO i umożliwia wykorzystanie dedykowanego kanału pamięci masowej na każdy akcelerator, co zapewnia stabilniejszą i bardziej deterministyczną przepustowość bez obciążenia procesora.
- Odporność na stres: Pamięć podręczna chroniona superkondensatorami i szybsza odbudowa skracają czas do zaledwie 10 min/TiB, przy jednoczesnym zachowaniu wysokiej wydajności podczas odbudowy (odczyt do 53.7 GB/s, zapis do 68 GB/s, 17.3 MB/5.33 MB operacji wejścia/wyjścia na sekundę przy 4 kB).
- Kompleksowe bezpieczeństwo: Sprzętowy korzeń zaufania, identyfikacja urządzenia SPDM i pełne szyfrowanie obejmujące dyski, dane w trakcie przesyłania i pamięć podręczną kontrolera.
PERC H975i oferuje niezrównaną wydajność i innowacje architektoniczne. Wykorzystując interfejs hosta PCIe Gen 5 x16 i obsługując do 16 dysków NVMe (32 dyski NVMe na system z dwoma kontrolerami), H975i w naszych testach osiągnął imponującą maksymalną przepustowość 52.5 GB/s i 12.5 mln IOPS na kontroler. Oznacza to prawie dwukrotny wzrost wydajności w każdej kluczowej kategorii w porównaniu z PERC12, który osiągnął 6.9 mln IOPS i przepustowość 27 GB/s. Oprócz czystej wydajności, PERC13 wprowadza mechanizm ochrony pamięci podręcznej oparty na superkondensatorach (zastępujący tradycyjne systemy z podtrzymaniem bateryjnym), zapewniając integralność danych bez obniżania niezawodności operacyjnej. Opierając się na funkcjach bezpieczeństwa swojego poprzednika, H975i rozszerza teraz możliwości szyfrowania w pełnym zakresie, szyfrując dane w pamięci podręcznej i oferując kompleksową ochronę zarówno podczas przesyłania, jak i w spoczynku.
PERC H975i to specjalnie zaprojektowany akcelerator pamięci masowej, zaprojektowany z myślą o sprostaniu bezprecedensowym wymaganiom obliczeniowym obciążeń AI. Oferuje on zarówno wysoką gęstość, jak i wydajność, a także niskie opóźnienia pamięci masowej bez obciążenia procesora. W praktyce połączenie karty RAID PCIe Gen5, która może obsłużyć interfejs x16, z procesorem graficznym Gen5, zapewnia każdemu akceleratorowi własny, dedykowany potok pamięci masowej. Upraszcza to topologię PCIe/NUMA, zapobiegając efektom zaszumionego sąsiedztwa i utrzymując zadania odbudowy lub działania w tle w izolacji od domeny wejścia/wyjścia danego procesora graficznego.
Skalowanie do dwóch kart RAID i dwóch GPU pozwala zachować liniową wydajność, unikając jednocześnie rywalizacji o współdzielone pasma lub pamięci podręczne. Rezultatem jest stabilniejsza przepustowość wejściowa do intensywnego treningu i wnioskowania (duże partie danych, szybkie tasowanie, szybkie odczyty punktów kontrolnych) z gęstszym rozkładem opóźnień pod obciążeniem i podczas odbudowy. Ta architektura nie tylko generuje wyższe wartości szczytowe, ale także sprawia, że przepustowość jest bardziej deterministyczna, co jest dokładnie tym, czego potrzebują serwery AI z wieloma GPU, aby utrzymać wysokie wykorzystanie.
Specyfikacja Dell PERC12 H965i i PERC13 H975i
| Cecha | PERC12 H965i Przód | PERC13 H975i Przód |
|---|---|---|
| Poziomy RAID | 0, 1, 5, 6, 10, 50, 60 | 0, 1, 5, 6, 10, 50, 60 |
| Nie-RAID (JBOD) | Tak | Tak |
| Typ magistrali hosta | PCIe Gen4x16 | PCIe Gen5x16 |
| Zarządzanie wstęgami bocznymi | I2C, PCIe VDM | I2C, PCIe VDM |
| Obudowy na port | Nie dotyczy | Nie dotyczy |
| Procesor / Chipset | Broadcom RAID-on-Chip, SAS4116W | Broadcom RAID-on-Chip, SAS5132W |
| Pakiet energetyczny / Zasilanie rezerwowe | bateria | Superkondensator |
| Bezpieczeństwo lokalnego zarządzania kluczami | Tak | Tak |
| Bezpieczny menedżer kluczy przedsiębiorstwa | Tak | Tak |
| Głębokość kolejki kontrolera | 8,192 | 8,192 |
| Pamięć podręczna nieulotna | Tak | Tak |
| Pamięć podręczna | 8 GB DDR4 3200 MT/s | Zintegrowana pamięć podręczna RAID |
| Funkcje pamięci podręcznej | Zapis wsteczny, odczyt z wyprzedzeniem, zapis z wyprzedzeniem, zawsze zapis wsteczny, brak odczytu z wyprzedzeniem | Zapis wsteczny, zapis przelotowy, zawsze zapis wsteczny, brak odczytu z wyprzedzeniem |
| Maksymalna liczba złożonych dysków wirtualnych | 64 | 16 |
| Maksymalne proste dyski wirtualne | 240 | 64 |
| Maksymalna liczba grup dysków | 64 | 32 |
| Maksymalna liczba dysków wirtualnych na grupę dysków | 16 | 8 |
| Maksymalna liczba urządzeń zapasowych | 64 | 8 |
| Obsługiwane urządzenia z funkcją wymiany na gorąco | Tak | Tak |
| Automatyczna konfiguracja (podstawowa i wykonana jednorazowo) | Tak | Tak |
| Sprzętowy silnik XOR | Tak | Tak |
| Rozszerzenie pojemności online | Tak | Tak |
| Dedykowany i globalny zapasowy akumulator | Tak | Tak |
| Obsługiwane typy napędów | NVMe Gen3 i Gen4 | NVMe Gen3, Gen4 i Gen5 |
| Rozmiar elementu paska VD | 64KB | 64KB |
| Obsługa NVMe PCIe | Gen4 | Gen5 |
| Konfiguracja dysków Max NVMe | 8 napędów na kontroler | 16 napędów na kontroler |
| Obsługiwane rozmiary sektorów | 512B, 512e, 4Kn | 512B, 512e, 4Kn |
| Obsługa rozruchu z pamięci masowej | Tylko UEFI | Tylko UEFI |
Kontroler PERC13 H975i Front w serwerach Dell PowerEdge został zaprojektowany z myślą o bezproblemowej integracji z architekturą systemu. W przeciwieństwie do tradycyjnych kart rozszerzeń, które zajmują tylne gniazda PCIe, kontroler H975i łączy się bezpośrednio z przednią płytą główną napędów i komunikuje się z przednimi złączami MCIO na płycie głównej za pośrednictwem dedykowanych interfejsów PCIe 5.0. Ta zintegrowana konstrukcja pozwala zachować tylne gniazda PCIe dla wydajnych kart graficznych i dodatkowych kart rozszerzeń PCIe, jednocześnie znacznie skracając długość kabli. Pomaga to zachować integralność sygnału, zwiększając niezawodność systemu i ułatwiając jego serwisowanie. Rezultatem jest bardziej przejrzysty układ wewnętrzny i lepszy przepływ powietrza w gęstych, wymagających dużej mocy obliczeniowej środowiskach.
H975i wdraża kompleksową architekturę bezpieczeństwa, obejmującą atestację sprzętową na poziomie krzemu, po pełne szyfrowanie danych za pomocą dysków SED. U podstaw rozwiązania Hardware Root of Trust leży niezmienny łańcuch weryfikacji kryptograficznej, od wewnętrznej pamięci ROM rozruchowej (Internal Boot ROM) po każdy komponent oprogramowania sprzętowego, zapewniając, że na kontrolerze może być uruchamiane wyłącznie uwierzytelnione oprogramowanie sprzętowe certyfikowane przez firmę Dell. To sprzętowe zabezpieczenie obejmuje implementację protokołu SPDM (Security Protocol and Data Model), gdzie każdy kontroler zawiera unikalny certyfikat Device Identity, umożliwiający kontrolerowi iDRAC weryfikację uwierzytelniania w czasie rzeczywistym. Kontroler rozszerza ochronę kryptograficzną poza tradycyjne scenariusze danych w spoczynku, obejmując pamięć podręczną. Przechowuje klucze szyfrujące w bezpiecznych obszarach pamięci, niedostępnych dla nieautoryzowanego oprogramowania sprzętowego. Dzięki temu poufne dane pozostają chronione niezależnie od tego, czy znajdują się na dyskach, czy są aktywnie przetwarzane w pamięci podręcznej.
Ochrona zasilania w modelu H975i to kolejny istotny krok naprzód w stosunku do tradycyjnych systemów zasilanych bateryjnie, dzięki integracji superkondensatora. Superkondensator zapewnia natychmiastowe zasilanie w przypadku nieoczekiwanej utraty zasilania, zapewniając szyfrowane i pełne opróżnienie pamięci podręcznej do pamięci nieulotnej, gdzie dane pozostają chronione bezterminowo. Ponadto, w przeciwieństwie do systemów zasilanych bateryjnie, które wymagają 4-8 godzin na cykle uczenia, superkondensator modelu H975i kończy swój transparentny cykl uczenia w ciągu 5-10 minut bez spadku wydajności podczas kalibracji. Taka konstrukcja eliminuje koszty konserwacji i problemy z degradacją, charakterystyczne dla rozwiązań zasilanych bateryjnie, zapewniając jednocześnie doskonałą niezawodność w ochronie danych o znaczeniu krytycznym.
Zintegrowany monitoring i zarządzanie
Kontrolerem RAID PERC13 firmy Dell, podobnie jak wieloma rozwiązaniami RAID tej firmy, można zarządzać i monitorować go na wiele sposobów, m.in. podczas rozruchu platformy za pośrednictwem konfiguracji systemu w systemie BIOS, za pośrednictwem internetowego interfejsu graficznego kontrolera iDRAC, narzędzia PERC12, a nawet interfejsu użytkownika i wiersza poleceń Dell OpenManage.
Zarządzanie kontrolerem iDRAC
W interfejsie zarządzania iDRAC zakładka „Kontrolery” oferuje przegląd sprzętu pamięci masowej serwera. Obok karty BOSS widoczne są dwa kontrolery PERC H975i wraz z informacjami o wersjach oprogramowania sprzętowego, pamięci podręcznej i stanie baterii. To podsumowanie umożliwia szybką weryfikację gotowości i konfiguracji kontrolerów bez konieczności dostępu do BIOS-u lub korzystania z narzędzi CLI.
Karta Dyski wirtualne w kontrolerze iDRAC wyświetla utworzone macierze pamięci masowej, w tym ich poziom RAID, rozmiar i zasady buforowania. W tym systemie wyświetlane są dwie grupy RAID-10, wszystkie zbudowane na dyskach SSD. W tym widoku administratorzy mogą sprawdzić, czy woluminy są online, utworzyć nowe dyski wirtualne lub użyć menu Akcje, aby dostosować lub usunąć istniejące konfiguracje.
Narzędzie konfiguracji kontrolera RAID
Powyższy obraz przedstawia przykład uruchomienia narzędzia konfiguracji systemu PERC H975i Front Configuration Utility na platformie PowerEdge R7715. Z poziomu tego interfejsu można zarządzać wszystkimi kluczowymi ustawieniami kontrolera RAID, w tym zarządzaniem konfiguracją, zarządzaniem kontrolerami, zarządzaniem urządzeniami i innymi. Narzędzie to zapewnia uproszczony sposób konfigurowania dysków wirtualnych i monitorowania komponentów sprzętowych bezpośrednio podczas rozruchu platformy.
Po wybraniu poziomu RAID przechodzimy do wyboru dysków fizycznych dla macierzy. W tym przykładzie wszystkie dostępne dyski SSD NVMe są wymienione i oznaczone jako obsługujące RAID. Wybieramy kilka dysków Dell DC NVMe o pojemności 3.2 TiB z nieskonfigurowanej puli pojemności. Filtry takie jak typ nośnika, interfejs i rozmiar sektora logicznego pomagają zawęzić wybór. Po zaznaczeniu żądanych dysków możemy kontynuować, klikając „OK”, aby sfinalizować wybór dysku i kontynuować tworzenie dysku wirtualnego.
Przed sfinalizowaniem tworzenia dysku wirtualnego system wyświetla ostrzeżenie z potwierdzeniem, że wszystkie dane na wybranych dyskach fizycznych zostaną trwale usunięte. Aby kontynuować, zaznaczamy pole „Potwierdź” i wybieramy „Tak”, aby autoryzować operację. To zabezpieczenie pomaga zapobiec przypadkowej utracie danych podczas tworzenia macierzy RAID.
Po utworzeniu dysku wirtualnego pojawi się on w menu „Zarządzanie dyskami wirtualnymi”. W tym przykładzie nasz nowy dysk wirtualny RAID 5 ma pojemność 43.656 TiB i status „Gotowy”. Wystarczy kilka prostych kroków, aby skonfigurować pamięć masową i przygotować ją do użycia.
Podczas gdy narzędzie konfiguracji BIOS-u PERC i interfejs iDRAC oferują intuicyjne opcje zarządzania lokalnego i zdalnego, firma Dell udostępnia również potężne narzędzie wiersza poleceń o nazwie PERC CLI (perccli2). Narzędzie to obsługuje systemy Windows, Linux i VMware, dzięki czemu idealnie nadaje się do tworzenia skryptów, automatyzacji lub zarządzania kontrolerami PERC w środowiskach bezobsługowych. Firma Dell udostępnia również szczegółową dokumentację dotyczącą instalacji i używania poleceń PERC CLI na swojej stronie pomocy technicznej.
Testowanie wydajności Dell PERC13
Przed przystąpieniem do testów wydajnościowych przygotowaliśmy nasze środowisko, wykorzystując platformę Dell PowerEdge R7715 skonfigurowaną z dwoma kontrolerami PERC H975i. Zostały one sparowane z trzydziestoma dwoma dyskami Dell NVMe o pojemności 3.2 TB, z których każdy zapewniał prędkość odczytu sekwencyjnego do 12 000 MB/s i zapisu sekwencyjnego do 5,500 MB/s przy blokach o rozmiarze 128 KiB. Ta wydajna baza danych pozwala nam przekroczyć granice przepustowości kontrolera PERC13 i ocenić zachowanie RAID w dużej skali.
- Platforma: Dell PowerEdge R7715
- PROCESOR: Procesor AMD EPYC 9655P 96-rdzeniowy
- Rama: 768 GB (12 x 64 GB) DDR5-5200 ECC
- Kontroler RAID: 2 x PERC13 H975i
- Przechowywanie: 32 dyski Dell CD8P NVMe o pojemności 3.2 TB
- Akceleratory PCIe: 2 x karta graficzna NVIDIA H100
NVIDIA Magnum IO GPU Direct Storage: sztuczna inteligencja spotyka się z pamięcią masową
Nowoczesne potoki AI często są ograniczone operacjami wejścia/wyjścia, a nie obliczeniami. Partie danych, osadzenia i punkty kontrolne muszą być przesyłane z pamięci masowej do pamięci GPU wystarczająco szybko, aby utrzymać akceleratory w ciągłym ruchu. Magnum IO GDS firmy NVIDIA (za pośrednictwem cuFile) omija tradycyjną ścieżkę „dysk SSD → pamięć DRAM procesora → GPU” i umożliwia bezpośrednie przesyłanie danych z pamięci NVMe do pamięci GPU za pomocą DMA. Eliminuje to obciążenie bufora odbić procesora, zmniejsza opóźnienia i zwiększa przewidywalność przepustowości pod obciążeniem, co przekłada się na wyższe wykorzystanie GPU, krótsze czasy epok i szybsze cykle zapisu/ładowania punktów kontrolnych.
Nasz test GDSIO ma na celu zmierzenie samej ścieżki danych od pamięci masowej do GPU, analizując rozmiary bloków i liczbę wątków, aby pokazać, jak szybko zestaw NVMe oparty na PERC13 może przesyłać strumieniowo dane do pamięci H100. Przy każdym H975i podłączonym do łącza PCIe 5.0 x16 (teoretycznie ~64 GB/s na kontroler, jednokierunkowo), dwa kontrolery ustalają łączny limit na poziomie ~112 GB/s; przy czym nasze plateau krzywych wskazuje, czy masz ograniczone łącze, czy nośniki. Dla praktyków, potraktuj wykresy jako przykład rzeczywistych obciążeń: duże sekwencyjne odczyty są odwzorowywane na strumieniowanie zestawu danych i przywracanie punktów kontrolnych; duże sekwencyjne zapisy są odwzorowywane na zapisywanie punktów kontrolnych; mniejsze transfery z współbieżnością odzwierciedlają przetasowania w programie ładującym dane i wstępne pobieranie. Krótko mówiąc, silne skalowanie GDSIO oznacza mniej przestojów GPU i bardziej spójną wydajność zarówno podczas trenowania, jak i wnioskowania o wysokiej przepustowości.
Przepustowość sekwencyjna odczytu GDSIO
Począwszy od odczytu sekwencyjnego, przepustowość początkowo była umiarkowana przy niższych rozmiarach bloków i liczbie wątków, zaczynając od około 0.3 GiB/s przy blokach 8 tys. z jednym wątkiem. Wydajność gwałtownie rosła między blokami 16 tys. a 512 tys., szczególnie po zwiększeniu liczby wątków z 4 do 16. Największe wzrosty wystąpiły przy blokach o rozmiarach 1 mln, 5 mln i 10 mln, gdzie przepustowość gwałtownie wzrosła, osiągając szczyt na poziomie 103 GiB/s przy bloku 10 mln i 256 wątkach. Ta progresja pokazuje, że macierz PERC13 korzysta z większych rozmiarów bloków i paralelizmu wielowątkowego, z optymalnym nasyceniem około 64–128 wątków, po przekroczeniu którego następuje plateau.
Różnica przepustowości sekwencyjnego odczytu GDSIO
W testach sekwencyjnego odczytu bloków o rozmiarach od 8K do 10M, PERC13 (H975i) konsekwentnie przewyższał PERC12 (H965i), a procentowy wzrost wydajności znacząco zwiększał się przy większych rozmiarach bloków i większej liczbie wątków.
Przy mniejszych rozmiarach bloków (8 KB–16 KB) poprawa była niewielka (zwykle w zakresie 0–20%), a w kilku odosobnionych przypadkach procesor H975i nieznacznie odstawał z powodu zmienności testów przy niskich głębokościach kolejek. Przy rozmiarach bloków 32 KB–64 KB przewaga stała się bardziej stabilna, a procesor H975i zapewniał o 30–50% wyższą przepustowość dla większości wątków.
Najbardziej znaczące różnice zaobserwowano przy większych rozmiarach bloków (od 128 KB do 10 MB), gdzie kontroler PERC13 uwolnił pełny potencjał systemu w zakresie sekwencyjnego odczytu. W tym przypadku układ H975i wykazał wzrost o 50–120% w porównaniu z układem H965i. Na przykład, przy rozmiarze bloku 1 MB i 8–16 wątkach, przepustowość była wyższa o ponad 55 GiB/s, co odpowiadało wzrostowi o około 90%. Przy rozmiarach bloków 5 MB i 10 MB, poprawa regularnie przekraczała 100%, a niektóre konfiguracje charakteryzowały się niemal dwukrotną wydajnością w porównaniu z poprzednią generacją.
Ogólnie rzecz biorąc, PERC13 (H975i) zapewnił sobie zdecydowaną przewagę w obciążeniach odczytu sekwencyjnego, zwłaszcza w miarę skalowania rozmiaru bloków i liczby wątków. Podczas gdy mniejsze rozmiary bloków wykazywały stopniową poprawę, przy 256 KB i wyższych, nowszy kontroler konsekwentnie zapewniał wydajność wyższą o 50–100% i więcej, co wyraźnie podkreśla postęp architektoniczny w najnowszej platformie RAID firmy Dell.
Opóźnienie sekwencyjnego odczytu GDSIO
Wraz ze wzrostem przepustowości odczytu sekwencyjnego, opóźnienie pozostawało możliwe do opanowania przy mniejszych rozmiarach bloków i mniejszej liczbie wątków. Na przykład, opóźnienie utrzymywało się poniżej 100 µs do 64 000 bloków i 16 wątków, co świadczy o efektywnym przetwarzaniu odczytów w tym zakresie. Wraz ze wzrostem rozmiarów bloków i liczby wątków, szczególnie przy 5 mln i 10 mln bloków z 64 lub większą liczbą wątków, opóźnienie gwałtownie rosło, osiągając szczyt na poziomie 211.8 ms przy rozmiarze bloku 10 mln i 256 wątkach. Uwidacznia to, jak wąskie gardła kontrolera lub kolejki pojawiają się przy ekstremalnych obciążeniach, mimo że przepustowość pozostaje wysoka.
Najlepszą równowagę między wydajnością a efektywnością zaobserwowano przy rozmiarze bloku 1 MB i 8–16 wątkach, gdzie macierz utrzymywała przepustowość na poziomie 87.5–93.7 GiB/s, utrzymując opóźnienie w zakresie 179–334 µs. Ta strefa stanowi optymalny punkt maksymalizacji przepustowości przy jednoczesnym utrzymaniu opóźnień znacznie poniżej milisekundy.
Przepustowość sekwencyjna zapisu GDSIO
Wydajność zapisu wykazywała silną, wczesną skalowalność wraz ze wzrostem rozmiarów bloków, a przepustowość wzrosła z 1.2 GiB/s przy 8 KB i 1 wątku do 13.9 GiB/s przy 256 KB. Największy wzrost nastąpił między rozmiarami bloków 128 KB a 1 MB, gdzie przepustowość osiągnęła ponad 80 GiB/s przy 8 do 16 wątkach. Maksymalna wydajność wystąpiła przy blokach 5 MB i 10 MB, utrzymując się na poziomie 100 do 101 GiB/s od 8 wątków.
Wydajność uległa spłaszczeniu w przypadku bloków o rozmiarze od 8 do 64 wątków, co wskazuje, że kontrolery osiągnęły nasycenie na wczesnym etapie krzywej skalowania. Przy większej liczbie wątków, zwłaszcza 128 i 256 wątków, stabilność przepustowości była zmienna, utrzymując się na stałym poziomie dla dużych bloków 5 mln i 10 mln na poziomie 101 GiB/s, ale spadając dla bloków o średniej wielkości, takich jak 256 KB, z 61.2 GiB/s przy 32 wątkach do 45.3 GiB/s przy 256 wątkach.
Różnica przepustowości sekwencyjnej zapisu GDSIO
W sekwencyjnych testach zapisu, PERC13 (H975i) zapewnił znaczną poprawę w porównaniu z PERC12 (H965i), szczególnie w przypadku skalowania rozmiarów bloków i liczby wątków. Przy małych rozmiarach bloków (8 KB–32 KB) poprawa była niewielka, zazwyczaj w granicach 0–10%, a sporadyczne szumy testowe wykazywały nieznaczne różnice.
Od 64 KB przewaga procesora H975i stała się bardziej widoczna. Przy rozmiarze bloku 64 KB poprawa sięgała 40-70%, a przepustowość wzrosła o ponad 12-17 GiB/s w porównaniu z H965i. Przy 128 KB-256 KB wzrost był silniejszy, gdzie procesor H975i konsekwentnie zapewniał o 50-70% wyższą przepustowość przy umiarkowanej i wysokiej liczbie wątków.
Najbardziej drastyczna różnica w wydajności wystąpiła przy większych rozmiarach bloków (od 512 KB do 10 MB). Przy 512 KB, H975i osiągnął wzrost wydajności od +31 do +56 GiB/s, co stanowiło 60-80% poprawę w porównaniu z H965i. Przy rozmiarze bloku 1 MB przewaga jeszcze się powiększyła, ze skokami przepustowości od +40 do +68 GiB/s, co stanowiło wzrost o 70-90%. Wreszcie, przy rozmiarach bloków 5 MB i 10 MB, PERC 13 niemal podwoił przepustowość w porównaniu z PERC 12, z deltami od +75 do +79 GiB/s, co przekłada się na 100% poprawę w niektórych scenariuszach z dużą liczbą wątków.
Ogólnie rzecz biorąc, kontroler PERC 13 wykazał wyraźny skok generacyjny w wydajności zapisu sekwencyjnego. Chociaż różnice są niewielkie przy najmniejszych rozmiarach bloków, to po przekroczeniu 64 KB obciążenia H975i konsekwentnie zapewnia o 50–100% wyższą przepustowość, co zdecydowanie potwierdza jego przewagę nad H965i w obciążeniach sekwencyjnych wymagających intensywnego zapisu.
Opóźnienie zapisu sekwencyjnego GDSIO
Opóźnienie podczas zapisu sekwencyjnego pozostawało imponująco niskie przy mniejszych rozmiarach bloków i mniejszej liczbie wątków, często utrzymując się poniżej 50 µs dla bloków 128 000 i nawet 8 wątków. Wraz ze wzrostem liczby wątków, opóźnienie rosło w zauważalny sposób. Na przykład, opóźnienie osiągnęło 392 µs przy 512 000 blokach z 32 wątkami i przekroczyło 1 ms przy rozmiarze bloku 1 mln i 64 wątkach.
Efekt nasycenia stał się bardziej widoczny przy największych rozmiarach bloków i najwyższych poziomach współbieżności. Opóźnienie wzrosło do 12.4 ms przy 5 mln i 128 wątkach, a osiągnęło szczyt 50.3 ms przy 10 mln i 256 wątkach.
Najbardziej wydajny punkt operacyjny dla obciążeń zapisu sekwencyjnego występował przy rozmiarach bloków 1M lub 5M z 8 do 16 wątkami, gdzie przepustowość osiągała od 87.9 do 101.2 GiB/s, a opóźnienie mieściło się w przedziale 178 µs – 1.7 ms, zapewniając wysoką, stałą wydajność bez wywoływania nadmiernych opóźnień w kolejce zapisu.
Wydajność pamięci masowej MLPerf 2.0
Aby ocenić rzeczywistą wydajność w środowiskach szkoleniowych sztucznej inteligencji, wykorzystaliśmy pakiet testowy MLPerf Storage 2.0. MLPerf Storage został zaprojektowany specjalnie do testowania wzorców wejścia/wyjścia w rzeczywistych, symulowanych obciążeniach głębokiego uczenia. Dostarcza on informacji o tym, jak systemy pamięci masowej radzą sobie z wyzwaniami, takimi jak obsługa punktów kontrolnych i trenowanie modeli.
Punkt kontrolny
Podczas trenowania modeli uczenia maszynowego punkty kontrolne są niezbędne do okresowego zapisywania stanu modelu. Pomaga to zapobiegać utracie postępów z powodu przerw, takich jak awarie sprzętu, umożliwia wcześniejsze zatrzymanie treningu i pozwala badaczom na rozgałęzianie się między różnymi punktami kontrolnymi w celu przeprowadzenia eksperymentów i ablacji.
Porównanie czasu zapisu w punktach kontrolnych wykazało, że Dell PERC13 konsekwentnie przewyższał PERC12 we wszystkich konfiguracjach modeli. PERC 13 osiągał czasy zapisu od 7.61 do 10.17 sekundy, podczas gdy PERC12 potrzebował od 10.41 do 20.67 sekundy na wykonanie tych samych operacji. Różnica w wydajności była najbardziej widoczna w modelu z 1 TB parametrów, gdzie PERC13 wykonywał zapisy w nieco ponad 10 sekund, w porównaniu z ponad 20 sekundami w przypadku PERC12. Oznacza to około 50% skrócenie czasu zapisu w przypadku największych modeli.
Analiza przepustowości zapisu (Save), dane wskazują na lepsze wykorzystanie pasma przez kontroler PERC13, który konsekwentnie zapewnia wyższe prędkości transferu danych. PERC13 osiąga przepustowość od 11.46 do 14.81 GB/s, a szczytową wydajność osiąga w modelu 1T. Natomiast kontroler PERC12 osiąga maksymalną przepustowość 9.49 GB/s i spada do 6.98 GB/s w największej konfiguracji. Nowszy kontroler utrzymuje stabilniejszą wydajność w różnych rozmiarach modeli, co sugeruje lepszą optymalizację pod kątem obsługi dużych, sekwencyjnych zapisów, typowych dla operacji w punktach kontrolnych.
Porównania czasu ładowania pokazują podobne korzyści dla PERC13, choć różnica w wydajności różni się w zależności od rozmiaru modelu. W przypadku mniejszych modeli (8B, 70B), PERC13 ładował punkty kontrolne o około 35-40% szybciej niż PERC12. Jednak ponownie najbardziej spektakularną poprawę zaobserwowaliśmy w modelu 1T, gdzie PERC13 ładował się w 10.58 sekundy w porównaniu z 21.22 sekundy w przypadku PERC12 (prawie 50% skrócenie czasu). Ten krótszy czas odzyskiwania jest kluczowy dla minimalizacji przestoju podczas wznawiania treningu od punktów kontrolnych po przerwach.
Wreszcie, analizując wskaźniki przepustowości obciążenia, PERC13 wykazuje wyraźną przewagę wydajnościową, konsekwentnie utrzymując przepustowość powyżej 18 GB/s we wszystkich konfiguracjach i osiągając szczytową wartość 23.73 GB/s w modelu 405B. Natomiast PERC12 wykazał niższą wydajność, wahającą się od 6.8 GB/s do 10.68 GB/s.
FIO Test wydajności
Chociaż w tej recenzji zastosowaliśmy nowe metody testowania, aby podkreślić wprowadzone udoskonalenia, zamieściliśmy część danych z naszego poprzedniego artykułu na temat kontrolera PERC12 firmy Dell, pokazując różnice w szczytowej przepustowości i szczytowej wydajności.
Powiedzenie, że PERC13 przynosi ulepszenia, to mało powiedziane. Przy pojedynczym wolumenie RAID5 na każdym kontrolerze, zaobserwowaliśmy wzrost przepustowości odczytu o 88%, wzrost przepustowości zapisu o 318%, wzrost wydajności losowego odczytu 4K o 31% i oszałamiający wzrost wydajności losowego zapisu 4K o 466%. Nie jest to absolutna szczytowa wydajność kontrolera PERC 13; wyższe prędkości są możliwe przy większej liczbie dysków wirtualnych. Jednak wynik ten odzwierciedla wydajność pojedynczej przestrzeni nazw przy maksymalizacji całkowitej pojemności.
| Obciążenie pracą | Podwójny PERC 12 (2 x RAID5) | Podwójny PERC 13 (2 x RAID5) | Wzrost wydajności |
|---|---|---|---|
| 128 tys. kolejnych odczytów | 101 723 (MB/s) | 101 723 (MB/s) | 88% |
| 128 tys. kolejnych zapisów | 101 723 (MB/s) | 101 723 (MB/s) | 318% |
| 4 KB losowych odczytów | 5 333 783 (IOP) | 5 333 783 (IOP) | 31% |
| 4 KB losowych zapisów | 5 333 783 (IOP) | 5 333 783 (IOP) | 466% |
Skupiliśmy się na wydajności kontrolerów Dell PERC H975i i PERC H965i, wykorzystując RAID 5, który oferuje doskonałe połączenie pojemności z ochroną parzystości. Przetestowaliśmy konfiguracje wielu dysków wirtualnych (VD) na kontrolerze Dell PERC H975i: 8 dysków VD w RAID 5 (8R5), 4 dyski VD w RAID 5 (4R5) i 2 dyski VD w RAID 5 (2R5). Przetestowaliśmy również dwie konfiguracje na kontrolerze Dell PERC H965i: 4 dyski VD w RAID 5 (4R5) i 2 dyski VD w RAID 5 (2R5). Konfiguracje wybrano na podstawie liczby dysków SSD, którymi może zarządzać każdy kontroler. Najnowszy kontroler PERC 13 może zarządzać maksymalnie 16 dyskami SSD, które można łatwo podzielić na maksymalnie 4 grupy RAID 5 po 4 dyski SSD każda. Starszy kontroler PERC12 mógł zarządzać tylko 8 dyskami SSD, co ograniczało go do testowania maksymalnie 2 grup RAID 5 SSD. Taka konfiguracja oznacza, że w przypadku systemu 8R5 mamy cztery 4-dyskowe macierze RAID 5 na każdym kontrolerze RAID PERC.
Każda konfiguracja przeszła identyczny proces benchmarkingu, rozpoczynając się od fazy wstępnego kondycjonowania, składającej się z dwóch pełnych zapisów urządzenia z wykorzystaniem sekwencyjnych obciążeń. Po osiągnięciu stanu ustalonego, zmierzyliśmy wydajność dla różnych wzorców dostępu. Przed każdym nowym testem obciążenia, ponownie uruchamialiśmy cykl wstępnego kondycjonowania, używając odpowiedniego rozmiaru transferu, aby zapewnić spójność wyników.
128K sekwencyjnej przepustowości zapisu
W testach zapisu sekwencyjnego 128 KB, zaobserwowano znaczącą różnicę w wydajności między generacjami kontrolerów. Macierze PERC H965i zapewniły umiarkowaną przepustowość, przy czym konfiguracja 2R5 osiągnęła 28.1 GB/s, a konfiguracja 4R5 29.5 GB/s, wykazując minimalne skalowanie z dodatkowych dysków RAID. Dla kontrastu, kontroler PERC H975i zapewnił wyjątkową wydajność we wszystkich konfiguracjach: macierz 2R5 osiągnęła 99.3 GB/s (253%), konfiguracja 4R5 99.7 GB/s (238%), a konfiguracja 8R5 osiągnęła szczyt 101.3 GB/s (243% w porównaniu z H965i 4R5). Ogólnie rzecz biorąc, H975i zgrupował się blisko 100 GB/s, niezależnie od liczby dysków, co wskazuje na osiągnięcie limitu przepustowości kontrolera dla zapisu sekwencyjnego 128 KB.
128K Sekwencyjne opóźnienie zapisu
W testach sekwencyjnego opóźnienia zapisu 128 KB ujawniła się wyraźna różnica między generacjami kontrolerów. Macierze PERC H965i charakteryzowały się wyższymi opóźnieniami, przy czym konfiguracja 2R5 wahała się od 0.0238 ms do 17.8 ms, a konfiguracja 4R5 do 38.9 ms, wykazując minimalne korzyści z dodatkowych dysków RAID. Z kolei kontroler PERC H975i osiągnął znacznie niższe opóźnienia we wszystkich konfiguracjach: macierz 2R5 od 0.0173 ms do 5.0 ms (o 72% niższe opóźnienie szczytowe), konfiguracja 4R5 od 0.0179 ms do 10.5 ms (o 73% niższe), a konfiguracja 8R5 od 0.0188 ms do 20.1 ms (o 48% niższe niż H965i 4R5).
128K sekwencyjnej przepustowości odczytu
W testach sekwencyjnego odczytu 128 KB na systemach Dell, kontrolery PERC H965i wykazały spójną wydajność w obu konfiguracjach. Macierz 2R5 osiągnęła maksymalną przepustowość 54.8 GB/s, a konfiguracja 4R5 również 54.8 GB/s. Z kolei kontrolery PERC H975i wykazały się znacznie lepszą wydajnością, osiągając szczytową przepustowość we wszystkich trzech konfiguracjach na poziomie około 102.7–102.8 GB/s. Macierz H975i 2R5 osiągnęła 102.8 GB/s (poprawa o 87%), konfiguracja 4R5 102.7 GB/s (poprawa o 87%), a konfiguracja 8R5 102.7 GB/s (poprawa o 87%). Warto zauważyć, że chociaż kontrolery H965i nie wykazały znaczącej różnicy w wydajności pomiędzy konfiguracjami 2R5 i 4R5, kontrolery H975i utrzymywały spójną, wysoką wydajność we wszystkich konfiguracjach RAID 5, a maksymalny limit przepustowości wydawał się być osiągnięty niezależnie od liczby dysków w macierzy.
128K opóźnienie odczytu sekwencyjnego
W testach sekwencyjnego opóźnienia odczytu 128 KB, PERC H965i oferował opóźnienia od 0.2006 ms do 16.1 ms w konfiguracji 2R5 i od 0.1644 ms do 24.7 ms w konfiguracji 4R5, wykazując zwiększoną zmienność wraz ze skalowaniem dysków. Dla porównania, PERC H975i był znacznie wydajniejszy – w konfiguracji 2R5 opóźnienia wahały się od 0.062 ms do 4.9 ms (80% niższe opóźnienie szczytowe), w konfiguracji 4R5 od 0.075 ms do 9.8 ms (60% niższe), a w konfiguracji 8R5 osiągały wartość szczytową 19.5 ms (21% niższe niż w przypadku H965i 4R5).
64k losowej przepustowości zapisu
W testach losowego zapisu 64K, starszy kontroler PERC H965i wykazał się spójną, ale ograniczoną wydajnością, przy czym zarówno konfiguracja 2R5, jak i 4R5 osiągnęły niemal identyczną przepustowość 8.3 GB/s, niezależnie od liczby dysków. Dla kontrastu, kontroler PERC H975i zapewnił wyjątkową poprawę wydajności: konfiguracja 2R5 osiągnęła 39.8 GB/s (poprawa o 379%), podczas gdy konfiguracja 4R5 utrzymała tę samą szczytową przepustowość 39.8 GB/s (poprawa o 379%). Macierz 8R5 w kontrolerze H975i nieznacznie wyprzedziła go, osiągając 40.3 GB/s (poprawa o 386%).
64k losowego opóźnienia zapisu
W testach losowego opóźnienia zapisu 64 KB, kontroler H965i miał problemy z większym obciążeniem, z wartością 2R5 w zakresie od 0.020 ms do 30.0 ms i 4R5 sięgającą nawet 60.0 ms. Dla kontrastu, kontroler H975i uzyskał znacznie lepszą wydajność: 2R5 wahało się od 0.0115 ms do 6.3 ms (o 79% niższe opóźnienie szczytowe), 4R5 osiągnęło zaledwie 12.6 ms (o 79% niższe), a 8R5 osiągnęło szczyt na poziomie 24.8 ms (o 59% niższe niż w przypadku kontrolera H965i 4R5).
64k losowej przepustowości odczytu
W testach losowego odczytu 64 KB, kontroler PERC H965i z macierzami 2R5 i 4R5 osiągnął niemal identyczną przepustowość 54.6 GB/s. Dla kontrastu, kontroler PERC H975i ponownie okazał się znacząco lepszy – wszystkie trzy konfiguracje osiągnęły przepustowość około 102.7 GB/s, co stanowi wzrost wydajności o 88% w porównaniu z H965i. Co godne uwagi, konfiguracje H975i wykazały się niezwykłą spójnością w przypadku różnych rozmiarów macierzy RAID, a szczytowa przepustowość wahała się zaledwie od 102.7 GB/s do 102.7 GB/s, niezależnie od tego, czy w macierzy RAID-5 użyto 2, 4 czy 8 dysków. Sugeruje to, że przy obciążeniu losowym odczytem 64 KB jesteśmy w stanie całkowicie nasycić kontroler i nie jesteśmy ograniczeni przez dyski na nowszej platformie H975i.
64k losowego opóźnienia odczytu
W przypadku losowych odczytów 64 KB macierz H965i 2R5 osiągała wartości od 0.226 ms do 4.6 ms, podczas gdy w konfiguracji 4R5 sięgała ona 9.6 ms. Przejście na macierz H975i znacznie obniżyło opóźnienia: w przypadku macierzy 2R5 wynosiło ono od 0.080 ms do 2.4 ms (o 48% niższe opóźnienie szczytowe), w przypadku macierzy 4R5 od 0.080 ms do 4.9 ms (o 49% niższe), a w przypadku macierzy 8R5 od 0.080 ms do 9.7 ms (porównywalnie z macierzą H965i 4R5). Ogólnie rzecz biorąc, macierz H975i charakteryzowała się lepszą kontrolą i niższymi limitami opóźnień w grupach RAID.
16 tys. sekwencyjnych operacji zapisu IOPS
W testach zapisu sekwencyjnego 16K kontroler PERC H965i wykazał umiarkowaną wydajność, przy czym konfiguracja 2R5 osiągnęła 1.73 mln IOPS, a konfiguracja 4R5 1.87 mln IOPS. Dla porównania, kontroler PERC H975i zapewnił znaczący wzrost, osiągając 6.44 mln IOPS w konfiguracji 2R5 (272% więcej niż H965i). Macierz 4R5 kontrolera H975i osiągnęła szczyt na poziomie 6.54 mln IOPS (250% więcej), podczas gdy konfiguracja 8R5 osiągnęła 6.53 mln IOPS (249% więcej niż H965i 4R5), co ponownie pokazuje, że kontrolery osiągają nasycenie na poziomie około 6.5 mln IOPS przy rozmiarze bloku 16K.
16k opóźnienie zapisu sekwencyjnego
W sekwencyjnych zapisach 16 tys. pamięci macierze H965i osiągnęły czas 0.0080–3.5 ms na 2R5 i 0.0083–5.3 ms na 4R5. Model H975i wykazał się wyższą wydajnością, z czasem 2R5 od 0.0070 ms do 0.80 ms (o 77% niższym), 4R5 do 1.42 ms (o 73% niższym), a 8R5 osiągającym szczyt 6.2 ms (o 17% niższym w porównaniu z H965i 4R5).
16 tys. sekwencyjnych operacji odczytu IOPS
W testach sekwencyjnego odczytu 16 tys. danych kontrolery PERC H965i uzyskały spójne wyniki, przy czym konfiguracja 2R5 osiągnęła 3.56 mln IOPS, a konfiguracja 4R5 również 3.56 mln IOPS. Dla porównania, kontrolery PERC H975i uzyskały wszystkie konfiguracje zwarte, około 6.64 mln IOPS, co stanowi 86% poprawę w porównaniu z H965i.
16k opóźnienie odczytu sekwencyjnego
W 16 tys. odczytów sekwencyjnych, macierz H965i 2R5 mieściła się w zakresie od 0.040 ms do 1.15 ms, podczas gdy 4R5 sięgała nawet 3.0 ms. W przypadku H975i opóźnienia uległy skróceniu: 2R5 wynosiło 0.038–0.62 ms (o 46% mniej), 4R5 osiągnęło szczyt na poziomie 1.23 ms (o 59% mniej), a 8R5 osiągnęło 2.47 ms (o 19% mniej niż H965i 4R5).
16 tys. losowych operacji zapisu IOPS
Przy losowym wejściu/wyjściu z bloku o rozmiarze 16 KB zaobserwowaliśmy, że punkt nasycenia został osiągnięty bardzo wcześnie w fazie testów. Obie konfiguracje PERC H965i (2R5 i 4R5) zapewniły niemal identyczną wydajność, wynoszącą około 492 000 IOPS. Kontrolery PERC H975i z macierzą 2R5 osiągnęły 2.57 miliona IOPS (poprawa o 422%). Konfiguracje H975i 4R5 i 8R5 osiągnęły nieco wyższy wynik, około 2.60 miliona IOPS (poprawa o 428%).
16k losowego opóźnienia zapisu
Przy 16 tys. losowych zapisów, H965i charakteryzował się większym opóźnieniem, z czasem 2R5 wynoszącym 0.0082–8.6 ms i czasem 4R5 rozciągającym się do 16.6 ms. W przypadku H975i opóźnienie znacznie się poprawiło, z czasem 2R5 wynoszącym 0.0070–1.59 ms (o 82% niższym), 4R5 sięgającym 3.17 ms (o 81% niższym), a czasem 8R5 osiągającym maksymalnie 6.27 ms (o 62% niższym w porównaniu z H965i 4R5).
16 tys. losowych operacji odczytu IOPS
W losowym odczycie 16 000 bitów, konfiguracje PERC H965i zapewniły spójną wydajność, przy czym macierz 2R5 osiągnęła 3.55 miliona IOPS, a macierz 4R5 – 3.55 miliona IOPS. Konfiguracje PERC H975i 2R5, 4R5 i 8R5 osiągnęły niemal identyczną wydajność szczytową, wynoszącą około 6.64 miliona IOPS, co stanowi 87% poprawę w porównaniu z generacją H965i.
16k losowego opóźnienia odczytu
W 16 tys. losowych odczytów macierze H965i zapewniły opóźnienie rzędu 0.0906–1.15 ms dla 2R5 i do 2.74 ms dla 4R5. Model H975i ponownie zmniejszył opóźnienie: dla 2R5 wynosiło ono 0.072–0.62 ms (o 46% mniej), dla 4R5 do 1.23 ms (o 55% mniej), a dla 8R5 osiągało szczyt na poziomie 2.47 ms (o 10% mniej niż w przypadku H965i 4R5).
4K losowy zapis IOPS
W testach losowego zapisu 4K kontrolery PERC H975i w konfiguracji 2R5 osiągnęły szczytową wydajność 9.76 mln IOPS, podczas gdy macierz 4R5 zapewniła nieco wyższą wydajność, wynoszącą 9.94 mln IOPS. Konfiguracja 8R5 wykazała się najwyższą wydajnością, osiągając 10.10 mln IOPS.
Opóźnienie losowego zapisu 4K
W testach 4K ocenialiśmy H975i wyłącznie pod kątem wydajności szczytowej. Opóźnienie było doskonałe we wszystkich macierzach: 2R5 wahało się od 0.0058 ms do 0.47 ms, 4R5 osiągało szczyt 0.88 ms, a 8R5 1.63 ms. Wyniki te pokazują, że przy najmniejszym rozmiarze bloku, H975i utrzymywał wyjątkowo niskie opóźnienia, konsekwentnie poniżej 2 ms.
4K losowy odczyt IOPS
Jeden z najbardziej ekscytujących wykresów zostawiliśmy na koniec: w testach losowego odczytu 4K, H975i w konfiguracji 2R5 osiągnął imponujące 17.3 mln IOPS. Macierz H975i 4R5 osiągnęła 20.1 mln IOPS, a konfiguracja 8R5 osiągnęła najwyższą przepustowość – 25.2 mln IOPS.
Opóźnienie odczytu losowego 4K
W przypadku losowych odczytów 4K opóźnienia zaczynały się od 0.069 ms we wszystkich macierzach, przy czym w przypadku macierzy 2R5 wartość maksymalna wynosiła 0.29 ms, w przypadku macierzy 4R5 – 0.53 ms, a w przypadku macierzy 8R5 – 0.65 ms. Niski pułap we wszystkich grupach RAID podkreśla zdolność macierzy H975i do obsługi małych losowych odczytów z niezwykłą wydajnością.
Brak kompromisów wydajnościowych podczas przebudowy
W porównaniu z PERC12, kontroler Dell PERC13 oferuje znacznie wyższą przepustowość dla każdego obciążenia podczas odbudowy macierzy. Sekwencyjny odczyt wzrósł ponad dwukrotnie, osiągając 53.7 GB/s w porównaniu z 25 GB/s (wzrost o 114.7%), a sekwencyjny zapis wzrósł z 14.6 GB/s do 68 GB/s (wzrost o 363.7%). Wydajność małych bloków dodatkowo zwiększa tę różnicę: losowe odczyty 4K wzrosły z 4.68 mln do 17.33 mln IOPS (wzrost o 270.4%), a losowe zapisy 4K gwałtownie wzrosły z 0.48 mln do 5.33 mln IOPS (wzrost o 1013.1%). Krótko mówiąc, PERC13 minimalizuje wpływ odbudowy i zachowuje zapas mocy obliczeniowej hosta nawet w najintensywniejszych okresach konserwacji.
| Obciążenie pracą | Podwójny PERC 12 (2 × RAID5) – odbudowa | Podwójny PERC 13 (2 × RAID5) – odbudowa | % Poprawa |
|---|---|---|---|
| Sekwencyjna przepustowość odczytu | 25 (GB/s) | 53.7 (GB/s) | 114.7% |
| Sekwencyjna przepustowość zapisu | 14.7 (GB/s) | 68 (GB/s) | 363.7% |
| 4 KB losowych odczytów | 4 676 748 (IOPS) | 5 333 783 (IOP) | 270.4% |
| 4 KB losowych zapisów | 5 333 783 (IOP) | 5 333 783 (IOP) | 1013.1% |
Szybka odbudowa bez spowalniania obciążeń roboczych
Dell deklaruje również znaczny wzrost odporności i wydajności odbudowy, powołując się na skrócenie czasu odbudowy macierzy z ponad 80 minut na terabajt w przypadku PERC12 do zaledwie 10 minut na terabajt w przypadku PERC13. Taka szybkość ogranicza okna ryzyka i świadczy o dojrzałości sprzętowego mechanizmu XOR, przyspieszenia pamięci podręcznej i optymalizacji ścieżek danych kontrolera.
W testach odbudowy RAID5, PERC13 konsekwentnie zapewniał krótsze czasy odbudowy niż PERC12, gdy kontroler mógł nadać priorytet odbudowie, z zastrzeżeniem, że ekstremalnie duże obciążenie zapisu może zniweczyć tę przewagę. Po włączeniu priorytetu odbudowy, kontroler daje zadaniom odbudowy pierwszeństwo w dostępie do zasobów. Pozwoliło to kontrolerowi PERC13 znacząco skrócić czas odbudowy pod presją sekwencyjnego odczytu. Przy najniższym obciążeniu hosta (125 MB/s) czas odbudowy spadł z 11.53 do 5.32 min/TiB. Nawet przy największym obciążeniu, czas odbudowy spadł z 16.96 do 7.73 min/TiB, przy jednoczesnym utrzymaniu znacznie wyższej szybkości odczytu hosta (22.4 GB/s w porównaniu do 60 GB/s).
Dzięki sekwencyjnemu obciążeniu zapisu, PERC13 poprawił odbudowę przy niskim obciążeniu z 7.51 do 4.98 min/TiB, ale przy największym obciążeniu zapisu czas odbudowy wzrósł do 15.29 min/TiB w porównaniu z 13.09 min/TiB w modelu R760. Można to rozpatrywać z dwóch perspektyw: PERC13 miał wolniejsze tempo odbudowy, ale PERC13 utrzymywał prędkości zapisu zbliżone do produkcyjnych w porównaniu z PERC12 (62.5 GB/s w porównaniu z 12 GB/s). Innymi słowy, funkcja Priority Rebuild spełnia obietnicę szybszego okna odbudowy, szczególnie w przypadku aktywności z przewagą odczytu. Jedynym wyjątkiem jest sytuacja, gdy system jest jednocześnie poddawany bardzo dużym obciążeniom zapisu; wyższa przepustowość hosta PERC13 może wydłużyć czas odbudowy.
| Scenariusz | Podwójny PERC 12 (2 × RAID5) | Podwójny PERC 13 (2 × RAID5) | ||
|---|---|---|---|---|
| Min/TiB | Całkowita przepustowość | Min/TiB | Całkowita przepustowość | |
| Czytanie sekwencyjne – aktywność świetlna | 11.53 | 0.125 Gb / s | 5.32 | 0.125 Gb / s |
| Odczyt sekwencyjny – duża aktywność | 16.96 | 22.4 Gb / s | 7.73 | 60 Gb / s |
| Sekwencyjne pisanie – aktywność świetlna | 7.51 | 0.125 Gb / s | 4.98 | 0.125 Gb / s |
| Zapis sekwencyjny – duża aktywność | 13.09 | 12 Gb / s | 15.29 | 62.5 Gb / s |
Przejście na tryb Priority Host, który celowo chroni operacje wejścia/wyjścia aplikacji kosztem szybkości odbudowy, zapewnia podobną wydajność odczytu i bardziej zniuansowaną wydajność zapisu. Przy obciążeniach odczytu kontroler PERC13 ponownie kończy odbudowę znacznie szybciej niż starszy model PERC12, skracając czas przy małym obciążeniu z 11.23 do 6.70 min/TiB, a przy dużym obciążeniu z 38.44 do 19.75 min/TiB, obsługując jednocześnie większy ruch hosta (46.2 GB/s w porównaniu z 24.1 GB/s w punkcie dużego obciążenia). W przypadku obciążeń zapisu tryb Priority Host utrzymuje wydajność produkcyjną na pierwszym planie: PERC13 jest szybszy przy najmniejszym obciążeniu (7.80 w porównaniu z 5.67 min/TiB), ale przy największym obciążeniu zapisu jego odbudowa wydłuża się do 32.81 min/TiB w porównaniu z 25.40 min/TiB w przypadku PERC12. Czas odbudowy jest nieco dłuższy, ale PERC13 zapewnia hostowi znacznie większą przepustowość zapisu (62.4 GB/s w porównaniu do 12.5 GB/s).
| Scenariusz | Podwójny PERC 12 (2 × RAID5) | Podwójny PERC 13 (2 × RAID5) | ||
|---|---|---|---|---|
| Min/TiB | Całkowita przepustowość | Min/TiB | Całkowita przepustowość | |
| Czytanie sekwencyjne – aktywność świetlna | 11.23 | 0.125 Gb / s | 6.70 | 0.125 Gb / s |
| Odczyt sekwencyjny – duża aktywność | 38.44 | 24.1 Gb / s | 19.75 | 46 Gb / s |
| Sekwencyjne pisanie – aktywność świetlna | 7.80 | 0.125 Gb / s | 5.67 | 0.125 Gb / s |
| Zapis sekwencyjny – duża aktywność | 25.40 | 12.5 Gb / s | 32.81 | 62.4 Gb / s |
Z perspektywy wdrożenia wybór jest prosty. Gdy trzeba zminimalizować okno podatności i można tolerować pewne obniżenie priorytetu operacji wejścia/wyjścia, funkcja Priorytetu Rebuild w kontrolerze PERC13 skraca czas odbudowy, szczególnie w scenariuszach z dużą liczbą operacji odczytu. W sytuacjach, gdy utrzymanie responsywności aplikacji jest nie do negocjacji, funkcja Priority Host spełnia to zadanie; kontroler PERC13 nadal doskonale sprawdza się w przypadku odbudowy odczytu, podczas gdy okresy intensywnego zapisu mogą wymagać harmonogramowania lub umiarkowanego ograniczania, jeśli istotny jest bezwzględny czas odbudowy.
Wniosek
Dell PERC H975i ustanawia sprzętowy RAID jako atrakcyjne rozwiązanie dla korporacyjnych centrów danych opartych na technologii NVMe. Chociaż implementacje JBOD i programowego RAID zyskały popularność w środowiskach skalowalnych, te podejścia wprowadzają złożoność operacyjną, obciążenie procesora i wydłużony czas odzyskiwania danych w przypadku awarii dysków. H975i oferuje specjalnie zaprojektowaną akcelerację sprzętową z dedykowanymi silnikami kontroli parzystości, przyspieszone operacje odbudowy oraz zintegrowane funkcje zarządzania w ramach infrastruktury Dell.
W przypadku obciążeń związanych ze sztuczną inteligencją i uczeniem maszynowym, które wymagają spójnych charakterystyk przepustowości, minimalnych wahań opóźnień i maksymalnej niezawodności działania, architektury RAID zarządzane sprzętowo zapewniają zarówno wydajność obliczeniową, jak i odporność operacyjną bez wykorzystywania krytycznych zasobów przetwarzania hosta.
Testy wydajności potwierdzają udoskonalenia architektury – H975i zapewnia o 88% wyższą przepustowość sekwencyjnego odczytu i o 318% wyższą przepustowość sekwencyjnego zapisu w porównaniu z generacją PERC12. Maksymalne wartości przepustowości 103 GB/s i 25.2 mln operacji wejścia/wyjścia na sekundę (IOPS) potwierdzają możliwości kontrolera w zakresie obciążeń intensywnie przetwarzających dane. Dodatkowo, czas odbudowy skrócił się z ponad 80 minut na terabajt do zaledwie 10 minut na terabajt, przy jednoczesnym zachowaniu wydajności zbliżonej do produkcyjnej podczas operacji odzyskiwania danych.
Interfejsy PCIe Gen5 x16 i zintegrowana z przodu konstrukcja serwera H975i umożliwiają gęste rozmieszczenie GPU bez rywalizacji o zasoby pamięci masowej, umożliwiając przewidywalne skalowanie wydajności w konfiguracjach z wieloma akceleratorami. Ponieważ wiele serwerów PowerEdge oferuje zarówno kontrolery RAID H965i, jak i H975i, nie ma wątpliwości, że organizacje wykorzystujące nowe obciążenia powinny wybrać nowsze rozwiązanie. Jeśli wdrażasz infrastrukturę AI na dużą skalę, serwer H975i zapewnia podstawę pamięci masowej o wysokiej przepustowości i niskich opóźnieniach, niezbędną do maksymalizacji wykorzystania zasobów obliczeniowych.





Amazon