Solidigm D7-PS1030 to średniej klasy moduł z pierwszej rodziny centrów danych PCIe 5.0 firmy, łączący platformę dzieloną z D7-PS1010, z wydajnością 3 DWPD i limitem losowego zapisu do 800 tys. IOPS, czyli dwukrotnie większą niż 400 tys. w przypadku jego standardowej wersji o wysokiej wytrzymałości. Rodzina dysków oferuje od 1.6 TB do 12.8 TB w wersjach E3.S i U.2, wykorzystując 176-warstwową pamięć NAND TLC, z nominalną wydajnością do 14 500 MB/s przy odczycie sekwencyjnym i 10 000 MB/s przy zapisie sekwencyjnym. Solidigm jest przeznaczony do obciążeń zorientowanych na zapis i mieszanych: OLTP, rejestrowania metadanych, HPC i potoków AI/ML, gdzie presja zapisu nigdy nie maleje. Nasz egzemplarz testowy to model E3.S o pojemności 12.8 TB.

Dysk Solidigm D7-PS1030 o pojemności 12.8 TB w obudowie E3.S o grubości 7.5 mm.
Nie jest to nasz pierwszy raz z tym dyskiem; jednak po raz pierwszy testowaliśmy pojedynczy dysk. Osiem z tych samych jednostek 12.8 TB obsługiwało warstwę flash w naszej pracy z odciążeniem pamięci podręcznej KV na serwerze Dell PowerEdge XE7740, gdzie macierz utrzymywała 1.9 GB/s ciągłych zapisów KV przez całą dobę, co daje cykl pracy wynoszący około 3.2 zapisów na dysk dziennie na dysk w trybie lustrzanym, czyli około 1.6 DWPD w trybie RAID0. To właśnie ten zakres jest w stanie obsłużyć dysk PS1030 o wartości 3 DWPD: odciążenie KV to obciążenie, w którym wytrzymałość, a nie pojemność czy prędkość szczytowa, jest definiującym ograniczeniem warstwy. Klasa intensywnie odczytująca, która dominuje w nagłówkach Gen5, szybko wyczerpałaby swój budżet 1 DWPD przy takim obciążeniu.

Serwer PS1030 przed serwerem Dell PowerEdge XE7740, na którym przeprowadzaliśmy testy odciążenia pamięci podręcznej KV.
Przy pojemności 12.8 TB, Solidigm ocenia dysk na 2.75 miliona losowych operacji odczytu/s (IOPS) 4K i pełne 800 tysięcy losowych operacji zapisu/s (IOPS), przy czym szczytowa wartość losowych odczytów (IOPS) w tej rodzinie, wynosząca 3.1 miliona, znajduje się niżej w stosie pojemności. Pobór mocy w trybie aktywnym wynosi typowo 23 W, a w stanie spoczynku 5 W, zgodnie z wymaganiami Gen5, z pięcioma konfigurowalnymi stanami zasilania od 5 W do 25 W dla operatorów pracujących przy stałym budżecie szafy. Solidigm podaje również dwie dodatkowe, warte odnotowania deklaracje: do 70% lepszą efektywność energetyczną niż porównywalne dyski oraz do 90% spójność operacji IOPS przez cały okres eksploatacji dysku. Wytrzymałość można również zużywać szybciej w krótszych okresach; ten sam nośnik obsługuje 4.98 DWPD w okresie trzech lat, a model 12.8 TB jest przeznaczony do zapisu 70 PB w obu trybach. Specyfikacja niezawodności jest zgodna z klasą: 2.5 miliona godzin MTBF, pięcioletnia gwarancja i test UBER Solidigm 1E-18. Opcje bezpieczeństwa obejmują wersję TCG Opal 2.02 SED, sprzęt z certyfikatem FIPS 140-3 Level 2, bezpieczne uruchamianie i podpisywanie oprogramowania sprzętowego zgodne ze standardem OCP, a także atestację urządzenia i unieważnianie klucza.

W obudowie Dell E3.S.
Dane techniczne Solidigm D7-PS1030
| Specyfikacja | Solidigm D7-PS1030 (12.8TB E3.S, odnotowano w serii rodzinnej) |
|---|---|
| Omówienie platformy | |
| Możliwości | 1.6TB 3.2TB 6.4TB 12.8 TB (według testów) |
| Formy czynników | E3.S 7.5 mm (testowany) U.2 15mm |
| Interfejs / Protokół | PCIe 5.0 x4, NVMe |
| NAND | Solidigm 176-warstwowa pamięć TLC 3D NAND |
| Wydajność (do, ocena sprzedawcy) | |
| Odczyt sekwencyjny (128 KB) | 10 000 MB/s (rodzina) |
| Zapis sekwencyjny (128 KB) | 10 000 MB/s (rodzina) |
| Losowe czytanie (4K) | 2,750 tys. operacji wejścia/wyjścia na sekundę (12.8 TB) Do 3,100 tys. IOPS (szczyt rodzinny) |
| Losowy zapis (4K) | 800K IOPS |
| Moc i wytrzymałość | |
| Moc (aktywna / bezczynna) | 23W typ. / 5W typ. Pięć konfigurowalnych stanów zasilania, od 5 W do 25 W |
| Wytrzymałość | 3.0 DWPD (na podstawie 5 lat) 4.98 DWPD (na podstawie 3 lat) 70 PBW przy 12.8 TB |
| Niezawodność i bezpieczeństwo | |
| Średni czas między awariami (MTBF) / UBER | 2,500,000 godzin Przetestowano zgodnie z normą 1E-18 |
| Ochrona | TCG Opal 2.02 (wariant SED) Certyfikat FIPS 140-3 Poziom 2 Podpisywanie oprogramowania sprzętowego i bezpiecznego rozruchu w standardzie OCP Atestacja urządzenia, unieważnienie klucza |
| Gwarancja | 5 Lata |

Urządzenia PS1030 w wersji E3.S, rodzina dostępna jest również w wersji U.2.
Solidigm D7-PS1030 Wydajność
Kontekst poniższych wykresów pokazuje, że PS1030 znajduje się w naszym zestawieniu porównawczym jako przeciwwaga do dysków o dużej intensywności odczytu, które napędzały ostatnie testy Gen5. W porównaniu z dyskiem KIOXIA CD9P-R, który testowaliśmy w czerwcu, PS1030 oferuje nominalną prędkość odczytu sekwencyjnego (14 500 w porównaniu do 14 800 MB/s), ale prawie dwukrotnie większą nominalną prędkość zapisu losowego (800 tys. w porównaniu do 450 tys. IOPS) i trzykrotnie większy budżet zapisu (3 w porównaniu do 1 DWPD). Jego najbliższym rywalem w tej grupie jest Micron 7600 MAX , drugi dysk o 3 DWPD w tym zestawieniu, a Micron 9550 MAX oferuje wydajność w zastosowaniach mieszanych, oferując tę samą pojemność 12.8 TB, co nasz egzemplarz.
Platforma testowania napędów
W tej recenzji jako platformę testową dla wszystkich obciążeń wykorzystaliśmy serwer Dell PowerEdge R760 z systemem Ubuntu 22.04.2 LTS. Wyposażony w złącze JBOF Serial Cables Gen5, oferuje on szeroką kompatybilność z dyskami SSD U.2, E1.S, E3.S i M.2. Poniżej przedstawiono konfigurację naszego systemu:
- 2 x Intel Xeon Gold 6430 (32-rdzeniowy, 2.1 GHz)
- 16 x 64 GB DDR5-4400
- Dysk SSD Dell BOSS 480 GB
- Kable szeregowe Gen5 JBOF
- NVIDIA L4
Porównanie napędów
- KIOXIA CD9P-R 7.68TB (1 dni robocze dziennie)
- KIOXIA CM9-R 15.36 TB (1 dni robocze dziennie)
- SanDisk DC SN861 7.68 TB (1 dni robocze dziennie)
- Solidigm PS1010 7.68 TB (1 dni robocze dziennie)
- Micron 7600 MAX 6.4 TB (3 dni robocze dziennie)
- Micron 9550 MAX 12.8 TB (3 dni robocze dziennie)
- Micron 9550 Pro 7.68 TB (1 DWPD)
Test punktów kontrolnych DLIO
Aby ocenić rzeczywistą wydajność dysków SSD w środowiskach szkoleniowych AI, wykorzystaliśmy narzędzie testowe Data and Learning Input/Output (DLIO). Opracowane przez Argonne National Laboratory, narzędzie DLIO zostało zaprojektowane specjalnie do testowania wzorców wejścia/wyjścia w obciążeniach głębokiego uczenia. Dostarcza ono informacji o tym, jak systemy pamięci masowej radzą sobie z takimi wyzwaniami, jak obsługa punktów kontrolnych, pobieranie danych i trenowanie modeli.
Poniższa tabela przedstawia średni czas ukończenia punktów kontrolnych dla każdego dysku w trzech przebiegach; im niższy, tym lepiej. Uwaga dotycząca tych danych: liczba punktów kontrolnych w przebiegu skaluje się wraz z pojemnością każdego dysku, więc większe dyski rejestrują więcej punktów kontrolnych, a wyniki dla poszczególnych punktów kontrolnych nie są wyrównane punkt po punkcie na dyskach o różnych rozmiarach. Dlatego publikujemy średnie przebiegów, które normalizują przebieg każdego dysku do wartości bezpośrednio porównywalnych. Podczas trenowania modeli uczenia maszynowego punkty kontrolne są niezbędne do okresowego zapisywania stanu modelu, zapobiegając utracie postępu podczas przerw lub przerw w zasilaniu. To zapotrzebowanie na pamięć masową wymaga wysokiej wydajności, szczególnie w przypadku długotrwałych lub intensywnych obciążeń. Wykorzystaliśmy test porównawczy DLIO w wersji 2.0 z wydania z 13 sierpnia 2024 r.
Aby zapewnić, że nasze testy porównawcze odzwierciedlają rzeczywiste scenariusze, oparliśmy je na architekturze modelu LLAMA 3.1 405B. Zaimplementowaliśmy obsługę punktów kontrolnych za pomocą funkcji torch.save() w celu przechwytywania parametrów modelu, stanów optymalizatorów i stanów warstw. Nasza konfiguracja symulowała system z ośmioma procesorami graficznymi, implementując hybrydową strategię paralelizmu z 4-kierunkowym paralelizmem tensorowym i 2-kierunkowym przetwarzaniem równoległym potokowym, rozłożonym na osiem procesorów graficznych. Ta konfiguracja dała rozmiar punktu kontrolnego wynoszący 1,636 GB, co odzwierciedla wymagania związane z trenowaniem nowoczesnych modeli języków programowania.
| Drive | Średnia z 1 podejść (sekundy) | Średnia z 2 podejść (sekundy) | Średnia z 3 podejść (sekundy) |
|---|---|---|---|
| SanDisk DC SN861 7.68 TB | 461.3 | 558.6 | 553.3 |
| Micron 9550 MAX 12.8 TB | 462.8 | 558.9 | 555.3 |
| Micron 9550 Pro 7.68 TB | 461.4 | 577.9 | 559.7 |
| Solidigm PS1010 7.68 TB | 458.8 | 561.1 | 564.6 |
| Micron 7600 MAX 6.4 TB | 464.2 | 581.5 | 567.3 |
| KIOXIA CD9P-R 7.68TB | 464.7 | 575.6 | 570.6 |
| KIOXIA CM9-R 15.36 TB | 462.8 | 571.9 | 580.9 |
| Solidigm PS1030 12.8 TB | 462.3 | 578.0 | 599.2 |
Patrząc na średnie wyniki testów, Solidigm PS1030 otworzył się w czołówce z czasem 462.3 sekundy w pierwszym teście, podczas gdy cała grupa porównawcza znalazła się w siedmiosekundowym paśmie od około 459 do 465 sekund. Rozdzielenie nastąpiło później. W drugim teście PS1030 osiągnął 578.0 sekund, plasując się w górnej części pola, które wahało się od 558.6 sekundy SanDisk SN861 do 581.5 sekundy Micron 7600 MAX, a w trzecim teście spadł do 599.2 sekundy, co stanowi najwyższą średnią w grupie porównawczej, podczas gdy reszta pola ustabilizowała się między 553.3 sekundy SN861 a 580.9 sekundy KIOXIA CM9-R.
Własny dziennik punktów kontrolnych dysku PS1030 pokazuje kształt tego dryfu. PS1030 otworzył się po 465.3 sekundy i utrzymał się przez prawie 461 sekund do punktu kontrolnego 5, zanim przyspieszył. Po przejściu, czas wahał się od około 553 do 593 sekund, zamknął punkt kontrolny 12 po 614.7 sekundy, a jego ostatnie punkty kontrolne osiągnęły nawet 629.0 sekund. Wynik jest zgodny z jedną, ustaloną słabością dysku, a nie nową: punkty kontrolne DLIO to dokładnie ten rodzaj dużej, sekwencyjnej serii zapisu, którą zasygnalizował test FIO dla pojedynczego serwera roboczego o przepustowości 128 KB. Różnica jest realna, ale ograniczona, około 5% w porównaniu ze średnimi wynikami KIOXIA CD9P-R w trzecim przejściu, a PS1030 skalował się przewidywalnie w kolejnych przejściach, zamiast wahać się.
Wskaźnik wydajności FIO
Aby zmierzyć wydajność pamięci masowej każdego dysku SSD w oparciu o typowe wskaźniki branżowe, wykorzystujemy FIO. Każdy dysk przechodzi ten sam proces testowania, który obejmuje etap wstępnego kondycjonowania, obejmujący dwa pełne zapełnienia dysku sekwencyjnym obciążeniem zapisu, a następnie pomiar wydajności w stanie ustalonym. W miarę zmiany typu mierzonego obciążenia, uruchamiamy kolejne wstępne zapełnienie dysku o nowym rozmiarze transferu.
W tej sekcji skupiamy się na następujących wskaźnikach FIO:
- 128K sekwencyjny
- 64K Losowo
- 16K sekwencyjny
- 4K Losowo
128K Sekwencyjny zapis (IODepth 16 / NumJobs 1)
Test sekwencyjnego zapisu 128 KB w stanie ustalonym to jedyny obszar, w którym PS1030 wykazuje pewne słabości w porównaniu z innymi dyskami SSD. Dysk osiągnął 6,370.3 MB/s przy 313.7 µs, co stanowi najniższą przepustowość i najwyższe opóźnienie w grupie, ustępując nawet intensywnie korzystającemu z odczytu dyskowi KIOXIA CD9P-R z wynikiem 6,912.4 MB/s. Micron 9550 MAX prowadził z wynikiem 10 957,9 MB/s, 9550 Pro z 10 354,6 MB/s, a KIOXIA CM9-R zajął wyraźne trzecie miejsce z wynikiem 8,668.1 MB/s. W środku znalazły się modele PS1030, PS1010 (7,126.5 MB/s) i SanDisk DC SN861 (7,116.5 MB/s), a Micron 7600 MAX uzyskał 6,960.6 MB/s.
Warto o tym pamiętać: jest to obciążenie z pojedynczym zadaniem, a architektura zapisu PS1030 została zaprojektowana tak, aby rozłożyć pracę, a nie zapewnić jeden strumień. Poniższe losowe sekcje zapisu pokazują, że ten sam dysk przesyła znacznie więcej danych po wprowadzeniu paralelizmu, który odpowiada wzorcowi dostępu generowanemu przez docelowe obciążenia.
128 KB odczytu sekwencyjnego (IODepth 64 / NumJobs 1)
Strona odczytu odwróciła scenariusz. PS1030 osiągnął 14 156,4 MB/s przy 564.8 µs, co dało wynik remisowy z jego odpowiednikiem PS1010 (14 163,3 MB/s) i o 0.6% gorszy od wiodącego w grupie CD9P-R (14 235,9 MB/s). Micron 9550 Pro (14 050,1 MB/s) i 9550 MAX (14 047,5 MB/s) uzupełniły zestaw pięciu dysków, nasycając interfejs Gen5 pasmem 200 MB/s. SN861 znalazł się na drugim miejscu z wynikiem 12 631,2 MB/s, 7600 MAX z 11 240,5 MB/s, a CM9-R, tak silny w teście zapisu, uplasował się na ostatnim miejscu z wynikiem 9,974.6 MB/s w tej konfiguracji z jednym zadaniem. W przypadku dysku o budżecie przeznaczonym na zapis, cichym sukcesem w tym zestawieniu jest brak konieczności rezygnowania z czegokolwiek przy odczycie dużych bloków.
Losowy zapis 64K
Charakter dysku PS1030 ujawnia się w losowym zapisie 64 KB. Dysk osiągnął szczyt na poziomie 7,224.0 MB/s, zajmując czwarte miejsce w grupie za Micron 9550 MAX (10 878,1 MB/s), KIOXIA CM9-R (9,635.3 MB/s) i Micron 9550 Pro (9,069.4 MB/s), a wyprzedzając Micron 7600 MAX (6,960.5 MB/s) i resztę rynku. Tym, co wyróżnia dysk PS1030, jest moment, w którym ten szczyt wystąpił: przy IODepth 2 / NumJobs 2, z opóźnieniem wynoszącym zaledwie 34.3 µs, podczas gdy większość dysków potrzebowała głębokich kolejek, aby osiągnąć najlepsze wyniki. Dysk nasyca się niemal natychmiast, a następnie pozostaje w tym stanie przez resztę cyklu, co jest dokładnie tym profilem, jakiego oczekuje się od stabilnej warstwy zapisu działającej z umiarkowaną współbieżnością przez całą dobę. Różnica w stosunku do swojego odpowiednika to również warstwa wytrzymałościowa, która zapewnia mu utrzymanie pod względem wydajności: PS1010 osiągnął szczytową prędkość 5,873.9 MB/s, o 23% mniej niż PS1030.
Pod względem opóźnienia, PS1030 otworzył się z czasem 21.1 µs w punkcie IODepth 1 / NumJobs 1, ustępując jedynie CM9-R z czasem 18.4 µs, a jego najgorszy punkt w całym przebiegu wyniósł 2,831 µs, czyli mniej niż połowę szczytowego momentu PS1010 wynoszącego 5,987 µs. 9550 MAX pozostał najbardziej kontrolowany przy wysokiej współbieżności, osiągając szczyt na poziomie 1,714 µs.
Odczyt losowy 64K
PS1030 odnotował najlepszy wynik w grupie w losowym odczycie danych 64 KB, uzyskując 14 162,9 MB/s (IODepth 32 / NumJobs 8), nieznacznie wyprzedzając Micron 9550 Pro (14 049,9 MB/s), 9550 MAX (14 049,7 MB/s) i PS1010 (14 013,6 MB/s). CM9-R uzyskał wynik 13 402,4 MB/s, a CD9P-R 12 036,0 MB/s jeszcze dalej. Historia niskiej głębokości kolejki należy do dysków KIOXIA, podobnie jak w naszej recenzji CD9P-R: CM9-R osiągnął prędkość otwarcia 1,359.0 MB/s, a CD9P-R 1,334.0 MB/s przy IODepth 1 / NumJobs 1, co daje opóźnienie około 45 µs, podczas gdy PS1030 osiągnął prędkość startową 768.4 MB/s i 81.0 µs, w połowie pakietu. PS1030 plasuje się na szczycie tego zestawienia pod względem skalowalności, a nie odpowiedzi pojedynczego strumienia.
16K Sekwencyjny zapis
Uwaga dotycząca samego testu: począwszy od tej grupy porównawczej, nasze pokrycie 16 000 danych ma charakter sekwencyjny, a nie losowy – obciążenie, które po raz pierwszy omówiliśmy w naszej recenzji Micron 9550 MAX . Strumienie sekwencyjne średniej wielkości lepiej odzwierciedlają to, co te dyski robią w środowisku produkcyjnym, zwłaszcza w potokach AI, które przesyłają strumieniowo uporządkowane dane treningowe, etapami wyprowadzają wyniki pośrednie i dostarczają warstwy wnioskowania w seriach, zamiast rozrzucać losowe trafienia po całym dysku.
Wyniki przetasowują sytuację w porównaniu z wynikami losowych testów. Micron 9550 MAX prowadził z wynikiem 10 970,8 MB/s (IODepth 32 / NumJobs 4), KIOXIA CM9-R był niemal tak samo dobry z wynikiem 10 812,2 MB/s, a 9550 Pro trzeci z wynikiem 9 772,8 MB/s. PS1030 osiągnął szczyt z wynikiem 5 977,7 MB/s (IODepth 8 / NumJobs 4), zajmując siódme miejsce w grupie, wyprzedzając SanDisk DC SN861 z wynikiem 5 772,5 MB/s i tuż za swoim odpowiednikiem PS1010 z wynikiem 6 271,7 MB/s. Kształt przebiegu jest jednak taki sam, jak sygnatura, którą wykazały losowe testy: PS1030 osiągnął już 5,856.7 MB/s według IODepth 2 / NumJobs 4 przy opóźnieniu 21.1 µs, a następnie utrzymał płaskie pasmo między około 4,700 a 6,000 MB/s w pozostałej części macierzy. Jego opóźnienie pojedynczego procesu roboczego wynoszące 10.9 µs plasowało się w czołówce klastra wraz z CM9-R (10.4 µs) i CD9P-R (11.0 µs), znacznie poniżej mikronów przy 15.1 do 17.8 µs. Pułap jest skromny jak na dysk z krótkim czasem reakcji skoncentrowanym na zapisie, ale osiąga minimalną głębokość kolejki i opóźnienie klasy mikrosekund, punkt operacyjny, w którym znajduje się podtrzymywana pamięć podręczna lub warstwa przejściowa, i ten sam profil, który przeprowadził ten dysk przez tygodnie ciągłych sekwencyjnych strumieni zapisu w naszym wdrożeniu pamięci podręcznej KV.
16K Sekwencyjny odczyt
W odczycie KIOXIA CD9P-R prowadził z wynikiem 13 819,7 MB/s, tuż za nim plasował się CM9-R z wynikiem 13 393,2 MB/s, a tuż za nim Micron 9550 Pro z wynikiem 13 273,5 MB/s. PS1030 osiągnął szczyt na poziomie 11 142,8 MB/s (IODepth 16 / NumJobs 8) z czasem 179.1 µs, zajmując siódme miejsce w grupie, wyprzedzając jedynie SN861 z wynikiem 10 995,0 MB/s i tuż za swoim rodzeństwem z wynikiem 11 656,3 MB/s, co stanowi około jedną piątą straty do lidera grupy. Obraz pojedynczego strumienia odwraca również historię losowego odczytu: w przypadku uporządkowanych odczytów 16 000, SN861 otworzył się z czasem 12.5 µs, a Microns z czasem między 13.9 a 21.3 µs, podczas gdy platforma Solidigm rozpoczęła odczyt z czasem bliskim 59 µs – tę samą cechę odczytu o niskiej współbieżności, którą oba dyski serii PS wykazały przy 64 000. Odczyty średniej wielkości pozostają tym narożnikiem macierzy, w którym ta platforma oferuje najwięcej; strona strumieniowego odczytu w potoku AI jest lepiej obsługiwana przez klasę intensywnie korzystającą z odczytu, co nie jest argumentem przemawiającym za tym, że ten dysk został stworzony.
Losowy zapis 4K
Nagłówek wykresu dla dysku 3 DWPD, a także PS1030, który spisał się znakomicie. Jego szczytowa wartość 1,595.8 tys. IOPS przy IODepth 16 / NumJobs 8 zajęła drugie miejsce w grupie, ustępując jedynie innemu dyskowi 3 DWPD Micron 7600 MAX z wynikiem 1,781.2 tys., a wyprzedzając 9550 MAX (1,544.2 tys.), PS1010 (1,504.7 tys.), CM9-R (1,502.9 tys.), 9550 Pro (1,467.6 tys.), SN861 (1,438.3 tys.) i CD9P-R (1,273.1 tys.). Ten zmierzony szczyt jest również dwukrotnie wyższy niż nominalna wartość 800 tys. dla dysku, którą Solidigm określa przy stałej głębokości kolejki; testy w stanie ustalonym ujawniają więcej.
Opóźnienie potwierdza argumentację. PS1030 otworzył się z czasem 8.8 µs na poziomie IODepth 1, w wiodącym klastrze z CM9-R (8.2 µs) i PS1010 (8.3 µs), osiągając szczytową przepustowość na poziomie zaledwie 79.8 µs i nigdy nie przekraczając 359.6 µs w żadnym miejscu cyklu. PS1010 z kolei potrzebował 32 IODepth / 16 zadań, aby osiągnąć szczyt 339.7 µs, w najgorszym przypadku osiągając 735.6 µs. W przypadku logów OLTP i ruchu w pamięci podręcznej KV, do którego skierowany jest ten dysk, kluczowe są krótkie czasy zapisu rzędu mikrosekund, z limitem poniżej 400 µs.
Odczyt losowy 4K
PS1030 pobił swój rekord zapisu, uzyskując drugi najlepszy w grupie wynik szczytowego losowego odczytu 4K: 2,255.8 tys. IOPS przy IODepth 16 / NumJobs 16 i 112.8 µs, za wynikiem 2,555.6 tys. IOPS uzyskanym przez SanDisk SN861 i przed wynikami Micron 9550 MAX (2,217.6 tys. IOPS) i CD9P-R (2,165.0 tys. IOPS). W teście IODepth 1 / NumJobs 1, sygnatura niskiego opóźnienia KIOXIA ponownie okazała się liderem: CM9-R z czasem 29.3 µs i CD9P-R z czasem 30.4 µs, ale wynik 56.8 µs dla PS1030 był najlepszy z pozostałych, wyprzedzając swojego brata oraz oba modele 9550 (około 65 µs) i SN861 (67.8 µs). Dysk o mieszanym przeznaczeniu, który zajmuje drugie miejsce pod względem szczytowych wartości odczytu i zapisu 4K w obszarze o tak dużym obciążeniu odczytem, pokrywa obie połowy swojego zakresu zadań.
Bezpośrednie przechowywanie GPU
Jednym z testów, jakie przeprowadziliśmy na tym stanowisku testowym, był test Magnum IO GPU Direct Storage (GDS). GDS to funkcja opracowana przez firmę NVIDIA, która pozwala procesorom graficznym ominąć procesor główny (CPU) podczas uzyskiwania dostępu do danych przechowywanych na dyskach NVMe lub innych szybkich urządzeniach pamięci masowej. Zamiast kierować dane przez procesor i pamięć systemową, GDS umożliwia bezpośrednią komunikację między procesorem graficznym a urządzeniem pamięci masowej, znacznie redukując opóźnienia i poprawiając przepustowość danych.
Jak działa bezpośrednie przechowywanie danych GPU
Tradycyjnie, gdy procesor graficzny (GPU) przetwarza dane przechowywane na dysku NVMe, dane muszą najpierw przejść przez procesor (CPU) i pamięć systemową, zanim dotrą do procesora graficznego (GPU). Proces ten wprowadza wąskie gardła, ponieważ procesor (CPU) działa jako pośrednik, zwiększając opóźnienia i zużywając cenne zasoby systemowe. Technologia GPU Direct Storage eliminuje ten problem, umożliwiając procesorowi graficznemu bezpośredni dostęp do danych z urządzenia pamięci masowej za pośrednictwem magistrali PCIe. Ta bezpośrednia ścieżka zmniejsza obciążenie związane z przesyłaniem danych, umożliwiając szybsze i bardziej wydajne przesyłanie danych.
Obciążenia sztucznej inteligencji, zwłaszcza te wykorzystujące uczenie głębokie, charakteryzują się wysoką intensywnością przetwarzania danych. Trenowanie dużych sieci neuronowych wymaga przetwarzania terabajtów danych, a każde opóźnienie w transferze danych może prowadzić do niewykorzystania procesorów graficznych (GPU) i wydłużenia czasu trenowania. Technologia GPU Direct Storage rozwiązuje ten problem, zapewniając jak najszybsze dostarczanie danych do procesora graficznego (GPU), minimalizując czas przestoju i maksymalizując wydajność obliczeniową.
Ponadto GDS jest szczególnie przydatny w przypadku obciążeń wymagających strumieniowego przesyłania dużych zbiorów danych, takich jak przetwarzanie wideo, przetwarzanie języka naturalnego czy wnioskowanie w czasie rzeczywistym. Zmniejszając zależność od procesora, GDS przyspiesza przesyłanie danych i uwalnia zasoby procesora do innych zadań, co dodatkowo zwiększa ogólną wydajność systemu.
Przepustowość sekwencyjnego odczytu GDSIO
W segmencie bloków o rozmiarze 16 KB, PS1030 otworzył się z prędkością około 0.2 GiB/s na pojedynczym wątku, co stanowi najniższy punkt wejścia w grupie, co jest zgodne z jego opóźnieniem odczytu pojedynczego wątku GDS wynoszącym 71.6 µs (jego odpowiednik osiągnął 71.1 µs, tę samą cechę platformy, którą wskazaliśmy w recenzji CD9P-R). Stabilnie skalował się w stawce w średnim zakresie, kończąc segment z prędkością około 1.6 GiB/s przy 16 KB/128, podczas gdy para KIOXIA utrzymała prowadzenie w segmencie na poziomie około 2.0 GiB/s. Przewaga dysków KIOXIA w zakresie skalowania wątków utrzymywała się również w segmencie 128K, przy czym CD9P-R i CM9-R wyprzedzały je w segmencie 128K/16, podczas gdy PS1030 podążał za główną grupą, osiągając około 4.7 GiB/s przy 128K/64 i 5.0 GiB/s przy 128K/128.
W segmencie 1M wyniki się wyrównały. PS1030 osiągnął szczyt 5.95 GiB/s (1M/32), co stanowi wynik o 3.5% gorszy od najlepszego w grupie wyniku 6.16 GiB/s uzyskanego przez CD9P-R, z wynikiem CM9-R na poziomie 6.06, PS1010 i 9550 MAX na poziomie 6.05 oraz 9550 Pro na poziomie 5.97 GiB/s. Ostatni wynik, 5.59 GiB/s, zajął 7600 MAX. Przy szczytowym wyniku 16 tys. operacji wejścia/wyjścia na sekundę (IOPS), prowadziła para procesorów KIOXIA (136.4 tys. dla CM9-R, 134.2 tys. dla CD9P-R), podczas gdy wynik PS1030, wynoszący 101.2 tys., był najniższy w grupie; bezpośrednie odczyty małych bloków GPU po prostu nie są mocną stroną tej platformy.
Przepustowość zapisu sekwencyjnego GDSIO
Wykres przemiatania zapisu to wykres, który powinni przeanalizować nabywcy dysku PS1030, ponieważ zawiera on zarówno najlepsze cechy dysku, jak i jego jedyną prawdziwą anomalię. W segmencie 16K wszystkie osiem dysków śledzono razem w paśmie od 0.5 do 1.5 GiB/s, a opóźnienie zapisu pojedynczego wątku PS1030 wynoszące 22.3 µs plasowało się w czołówce klastra wraz z dwoma dyskami KIOXIA (po 21.4 µs) i jego rodzeństwem (21.9 µs). W segmencie 128K, PS1030 skalował się czysto do około 3.95 GiB/s przy 128K/32, a następnie gwałtownie spadł: około 2.35 GiB/s przy 128K/64 i 1.55 GiB/s przy 128K/128, co stanowi mniej niż jedną trzecią wydajności liderów segmentu. To ten sam problem z załamaniem zapisu przy dużej liczbie wątków, który udokumentowaliśmy na PS1010 w recenzji CD9P-R, a który został niemal dokładnie powtórzony na PS1030 (PS1010 spadł do 2.5, a następnie 1.65 GiB/s przy tych samych wynikach). Cokolwiek za tym stoi, znajduje się w platformie, a nie w warstwie wytrzymałościowej, i pozostaje najpoważniejszą skazą w zbiorze danych.
Segment 1M osłabł, ale nie zatarł wzorca. PS1030 osiągnął szczyt na poziomie 4.22 GiB/s (1M/8), wyprzedzając jedynie swojego brata z wynikiem 4.17 GiB/s, a następnie spadł do około 3.35 GiB/s na poziomie 1M/128, podczas gdy CM9-R utrzymał najbardziej stabilną linię w grupie, zbliżając się do szczytu 5.51 GiB/s, a 9550 MAX osiągnął najwyższy szczyt na poziomie 5.69 GiB/s, wykazując się udokumentowaną zmiennością, spadając do około 2.2 GiB/s na poziomie 1M/64. 9550 Pro (5.54), 7600 MAX (5.44), CD9P-R (4.86) i SN861 (4.59 GiB/s) wypełniły zlecenie. Ratunkiem dla docelowego nabywcy PS1030 jest: pamięć podręczna KV i warstwy zapisu w stylu logicznym generują umiarkowaną liczbę wątków na dysk, gdzie PS1030 zachowuje się bez zarzutu, a nie przy ponad 64 wątkach zapisu bezpośredniego na GPU, gdzie występuje załamanie. Nasze własne wdrożenie pamięci podręcznej KV uruchamiało osiem takich dysków przez tygodnie, a macierz ani razu nie zbliżyła się do wąskiego gardła. Jednak każdy, kto planuje intensywne, wielowątkowe strumieniowanie zapisu GDS na tej platformie, powinien najpierw przeprowadzić test porównawczy swojego dokładnego wzorca.
Wniosek
Solidigm D7-PS1030 spełnia oczekiwania stawiane dyskom Gen5 o średniej wytrzymałości, a dane wskazują na jego wyjątkowe umiejętności. Jego znakiem rozpoznawczym jest równoległa praca na małych blokach: zajmuje drugie miejsce w grupie zarówno pod względem losowego zapisu 4K (1,595.8 tys. IOPS, ustępując jedynie innemu dyskowi 3 DWPD Micron 7600 MAX), jak i losowego odczytu 4K (2,255.8 tys. IOPS). Jego najlepszy wynik w grupie to losowy odczyt 64K – 14 162,9 MB/s, a także pełna przepustowość liniowa Gen5 przy sekwencyjnych odczytach 128K – 14 156,4 MB/s. Równie interesujące jest to, jak dysk ten osiąga ten poziom: osiąga szczyty na poziomie IODepth 2 lub NumJobs 8 z opóźnieniem rzędu dziesiątek mikrosekund, podczas gdy konkurencja potrzebuje głębokich kolejek i płaci za nie opóźnieniem. Dysk szybko się nasyca, utrzymuje stały poziom i najgorsze opóźnienie zapisu wynosi połowę tego, co jego odpowiednik PS1010.

Zatoka XE7740, w której umieszczono ośmiodyskową warstwę PS1030 w ramach naszej pracy z odciążeniem pamięci podręcznej KV.
Są jednak kompromisy. Zapisy sekwencyjne 128K pojedynczego pracownika wylądowały ostatnie w grupie z wynikiem 6,370.3 MB/s, a punktowanie kontrolne DLIO, które podkreśla dokładnie ten wzorzec, osiągnęło najwyższą średnią Pass 3 w grupie na poziomie 599.2 sekundy. Testy sekwencyjne 16K również były gorsze po obu stronach, ze szczytem zapisu 5,977.7 MB/s i szczytem odczytu 11,142.8 MB/s każdy osiągając siódmą z ośmiu wartości. Przemiatanie zapisu GDSIO odtworzyło spadek 128K w wątkach PS1010 prawie punkt po punkcie, potwierdzając, że jest to zachowanie platformy, a nie jednorazowe, a odczyty bezpośrednie małych bloków GPU faworyzują dyski KIOXIA z dużym marginesem. Nic z tego nie podważa specyfikacji dysku, ale ją podkreśla: PS1030 nie jest dyskiem do przetwarzania pojedynczego strumienia.
To, do czego został stworzony, udowodnił już w dłuższej formie niż jakikolwiek test laboratoryjny. Osiem z tych dysków spędziło tygodnie jako warstwa odciążająca pamięć podręczną KV w naszej pracy wnioskowania XE7740 , absorbując 1.9 GB/s ciągłych, całodobowych zapisów przy cyklu pracy, który otarł się o ich ocenę 3 DWPD, a warstwa nigdy nie stała się wąskim gardłem. Dane testowe wyjaśniają, dlaczego to zadziałało: wczesne nasycenie zachowania zapisu, opóźnienie zapisu 4K rzędu jednej cyfry mikrosekundy przy niskich głębokościach kolejki i kontrolowany pułap opóźnień to dokładnie cechy, które nagradzają ciągle zapisywaną warstwę pamięci podręcznej lub logu. Ograniczona wytrzymałość, wrażliwa na opóźnienia, umiarkowanie współbieżne obciążenia zapisem, odciążanie pamięci podręcznej KV, rejestrowanie OLTP i warstwy metadanych to miejsca, do których należy PS1030, a gdzie jego budżet 3 DWPD i trzyletnia opcja 4.98 DWPD pozwoliły mu na uruchamianie cykli pracy, które zdyskwalifikowałyby klasę intensywnie odczytującą.




Amazon