W ciągu ostatnich kilku lat toczyła się ożywiona dyskusja na temat problemów związanych z dyskami rozruchowymi w systemach hiperskalowych. Chociaż firmy zajmujące się hiperskalowaniem nie chcą wydawać na nie zbyt wiele, potrzebują one podstawowego minimalnego progu wydajności, oprócz innych niezbędnych specyfikacji.
Pojawia się również pytanie, kto tak naprawdę będzie kontynuował produkcję dysków rozruchowych M.2 NVMe o małej pojemności, ponieważ producenci dysków SSD dla przedsiębiorstw w większości wycofali się z tego segmentu. Solidigm nie ma w swojej ofercie nowoczesnych dysków rozruchowych M.2, a większość nowoczesnych rozwiązań oferowanych przez Samsunga, KIOXIA i Micron wiąże się z obawami o koszty ze względu na ich dużą pojemność. Dochodzi jeszcze kwestia wydajności. Choć nie jest ona rewelacyjna, dysk rozruchowy musi niezawodnie generować minimalne rezultaty.
Jak widać na poniższym wykresie, pojemność dysków rozruchowych i dysków danych stale rośnie, co oznacza większe wydatki dla organizacji.
Wymagania i przeszkody dotyczące dysków rozruchowych Hyperscale NVMe
Na szczycie OCP kwestie te zostały omówione podczas prezentacji przedstawicieli Google i Meta, a co najważniejsze, przedstawiono działania, jakie podejmują, aby rozwiązać te problemy.
Przedstawiono przykład hiperskalowalnego dysku rozruchowego SSD, reprezentującego aktywność z jednego dnia, obejmującą odczyty i zapisy we/wy, a także transakcje TRIM. Najbardziej zauważalna jest wysoka przepustowość dysków TRIM, która wskazuje na krótkotrwały czas życia danych (tworzonych i usuwanych wkrótce potem). Nieprawidłowo zaprojektowane dyski TRIM będą powodować opóźnienia i zakłócać ruch odczytu i zapisu. Większość ruchu to również losowe odczyty i zapisy.
Oto niektóre z przeszkód, z którymi musi zmierzyć się technologia Hyperscale NVMe Boot:
- Ostatecznie obciążenia hiperskalowalne są wrażliwe na opóźnienia, dlatego utrzymanie stałej wydajności jest bardzo ważne, aby zapewnić użytkownikom efektywne środowisko pracy.
- Utrudnione jest również debugowanie na dużą skalę, dlatego szczegółowe wskaźniki monitorowania są niezwykle ważne zarówno w celu przewidywania, jak i wykrywania awarii.
- Wytrzymałość jest bardzo ważna w przypadku dysków SSD rozruchowych. Po sfinalizowaniu systemu (co może zająć trochę czasu), posiadanie dysków rozruchowych o wysokiej wytrzymałości pozwoli im działać tak długo, jak cały cykl życia produktu.. Pomoże to wyeliminować konieczność napraw i zapobiegnie przedwczesnemu zużyciu.
- Co najważniejsze, klienci o dużej skali przywiązują dużą wagę do prywatności i bezpieczeństwa, a spełnienie wszystkich tych standardów bywa trudne.
Jest to bardzo zróżnicowany zakres problemów, więc rozwiązanie ich może być skomplikowane, jeśli nie zostanie przeprowadzone prawidłowo.
Rozwiązywanie problemów z dyskami rozruchowymi
Ponieważ głównym celem i siłą napędową OCP jest współpraca i otwarte specyfikacje, jedynym sposobem na rozwiązanie tych problemów jest współpraca. W związku z tym Meta i Google połączyły siły, aby połączyć wymagania i stworzyć specyfikację Hyperscale NMEe Boot SSD (wersja 1.0) , co stanowi ważny kamień milowy w zakresie wydajności dysków rozruchowych. Została ona zgłoszona na początku tego roku i jest dostępna na stronie internetowej OCP.
Te specyfikacje niosą ze sobą wiele korzyści. Ostatecznie pozwalają one rynkowi lepiej zrozumieć funkcje, których potrzebują i używają hiperskalerzy w swoich urządzeniach rozruchowych, a także zapewniają zgodność z branżą w zakresie wdrażania dysków rozruchowych SSD. Ponadto, zapewniają one organizacjom narzędzia open source do zarządzania dyskami rozruchowymi SSD, co prowadzi do rozwoju zewnętrznych pakietów testowych, które mogą spełnić wszystkie wymagania.
Podczas sesji wskazano również, że istnieją dwa sposoby na stworzenie hiperskalowalnego dysku SSD do rozruchu. Można obniżyć standard dysku SSD klasy korporacyjnej lub wymienić go na dysk SSD klasy konsumenckiej, ponieważ jego wymagania plasują się gdzieś pośrodku tych dwóch kategorii.
Ławka do butów
W naszych recenzjach dysków SSD zaczęliśmy dodawać sekcję dotyczącą wydajności Boot Bench. Jest to profil obciążenia przyjęty przez OCP do oceny dysków SSD przeznaczonych do rozruchu serwerów. To obciążenie rozruchowe wykonuje stosunkowo intensywny plan testowy, który polega na całkowitym wypełnieniu dysku operacjami zapisu przed testowaniem sekwencji obciążenia z dużą ilością odczytów.
W każdym teście wykonywana jest losowa operacja asynchronicznego odczytu 32 KB, a także synchroniczny losowy zapis 128 KB z prędkością 15 MiB/s oraz synchroniczny losowy zapis/przycinanie 128 KB z prędkością 5 MiB/s w tle. Skrypt rozpoczyna działanie losowego odczytu na poziomie 4 zadań i skaluje się do 256 zadań w szczytowym momencie. Końcowym rezultatem są operacje odczytu wykonane w szczytowym momencie.
Celem OCP dla tego benchmarku jest zaliczenie/niezaliczenie testu przy 60 tys. odczytów IOPS. Większość testowanych przez nas dysków znacznie przekracza minimalny próg, ale wyniki są mimo to pouczające. Najciekawsze w naszych testach było to, że udało nam się znacznie przekroczyć próg IOPS w przypadku modeli dysków SSD NVMe zorientowanych na wydajność, ale nie udało się to wolniejszym dyskom SSD, które zdały test. Wiele wolniejszych modeli SSD z łatwością trafia do kategorii nieprzechodzących testów, chociaż model 970 EVO Plus 2TB zanotował niższą prędkość, która nie spełniała wymagań.
| SSD | Odczyt IOPS |
| Sk hynix Platinum P41 | 220,884 IOPS |
| WDSN850X | 219,883 IOPS |
| Solidigma P44 Pro | 211,999 IOPS |
| Fantom VENOM8 | 190,573 IOPS |
| Samsung 990 Pro | 176,677 IOPS |
| Sabrent Rakieta 4 Plus | 162,230 IOPS |
| Samsung 970 EVO Plus 2 TB | 52,005 IOPS |
| Corsair MP600 GS | DNF |
| Solidigm P41 Plus | DNF |
Przykład przypadku użycia obciążenia hiperskalowalnego
Podczas sesji porównano również dwa różne dyski: jeden bardziej uniwersalny i jeden bardziej zgodny ze specyfikacjami OCP dla systemów hiperskalowych. Ogólnie rzecz biorąc, stwierdzili oni, że w przypadku tego drugiego nastąpiła znaczna poprawa opóźnień we wszystkich obszarach, co jest bardzo istotne w przypadku systemów hiperskalowych.
W rzeczywistości oznacza to, że zauważalnie skróci się czas wprowadzania produktu na rynek w przypadku próby wdrożenia dysku lepiej dostosowanego do specyfikacji.
Poruszamy się naprzód z Specyfikacje dysków SSD OCP Hyperscale NVMe Boot
Chociaż niektóre firmy wcześniej tworzyły własne dyski rozruchowe o dużej skali, aby sprostać własnym potrzebom (i konkretnym wymaganiom klientów), specyfikacje te nie były powszechnie znane w branży. W rezultacie dostawcy musieli tworzyć własny, dostosowany sprzęt/oprogramowanie sprzętowe, aby sprostać potrzebom swoich klientów.
Od tego czasu przebyliśmy długą drogę, ponieważ OCP oficjalnie udostępniło wersję 1.0 swojej specyfikacji Hyperscale NVMe Boot SSD . Pozwala to producentom systemów i dostawcom dysków SSD na osiągnięcie wspólnego zestawu wymagań, jednocześnie zachęcając do dalszej współpracy.
OCP wzywa wszystkich producentów OEM (tj. systemów) i firmy zajmujące się rozwiązaniami hiperskalowalnymi do przyłączenia się do tej akcji i obiecuje nieustanny rozwój oraz udoskonalanie specyfikacji w miarę zmian na rynku pamięci masowych.
Wpływ na przedsiębiorstwo
Potrzeba dysku rozruchowego nie ogranicza się do zastosowań hiperskalowych. M.2 jest obecnie standardowym dyskiem rozruchowym dla większości serwerów i macierzy pamięci masowej. Chociaż w większości przypadków dysk nie musi wykonywać wielu zadań, musi być niezawodny, w miarę wydajny i nie większy (droższy) niż jest to absolutnie konieczne. Miejmy nadzieję, że dostawcy pamięci masowej odpowiedzą na tę inicjatywę, wprowadzając dysk SSD przeznaczony do rozruchu, aby dostawcy infrastruktury mogli zachować pewien stopień standaryzacji.




Amazon