Naukowcy z Uniwersytetu Carnegie Mellon opublikowali badanie skupiające się na niezawodności dysków SSD w terenie. Badanie nosi tytuł „Badanie awarii pamięci flash na dużą skalę w terenie”. Badanie przeprowadzono w centrach danych Facebooka przez cztery lata i miliony godzin pracy. Badanie analizuje mechanizmy powstawania błędów i ma na celu pomoc innym w opracowaniu nowatorskich rozwiązań zwiększających niezawodność pamięci flash.
Jak już od jakiegoś czasu powtarzamy w StorageReview, pamięć flash oferuje szereg korzyści w zakresie wydajności, gęstości i niższego zużycia energii, a jej największą wadą jest koszt. Chociaż wiele dysków SSD deklaruje dobrą żywotność i niezawodność, do tej pory nie przeprowadzono żadnych poważnych badań terenowych.
Chociaż nie wymieniono konkretnych dostawców ani konkretnych napędów, Facebook korzysta z wielu z nich w swojej warstwie danych gorących. Badanie odnotowało jednak rodzaj platformy, na której zastosowano dyski SSD (zdefiniowano to jako kombinację pojemności urządzenia w systemie, technologii PCIe i liczby dysków SSD w systemie). Platformy te miały pojemność od 720 GB do 3.2 TB, dwie generacje PCIe (wersja 1 i 2), niektóre korzystały z jednego dysku SSD, inne z dwóch, a czas ich eksploatacji wynosił od pół roku do ponad dwóch lat.
Naukowcy wykorzystali rejestry do śledzenia działania dysków SSD, podobnie jak w przypadku danych SMART. Surowe wartości były zbierane raz na godzinę, przetwarzane do postaci, która mogła być zapisana w tabeli Hive, a następnie klaster maszyn przeprowadzał równoległą agregację danych przechowywanych w Hive za pomocą zadań MapReduce. Dzięki temu naukowcy mogli monitorować współczynnik błędów bitowych, wskaźnik awaryjności dysków SSD i liczbę błędów, korelację między różnymi dyskami SSD (szczególnie na platformach z więcej niż jednym dyskiem SSD) oraz rolę czynników wewnętrznych i zewnętrznych.
Wnioski wyciągnięte z badania obejmują:
- Dyski SSD przechodzą przez kilka odrębnych okresów awarii – wczesne wykrycie, wczesna awaria, okres użytkowania i zużycie – w trakcie swojego cyklu życia, co odpowiada ilości danych zapisanych na układach pamięci flash.
- Wpływ błędów odczytu nie jest dominującym źródłem błędów w badanych dyskach SSD.
- Rzadkie rozmieszczenie danych w fizycznej przestrzeni adresowej dysku SSD (np. dane przydzielane w sposób nieciągły) prowadzi do wysokiej awaryjności dysków SSD; gęste rozmieszczenie danych (np. dane ciągłe) może również negatywnie wpływać na niezawodność w pewnych warunkach, prawdopodobnie z powodu wzorców dostępu antagonistycznego.
- Wyższe temperatury prowadzą do zwiększonego wskaźnika awaryjności, ale jest to najbardziej zauważalne w przypadku dysków SSD, które nie wykorzystują technik ograniczania przepustowości.
- Ilość danych, którą oprogramowanie systemowe zgłasza jako zapisaną, może przeceniać ilość danych faktycznie zapisanych na układach pamięci flash, ze względu na buforowanie na poziomie systemu i techniki zmniejszania zużycia.
Chociaż badanie nie wskazuje na wyższość jednego dysku lub typu dysku nad innym, to wciąż stanowi interesujący wgląd w to, jak dyski SSD sprawdzają się w rzeczywistych warunkach intensywnego użytkowania. Badanie to otwiera drogę zarówno do przyszłych badań nad wykorzystaniem dysków SSD, jak i do nowych technologii, które mogłyby sprawić, że dyski SSD będą jeszcze bardziej niezawodne lub będą działać znacznie dłużej.
Z kolei Facebook stale rozwija swoje projekty serwerów, aby uwzględniać dane takie jak te pochodzące z badania Carnegie Mellon. Niedawno ogłoszona platforma Yosemite jest doskonałym przykładem tego, jak Facebook wykorzystuje pamięć Flash w niestandardowych formatach, przynajmniej w centrach danych, aby uzyskać najlepszy profil wydajności, kładąc duży nacisk na całkowity koszt posiadania (TCO).




Amazon