StorageReview.com

Första storskalig SSD-tillförlitlighetsstudie i fält utförd på Facebook

Företag  ◇  SSD

Forskare vid Carnegie Mellon University har släppt en studie som fokuserade på tillförlitligheten hos SSD:er inom fältet, studien har titeln "A Large-Scale Study of Flash Memory Failures in the Field." Studien genomfördes med hjälp av Facebooks datacenter under fyra år och miljontals drifttimmar. Studien tittar på hur fel manifesterar sig och syftar till att hjälpa andra att utveckla nya flash-tillförlitlighetslösningar.

Som vi har sagt ett tag här på StorageReview, erbjuder flash flera prestandafördelar, densitetsfördelar och lägre strömförbrukning med den största nackdelen är kostnaden. Även om många SSD:er hävdar god livslängd och tillförlitlighet, har det inte gjorts några större studier på fältet förrän nu.

Även om specifika leverantörer och specifika enheter inte nämndes, använder Facebook många i sin heta datanivå, men studien noterade vilken typ av plattform som SSD:n användes i (detta definierades som en kombination av enhetskapaciteten som användes i systemet , PCIe-tekniken som användes och antalet SSD-enheter i systemet), dessa var etikettplattformar AF. Plattformarna varierade i kapacitet från 720 GB till 3.2 TB, hade två generationer PCIe (version 1 och 2), vissa använde en SSD andra använde två, och tiden i drift sträckte sig från ett halvår till över två år.

Forskarna använde register för att hålla reda på SSD-drift liknande SMART-data. De råa värdena samlades in en gång per timme, analyserades till ett formulär som kunde kureras till en Hive-tabell, och sedan utförde ett kluster av maskiner en parallelliserad aggregering av data som lagrats i Hive med hjälp av MapReduce-jobb. Utifrån detta kunde forskarna övervaka Bit Error Rate, SSD-felfrekvens och felantalet, korrelationen mellan olika SSD:er (särskilt på plattformar som hade mer än en SSD), och rollen av både interna och externa faktorer.

Slutsatserna från studien inkluderar:

  • SSD:er går igenom flera distinkta felperioder – tidig upptäckt, tidig fel, användbar livslängd och slitage – under sin livscykel, vilket motsvarar mängden data som skrivs till flashchips.
  • Effekten av lässtörningsfel är inte en dominerande källa till fel i de undersökta SSD:erna.
  • Gles datalayout över en SSD:s fysiska adressutrymme (t.ex. icke sammanhängande allokerad data) leder till höga SSD-felfrekvenser; tät datalayout (t.ex. sammanhängande data) kan också negativt påverka tillförlitligheten under vissa förhållanden, troligtvis på grund av motstridiga åtkomstmönster.
  • Högre temperaturer leder till ökade felfrekvenser, men gör det mest märkbart för SSD-enheter som inte använder strypteknik.
  • Mängden data som rapporteras vara skriven av systemmjukvaran kan överdriva mängden data som faktiskt skrivs till flashchips, på grund av buffring på systemnivå och tekniker för slitageminskning.

Även om studien inte anger att en enhet, eller typ av enhet, är bättre än en annan, är det fortfarande en intressant titt på hur SSD:erna presterar i den verkliga världen under hård användning. Denna studie öppnar dörren för både framtida studier som tittar på SSD-användning såväl som ny teknik som kan göra SSD-enheter ännu mer pålitliga eller hålla mycket längre.

För sin del har Facebook fortsatt att utveckla sina serverdesigner för att hantera datapunkter som de som härrör från Carnegie Mellon-studien. Deras nyligen tillkännagivna Yosemite-plattform är ett aktuellt exempel på hur Facebook utnyttjar flash i icke-traditionella formfaktorer, åtminstone för datacentret, för att få bästa möjliga prestandaprofil med stor betoning på total ägandekostnad.

fullständig studie

Anmäl dig till StorageReviews nyhetsbrev

Engagera dig med StorageReview

Nyhetsbrev | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | RSS-flöde

Adam armstrong

Adam är chefsnyhetsredaktör för StorageReview.com och hanterar våra interna och frilansande innehållsteam.