Samsung ha avviato la produzione di massa del PM1763, il suo primo SSD PCIe Gen6 per il settore enterprise, che combina la tecnologia V-NAND di nona generazione con un controller a 4 nm di nuova concezione. Il modello di punta da 15.36 TB offre velocità di lettura sequenziale fino a 28,400 MB/s e di scrittura fino a 21,000 MB/s, con una velocità di lettura 1.96 volte superiore al limite di 14,500 MB/s del PM1753 Gen5 che va a sostituire. Samsung afferma che il PM1763 ha completato la validazione per le piattaforme AI di nuova generazione e che il lancio coincide con la prima ondata di server compatibili con Gen6, prevista per il prossimo anno.
Perché PCIe Gen6 è importante
Il PCIe Gen6 raddoppia la velocità di segnalazione per corsia a 64 GT/s utilizzando PAM4, il che porta la larghezza di banda a circa 32 GB/s in ciascuna direzione sul collegamento SSD x4 standard, rispetto ai circa 16 GB/s del Gen5. Le unità Gen5 si sono scontrate con questo limite per un po' di tempo, con i modelli più veloci che si attestano nell'intervallo di 14-14.5 GB/s consentito dall'interfaccia.
La velocità nominale di 28.4 GB/s del PM1763 sfrutta gran parte del nuovo margine di prestazioni e, per le infrastrutture AI, l'effetto pratico è che sono necessarie meno unità per saturare il percorso di archiviazione di un server GPU, mentre le operazioni di checkpoint e caricamento dei modelli impiegano meno tempo a bloccare gli acceleratori. Samsung lo spiega in termini di modello, affermando che un LLM da 40 GB può essere trasferito dall'unità alla memoria in circa 1.4 secondi, contro i circa 2.7 secondi del PM1753. Il valore di 1.4 secondi si riferisce alla velocità di lettura sequenziale di un file da 40 GB, non a un trasferimento misurato, quindi va considerato come un esempio del caso migliore per quanto riguarda i calcoli dell'interfaccia.
Le prestazioni casuali scalano di pari passo con quelle sequenziali. I materiali di prodotto di Samsung indicano fino a 6.8 milioni di IOPS in lettura casuale e 950,000 IOPS in scrittura casuale per la configurazione da 16 TB; il dato di 6.92 milioni di IOPS per unità misurato nel white paper SCADA (di cui si parlerà più avanti) suggerisce che la cifra relativa alla lettura sia prudente.
L'efficienza energetica migliora fino a 1.8 volte rispetto alla generazione precedente, un aspetto importante quanto la velocità pura nelle implementazioni ad alta densità, poiché i controller Gen6 generano calore e ogni watt risparmiato per unità si moltiplica in uno chassis denso. A tal proposito, Samsung ha ottimizzato il PM1763 per server con raffreddamento a liquido e raffreddamento diretto al chip (D2C), puntando a prestazioni di picco costanti sotto carico prolungato piuttosto che a valori di picco elevati.
Specifiche PM1763
| Specificazione | Samsung PM1763 |
|---|---|
| Panoramica della piattaforma | |
| Interfaccia | PCIe Gen6 x4, NVMe 2.1, OCP 2.6 |
| NAND | V-NAND di nona generazione di Samsung |
| Controller | Nuovo controller Samsung a 4 nm |
| Capacità | Disponibili al lancio modelli da 4 TB, 8 TB e 16 TB (15.36 TB formattati). Nella pagina del prodotto sono elencate le opzioni da 30.72 TB e 61.44 TB. |
| Fattori di forma | E1.S E3.S U.2 (solo PCIe Gen5) |
| Prestazioni (16 TB) | |
| Lettura sequenziale | Fino a 28,400 MB / s |
| Scrittura sequenziale | Fino a 21,000 MB / s |
| Lettura casuale | Fino a 6,800,000 IOPS |
| Scrittura casuale | Fino a 950,000 IOPS |
| Alimentazione e raffreddamento | |
| Efficienza energetica | Miglioramento fino a 1.8 volte superiore rispetto al PM1753 |
| Raffreddamento | Ottimizzato per server con raffreddamento a liquido, direct-to-chip (D2C) |
| Sicurezza | |
| Caratteristiche | Crittografia post-quantistica (PQC) Protocollo di sicurezza dell'interfaccia del dispositivo TEE (TDISP) |
I/O gestito dalla GPU: 281 milioni di IOPS su 42 unità
Samsung ha inoltre pubblicato un white paper che abbina il PM1763 a SCADA (Scaled Accelerated Data Access), il framework sviluppato da NVIDIA che consente ai thread della GPU di inviare comandi NVMe direttamente alle unità, bypassando completamente la CPU e lo stack di storage del kernel. Il vantaggio dell'I/O avviato dalla GPU risiede nella concorrenza: una CPU può gestire circa 45 milioni di IOPS contemporaneamente attraverso il suo pool di thread, mentre una GPU che gestisce circa 100,000 thread ha superato i 95 milioni di IOPS per GPU nei test di Samsung.
I dati provengono da un carico di lavoro di lettura casuale di 512 byte su un server H3 Falcon 6048 Gen6 con un H100, due H200 e 42 unità PM1763 E1.S da 15.36 TB dietro tre switch Broadcom PEX90144 Gen6. Una singola unità PM1763 ha elaborato circa 6.92 milioni di IOPS emessi dalla GPU, un aumento dell'86% rispetto ai 3.72 milioni gestiti dalla PM1753 Gen5 nella stessa configurazione. Con 14 unità per GPU, il sistema ha mantenuto una scalabilità quasi lineare a circa 96 milioni di IOPS per gruppo di GPU e la configurazione completa di 42 unità ha aggregato 281 milioni di IOPS, con risultati per unità che sono rimasti entro il 5% del picco della singola unità. Non abbiamo condotto questo test, né abbiamo verificato in modo indipendente i risultati, ma il comportamento di scalabilità è interessante: la coerenza della latenza tra le unità, e non il picco di IOPS, ha determinato la tenuta complessiva.
Cosa offre Gen6 ai server di archiviazione ad alta densità
La domanda è cosa possa fare un insieme di queste unità all'interno di un singolo chassis. Recentemente abbiamo spinto il Dell PowerEdge R7725xd oltre i 300 GB/s di throughput locale con 24 SSD Gen5, ciascuna unità su corsie x4 dedicate provenienti dal complesso CPU, e abbiamo fornito 160 GB/s sulla rete con il software PEAK:AIO che manteneva le code sature. Questo sistema rivaleggia con cluster di storage multi-nodo in un singolo chassis 2U. Sostituendo le unità con unità Gen6 alle velocità nominali del PM1763, la stessa topologia a 24 alloggiamenti offre un limite teorico di circa 681 GB/s di larghezza di banda di lettura grezza, anche se i limiti imposti dalle linee della CPU e dal traffico di rete in uscita diventano i vincoli principali ben prima delle unità stesse.
La densità di capacità si evolve di pari passo. Il server dati AI 2U di PEAK:AIO offre già 1.5 PB utilizzando unità QLC da 61.44 TB e garantendo una velocità di 120 GB/s tramite RDMA. Quando Samsung commercializzerà il PM1763 da 61.44 TB, questa classe di sistemi raggiungerà la larghezza di banda Gen6 e una densità superiore al petabyte in un ingombro simile (i server di prossima generazione probabilmente includeranno un'unità rack per il raffreddamento). Per le aziende che si occupano di intelligenza artificiale e che cercano di alimentare cluster GPU senza dover implementare un file system parallelo su una dozzina di nodi, l'argomento a favore di un singolo server per lo storage diventa sempre più convincente.
Sicurezza e disponibilità
Samsung ha inoltre esteso lo stack di sicurezza dell'unità per gli ambienti AI multi-tenant. Il PM1763 supporta algoritmi di crittografia post-quantistica in previsione di futuri attacchi quantistici alla crittografia classica, nonché il protocollo TDISP (TEE Device Interface Security Protocol), che protegge il percorso dati tra le macchine virtuali riservate e il dispositivo nelle implementazioni virtualizzate.
"Basato su prestazioni leader del settore, PM1763 ha completato con successo la validazione per le piattaforme AI di nuova generazione ed è ben posizionato per supportare i requisiti infrastrutturali AI in continua evoluzione", ha dichiarato Jangseok Choi, Vicepresidente e Responsabile della pianificazione dei prodotti di memoria presso Samsung Electronics. "Con la continua crescita in dimensioni e complessità dei modelli AI, PM1763 si affermerà come soluzione chiave che consentirà ai clienti di scalare in modo efficiente la capacità di memoria e ottimizzare le operazioni AI."
Il PM1763 è attualmente in produzione di massa nei tagli da 4 TB, 8 TB e 16 TB. Samsung non ha ancora annunciato le date di spedizione per i tagli di capacità maggiore.




Amazon