Solidigm D7-PS1030 是該公司首款 PCIe 5.0 資料中心系列固態硬碟的中階產品,它與 D7-PS1010 共享平台,擁有 3 DWPD 的讀寫速度等級和高達 800 萬 IOPS 的隨機寫入性能上限,是其標準兩倍型同級系列產品 400 萬耐用 IOPS 的耐用性上限。此系列產品容量從 1.6TB 到 12.8TB 不等,支援 E3.S 和 U.2 接口,採用 176 層 TLC NAND 閃存,額定順序讀取速度高達 14,500 MB/s,順序寫入速度高達 10,000 MB/s。 Solidigm 的目標應用場景是寫入密集型和混合型工作負載,例如 OLTP、元資料日誌記錄、高效能運算 (HPC) 以及 AI/ML 管線等,這些場景對寫入壓力要求極高。我們評測的這款產品是 12.8TB 的 E3.S 型號。

Solidigm D7-PS1030 12.8TB,E3.S 7.5mm 機身。
這並非我們首次使用這款硬碟;然而,這是我們首次對單塊硬碟進行基準測試。在戴爾 PowerEdge XE7740 伺服器上,我們使用了八個相同的 12.8TB 硬碟作為快閃記憶體層,進行 KV 快取卸載測試。測試中,該陣列能夠全天候持續進行 1.9GB/s 的 KV 寫入,在鏡像模式下,每塊硬碟每天的寫入量約為 3.2 次;而在 RAID 0 條帶化模式下,則約為 1.6 次/天的寫入量。這正是 PS1030 3 DWPD 額定值所針對的負載範圍:KV 卸載是一種以耐用性而非容量或峰值速度為關鍵限制的工作負載。而那些在第五代產品中佔據主導地位的讀取密集型硬碟,如果承擔同樣的任務,其 1 DWPD 的寫入量將會迅速耗盡。

PS1030 位於 Dell PowerEdge XE7740 前面,用於我們的 KV 快取卸載測試。
Solidigm 12.8TB 容量的這款硬碟,標稱 4K 隨機讀取 IOPS 為 2.75 萬,隨機寫入 IOPS 為 800 萬,而該系列硬碟的 3.1 萬隨機讀取峰值則位於容量較低的版本中。其典型工作功耗為 23W,空閒功耗為 5W,與第五代硬碟 (Gen5) 的水平相當,並提供 5W 至 25W 的五種可配置功耗狀態,以滿足不同用戶在固定機架預算下的需求。 Solidigm 也提出了兩項值得注意的額外聲明:與同類硬碟相比,其能源效率提升高達 70%,並且在整個使用壽命期間 IOPS 穩定性高達 90%。此外,此硬碟的耐用性也更強;在三年內,其 DWPD(每日寫入量)可達 4.98,而 12.8TB 型號的雙向寫入量額定為 70PB。可靠性規格符合此等級標準:2.5萬小時平均故障間隔時間 (MTBF)、五年保修,以及通過 UBER Solidigm 1E-18 測試。安全選項包括 TCG Opal 2.02 SED 微調、FIPS 140-3 2 級認證硬體、OCP 標準安全啟動和韌體簽名,以及裝置認證和金鑰撤銷。

在 E3.S 戴爾托架中。
Solidigm D7-PS1030 技術規格
| 規格 | Solidigm D7-PS1030(12.8TB E3.S,系列產品已註明) |
|---|---|
| 平台概述 | |
| 容量 | 1.6TB 3.2TB 6.4TB 12.8TB(經測試) |
| 形狀因素 | E3.S 7.5mm(經測試) U.2 15毫米 |
| 介面/協定 | PCIe 5.0 x4,NVMe |
| NAND閃存 | Solidigm 176層TLC 3D NAND |
| 性能(最高可達,廠商評級) | |
| 順序讀取(128K) | 14,500 MB/s(家庭裝) |
| 順序寫入(128K) | 10,000 MB/s(家庭裝) |
| 隨機讀取 (4K) | 2,750K IOPS (12.8TB) 最高可達 3,100K IOPS(系列峰值) |
| 隨機寫入 (4K) | 800K IOPS |
| 力量與耐力 | |
| 電源(活動/空閒) | 23瓦(典型值)/ 5瓦(典型值) 五種可配置功率狀態,5W 至 25W |
| 耐力 | 3.0 DWPD(三年期) 4.98 DWPD(三年期) 70 PBW,12.8TB |
| 可靠性與安全性 | |
| MTBF / UBER | 經測試達到 1E-18 |
| 安全性 | TCG Opal 2.02(SED 變異) 符合 FIPS 140-3 二級認證標準 OCP 標準安全啟動和韌體簽名 設備認證,金鑰撤銷 |
| 保固 | 5年 |

PS1030 單元在 E3.S 中;此系列產品也在 U.2 中發售。
Solidigm D7-PS1030 效能
以下圖表說明的是,PS1030 在我們的對比評測中扮演著混合用途硬碟的角色,與近期主導第五代硬碟評測的讀取密集型硬碟形成鮮明對比。與我們六月評測的KIOXIA CD9P-R相比,PS1030 的順序讀取速度略遜一籌(14,500 MB/s 對 14,800 MB/s),但隨機寫入速度幾乎翻了一番(800K IOPS 對 450K IOPS),寫入預算更是三倍對 1 DWPD 預算)。它在該組產品中最接近的競爭對手是Micron 7600 MAX,後者也是 3 DWPD 的硬碟。而 Micron 9550 MAX 則以與 PS1030 相同的 12.8TB 容量,在混合用途性能方面與之競爭。
路測平台
在本次評測中,我們使用一台執行 Ubuntu 22.04.2 LTS 的戴爾 PowerEdge R760 伺服器作為所有工作負載的測試平台。該伺服器配備了 Serial Cables Gen5 JBOF 接口,可廣泛相容於 U.2、E1.S、E3.S 和 M.2 固態硬碟。我們的系統配置如下:
- 2 個英特爾至強金牌 6430(32 核,2.1GHz)
- 16 個 64GB DDR5-4400
- 480GB 戴爾 BOSS 固態硬碟
- 串行電纜 Gen5 JBOF
- 英偉達 L4
驅動器比較
- KIOXIA CD9P-R 7.68TB (1 DWPD)
- 鎧俠 CM9-R 15.36TB (1 DWPD)
- SanDisk DC SN861 7.68TB (1 DWPD)
- 固力 PS1010 7.68TB (1 DWPD)
- Micron 7600 MAX 6.4TB (3 DWPD)
- Micron 9550 MAX 12.8TB (3 DWPD)
- Micron 9550 Pro 7.68TB (1 DWPD)
DLIO 檢查點基準
為了評估固態硬碟在人工智慧訓練環境中的實際效能,我們使用了資料與學習輸入/輸出(DLIO)基準測試工具。 DLIO 由阿貢國家實驗室開發,專門用於測試深度學習工作負載中的 I/O 模式。它能夠深入了解儲存系統如何處理諸如檢查點、資料攝取和模型訓練等挑戰。
下表顯示了每塊硬碟在三次測試中的平均檢查點完成時間;數值越低越好。需要注意的是:每次運行的檢查點數量與硬碟容量成正比,因此容量更大的硬碟會記錄更多檢查點,不同容量硬碟的每次檢查點結果並不完全相同。因此,我們發布的是每次測試的平均值,將每塊硬碟的運行結果標準化為一個可以直接比較的數值。在訓練機器學習模型時,檢查點對於定期保存模型狀態至關重要,可防止在中斷或斷電期間失去訓練進度。這種儲存需求需要強大的效能,尤其是在持續或高強度工作負載下。我們使用了 2024 年 8 月 13 日發布的 DLIO 基準測試 2.0 版本。
為了確保我們的基準測試能夠反映真實場景,我們基於 LLAMA 3.1 405B 模型架構進行了測試。我們使用 torch.save() 實作了檢查點機制,用於擷取模型參數、最佳化器狀態和層狀態。我們的設定模擬了一個八 GPU 系統,採用了混合平行策略,將四路張量並行和雙路管線並行處理分佈在八個 GPU 上。這種配置產生了 1,636GB 的檢查點大小,符合訓練現代大型語言模型的需求。
| 雲端硬碟 | 第三次通過平均成績(秒) | 第三次通過平均成績(秒) | 第三次通過平均成績(秒) |
|---|---|---|---|
| SanDisk DC SN861 7.68TB | 461.3 | 558.6 | 553.3 |
| Micron 9550 MAX 12.8TB | 462.8 | 558.9 | 555.3 |
| Micron 9550 Pro 7.68TB | 461.4 | 577.9 | 559.7 |
| 固力 PS1010 7.68TB | 458.8 | 561.1 | 564.6 |
| Micron 7600 MAX 6.4TB | 464.2 | 581.5 | 567.3 |
| KIOXIA CD9P-R 7.68TB | 464.7 | 575.6 | 570.6 |
| 鎧俠 CM9-R 15.36TB | 462.8 | 571.9 | 580.9 |
| 固力 PS1030 12.8TB | 462.3 | 578.0 | 599.2 |
從平均測驗成績來看,Solidigm PS1030 在第一輪測驗中以 462.3 秒的成績位列榜首,所有對比產品的平均成績都集中在 459 秒到 465 秒之間,相差約 1 秒。之後,PS1030 的成績開始提升。在第二輪測試中,PS2 的成績達到 578.0 秒,處於 SanDisk SN861(558.6 秒)到 Micron 7600 MAX(581.5 秒)之間的較高水準。到了第三輪測試,PS3 的平均成績更是達到了 599.2 秒,成為對比產品中的最高平均成績,而其他產品的成績則介於 SN861(553.3 秒)和 KIOXIA CM9-R(580.9 秒)之間。
PS1030 自身的檢查點日誌顯示了這種偏差的趨勢。 PS1030 的檢查點開啟時間為 465.3 秒,在第 5 個檢查點之前一直保持在 461 秒左右,之後開始加速。一旦加速,其檢查點開啟時間大約在 553 秒到 593 秒之間波動,第 12 個檢查點的關閉時間為 614.7 秒,而其最新的檢查點最高達到了 629.0 秒。這結果與該硬碟已知的弱點一致,而非新的弱點:DLIO 檢查點操作正是 128K 單工作 FIO 測試所標記的那種大批量順序寫入突發。差距確實存在,但範圍有限,與 KIOXIA CD9P-R 在 Pass 3 測試中的平均表現相比,差距約為 5%,而且 PS1030 的性能在各個測試階段都呈現出可預測的波動,而非劇烈變化。
FIO性能基準
為了衡量每個 SSD 在常見產業指標上的儲存效能,我們利用了 FIO。每個 SSD 都經過相同的測試流程,其中包括一個預處理步驟:使用順序寫入工作負載對硬碟進行兩次全碟填充,然後進行穩態效能測量。隨著每種被測工作負載類型的變化,我們會根據新的傳輸大小再次進行預處理填充。
在本節中,我們將重點放在以下 FIO 基準:
- 128K 連續
- 64K隨機
- 16K 連續
- 4K隨機
128K 順序寫入(IODepth 16/NumJobs 1)
在128K穩態順序寫入測試中,PS1030與其他固態硬碟相比略顯遜色。此硬碟的寫入速度為6,370.3 MB/s,延遲為313.7 µs,是同組產品中頻寬最低、延遲最高的,甚至落後於讀取密集型固態硬碟KIOXIA CD9P-R的6,912.4 MB/s。 Micron 9550 MAX以10,957.9 MB/s的寫入速度領先,9550 Pro以10,354.6 MB/s緊隨其後,KIOXIA CM9-R則以8,668.1 MB/s位列第三。 PS1030 的兄弟產品 PS1010(7,126.5 MB/s)和 SanDisk DC SN861(7,116.5 MB/s)處於中間位置,而 Micron 7600 MAX 的速度為 6,960.6 MB/s。
值得注意的是:這是一個單任務工作負載,而 PS1030 的寫入架構旨在分散工作負載,而非追求單次寫入的效率。下面的隨機寫入部分顯示,引入並行處理後,同一塊硬碟能夠處理更多的數據,這與目標工作負載產生的存取模式相符。
128K 順序讀取(IODepth 64 / NumJobs 1)
讀取效能測試結果截然相反。 PS1030 的讀取速度為 14,156.4 MB/s,耗時 564.8 µs,與同系列的 PS1010(14,163.3 MB/s)基本持平,與領先的 CD9P-R(14,235.9 MB/s)僅相差 0.6%。 Micron 9550 Pro(14,050.1 MB/s)和 9550 MAX(14,047.5 MB/s)緊隨其後,五款硬碟的讀取速度均在 200 MB/s 的範圍內,達到了 Gen5 介面的極限。 SN861 以 12,631.2 MB/s 的速度位列第三,7600 MAX 為 11,240.5 MB/s,而寫入性能強勁的 CM9-R 在此次單任務配置下排名墊底,速度僅為 9,974.6 MB/s。對於一款以寫入預算為賣點的硬碟來說,在大塊讀取方面沒有絲毫妥協,這才是該圖表中真正的亮點。
64K 隨機寫入
PS1030 的真正實力體現在 64K 隨機寫入測驗中。該硬碟的峰值寫入速度達到 7,224.0 MB/s,在同組產品中排名第四,落後於 Micron 9550 MAX (10,878.1 MB/s)、KIOXIA CM9-R (9,635.3 MB/s) 和 Micron 9550 Pro (9,069.4635. MB/s) 和其他所有產品。 PS1030 的獨特之處在於其峰值出現的位置:在 IODepth 2 / NumJobs 2 的條件下,延遲僅為 34.3 µs,而大多數產品需要更深的隊列才能達到最佳性能。該硬碟幾乎立即達到飽和,然後在剩餘的測試過程中保持平穩,這正是全天候中等並發運行的穩定寫入層所需要的特性。與同系列產品相比,PS1010 的差距也體現在其續航力上,這在性能方面也體現得淋漓盡致:PS1010 的峰值讀寫速度為 5,873.9 MB/s,比 PS1030 低 23%。
在延遲方面,PS1030 在 IODepth 1 / NumJobs 1 時啟動延遲為 21.1 µs,僅次於 CM9-R 的 18.4 µs,其在整個測試過程中的最差延遲為 2,831 µs,不到 PS1010 峰值延遲 5,987 µs 的一半。 9550 MAX 在高併發情況下表現最佳,最高延遲僅 1,714 µs。
64K 隨機讀取
PS1030 取得了該組最佳的 64K 隨機讀取峰值速度,達到 14,162.9 MB/s(IODepth 32 / NumJobs 8),略高於 Micron 9550 Pro(14,049.9 MB/s)、9550 MAX(14,049.76499.76995099(10099.763)(1099.763)(1099. CM9-R 的速度為 13,402.4 MB/s,CD9P-R 的速度為 12,036.0 MB/s,則落後一些。低隊列深度方面,KIOXIA 光碟機表現出色,正如我們在 CD9P-R 評測中看到的那樣:CM9-R 在 IODepth 1 / NumJobs 1 的設定下,初始速度為 1,359.0 MB/s,CD9P-R 為 1,334.0 MB/s,微延遲為 450383 107.03 秒的速度約為 450373。 MB/s,延遲為 81.0 微秒,處於中等水平。 PS1030 的優點在於其擴充性,而非單流響應速度。
16K 順序寫入
關於測驗本身的說明:從本次對比組開始,我們的 16K 讀寫測驗採用的是順序讀寫而非隨機讀寫,這種工作負載我們曾在Micron 9550 MAX 的評測中首次使用過。中等規模的順序讀寫流更能代表這些硬碟在生產環境中的實際應用,尤其是在 AI 管線中,這類管線會依序輸入訓練數據,輸出中間結果,並依序為推理層級提供數據,而不是將隨機讀寫資料分散到整個硬碟上。
與隨機掃描相比,測試結果重新排列了各款固態硬碟的排名。 Micron 9550 MAX 以 10,970.8 MB/s 的速度領先(IODepth 32 / NumJobs 4),KIOXIA CM9-R 緊隨其後,速度為 10,812.2 MB/s,而 9550 Pro 位列第三,速度為 9,772.8 MBs。 PS1030 的最高速度為 5,977.7 MB/s(IODepth 8 / NumJobs 4),排名第七,領先速度為 5,772.5 MB/s 的 SanDisk DC SN861,略低於其同系列產品 PS1010 的 6,271.7 MB/s。不過,掃描曲線的形狀與隨機測試的結果一致:PS1030 在 IODepth 2 / NumJobs 4 時速度已達到 5,856.7 MB/s,延遲為 21.1 µs,之後在矩陣的其餘部分保持了大約 4,700 到 6,000 MB/s 的平穩區間。其單一工作延遲為 10.9 µs,與 CM9-R (10.4 µs) 和 CD9P-R (11.0 µs) 並列領先,遠低於 Micron 的 15.1 到 17.8 µs。對於一款以寫入為主的硬碟來說,這樣的速度上限並不算高,但它實現了極低的佇列深度和微秒級的延遲,這正是持續快取或暫存層運作的理想狀態,也是我們在 KV 快取部署中連續數週進行順序寫入測試時所採用的效能指標。
16K 順序讀取
在讀取速度方面,KIOXIA CD9P-R 以 13,819.7 MB/s 的速度領先,CM9-R 以 13,393.2 MB/s 的速度緊隨其後,Micron 9550 Pro 以 13,273.5 MB/s 的速度位列第三。 PS1030 的峰值速度為 11,142.8 MB/s(IODepth 16 / NumJobs 8),耗時 179.1 µs,在該組中排名第七,僅高於 SN861 的 10,995.0 MB/s,略遜於其同系列 SN861 的 10,995.0 MB/s,略遜於其同系列 18615.165 165, 五分之一。單流讀取的情況也與隨機讀取的情況相反:在有序的 16K 讀取操作中,SN861 的初始讀取時間為 12.5 微秒,Micron 的讀取時間在 13.9 到 21.3 微秒之間,而 PSidigm 平台的初始讀取時間接近 59 微秒,這與 PS4 系列讀取中的低鍵讀取時間接近 59 微秒。中等大小的讀取操作仍然是該平台效能最弱的環節;AI 管線中的串流讀取環節更適合讀取密集型應用,但這並非該硬碟的設計初衷。
4K 隨機寫入
PS1030 是一款 3 DWPD 固態硬碟,其效能表現令人矚目。在 IODepth 16 / NumJobs 8 的條件下,其峰值 IOPS 達到 1,595.8K,在同級產品中排名第二,僅次於同樣採用 3 DWPD 的 Micron 7600 MAX(1,781.2K),領先於 9550 MAX (1,5474.1941941999950 MAX ( (1,502.9K)、9550 Pro (1,467.6K)、SN861 (1,438.3K) 和 CD9P-R (1,273.1K)。此峰值實測值是其標稱值 800K 的兩倍,Solidigm 官方標稱的標稱值是在固定隊列深度下測得的;而穩態掃描測試則顯示其性能更高。
延遲表現足以證明這一點。 PS1030 在 IODepth 1 時啟動時間為 8.8 微秒,與 CM9-R (8.2 微秒) 和 PS1010 (8.3 微秒) 並列領先,其峰值吞吐量僅為 79.8 微秒,且在整個測試過程中從未超過 359.6 微秒。相較之下,PS1010 需要 IODepth 32 / NumJobs 16 才能達到 339.7 微秒的峰值,最壞情況下延遲高達 735.6 微秒。對於這款硬碟的目標應用場景——OLTP 日誌和鍵值快取類型的流量——而言,寫入時間在個位數微秒級、上限低於 400 微秒的小資料寫入才是關鍵所在。
4K 隨機讀取
PS1030 的寫入性能與其在 4K 隨機讀取性能上的出色表現相符,其 4K 隨機讀取峰值達到了該組第二好的性能:在 IODepth 16 / NumJobs 16 和 112.8 µs 下達到 2,255.8K IOPS,僅次於 SanDisk SN861K 的 2,555.6K MAX (2,217.6K IOPS) 和 CD9P-R (2,165.0K IOPS)。在 IODepth 1 / NumJobs 1 的測試條件下,KIOXIA 的低延遲特性再次領先:CM9-R 為 29.3 微秒,CD9P-R 為 30.4 微秒,而 PS1030 的 56.8 微秒則位居榜首,超越了其同秒數產品以及兩款 9550 微秒(9550 微秒)(65 微秒 861.微秒)。在這樣一個以讀取為主的測試環境中,一款混合用途的固態硬碟能夠在 4K 讀取和 67.8K 寫入峰值上均位列第二,完美地完成了其任務描述中的兩部分。
GPU直接儲存
我們在這個測試台上進行的測試之一是 Magnum IO GPU 直接儲存 (GDS) 測試。 GDS 是 NVIDIA 開發的功能,可讓 GPU 在存取儲存在 NVMe 磁碟機或其他高速儲存裝置上的資料時繞過 CPU。 GDS 不再透過 CPU 和系統記憶體來路由數據,而是實現了 GPU 和儲存設備之間的直接通信,從而顯著減少了延遲並提高了數據吞吐量。
GPU 直接儲存的工作原理
傳統上,當 GPU 處理儲存在 NVMe 磁碟機上的資料時,資料必須先經過 CPU 和系統內存,才能到達 GPU。由於 CPU 充當了中間環節,這個過程會造成瓶頸,增加延遲並消耗寶貴的系統資源。 GPU 直接儲存技術使 GPU 能夠透過 PCIe 總線直接從儲存裝置存取數據,從而消除了這種低效率。這種直接路徑減少了資料移動開銷,從而實現了更快、更有效率的資料傳輸。
人工智慧工作負載,尤其是涉及深度學習的工作負載,是高度資料密集的。訓練大型神經網路需要處理 TB 級的數據,資料傳輸中的任何延遲都可能導致 GPU 利用率不足和訓練時間更長。 GPU 直接儲存透過確保資料盡快傳輸到 GPU、最大限度地減少空閒時間並最大限度地提高運算效率來解決這一挑戰。
此外,GDS 對於涉及串流大型資料集的工作負載特別有利,例如視訊處理、自然語言處理或即時推理。透過減少對 CPU 的依賴,GDS 可以加速資料移動並釋放 CPU 資源用於其他任務,從而進一步增強整體系統效能。
GDSIO 順序讀取吞吐量
在 16K 區塊大小的讀寫速度區間,PS1030 單執行緒讀寫速度約為 0.2 GiB/s,是該組產品中最低的入門級配置,這與其 71.6 µs 的單執行緒 GDS 讀取延遲相符(其同系列產品為 71.1 µs,與我們在 CD9P-R 測時所提及的平台相同評論特性。在中端讀寫速度區間,PS1030 的效能穩定提升,在 1.6K/128 區塊大小下達到約 16 GiB/s,而 KIOXIA 的兩款產品則以接近 2.0 GiB/s 的速度保持領先。 KIOXIA 的這種線程性能優勢也延續到了 128K 塊大小區間,CD9P-R 和 CM9-R 在 128K/16 塊大小下遙遙領先,而 PS5.0 則與主流產品持平,在 128K/64 塊大小下達到約 4.7 GiB/s,在 128/128 月。
在 1M 讀寫速度段,各款顯示卡的效能趨於一致。 PS1030 的峰值讀寫速度達到 5.95 GiB/s (1M/32),與 CD9P-R 的最佳成績 6.16 GiB/s 僅相差 3.5%。 CM9-R 的讀寫速度為 6.06 GiB/s,PS1010 和 9550 MAX 為 6.05 GiB/s,9550 Pro 為 5.97 GiB/s。 7600 MAX 墊底,讀寫速度為 5.59 GiB/s。在 16K IOPS 峰值測試中,KIOXIA 的兩款顯示卡表現最佳(CM9-R 為 136.4K,CD9P-R 為 134.2K),而 PS1030 的 101.2K 則是所有顯示卡中最低的;小塊 GPU 直接讀取並非該平台的強項。
GDSIO 順序寫入吞吐量
PS1030 的寫入掃描圖是買家應該重點研究的圖表,因為它既展現了這款硬碟的最佳效能,也暴露了它唯一的不足之處。在 16K 記憶體容量下,所有八款硬碟的寫入速度都集中在 0.5 到 1.5 GiB/s 的區間內,PS1030 的單線程寫入延遲為 22.3 µs,與兩款 KIOXIA 硬碟(均為 21.4 µs)及其同系列產品(21.9 µs)並列領先。在 128K 記憶體容量下,PS1030 的寫入速度在 128K/32 位元時平穩提升至約 3.95 GiB/s,之後便急劇下降:在 128K/64 位元時約為 2.35 GiB/s,在 128K/128 位元時約為 2.35 GiB/s,在 128K/128 位元時約為 1.55 位時約為同等級。這與我們在 CD9P-R 評測中記錄的 PS1010 高線程數寫入崩潰問題相同,在 PS1030 上幾乎完全復現(PS1010 在相同線程數下寫入速度分別降至 2.5 GiB/s 和 1.65 GiB/s)。導致這一問題的原因在於平臺本身,而非耐久性層,它仍然是資料集中最顯著的缺陷。
1M 容量段的效能有所下降,但並未改變其整體趨勢。 PS1030 在 1M/8 容量下峰值達到 4.22 GiB/s,僅高於其同系列產品 4.17 GiB/s,隨後在 1M/128 容量下回落至約 3.35 GiB/s。 CM9-R 的性能曲線在該組中最為穩定,峰值達到 5.51 GiB/s。 9550 MAX 的峰值達到 5.69 GiB/s,但其性能波動較大,在 1M/64 容量下跌至接近 2.2 GiB/s。 9550 Pro (5.54 GiB/s)、7600 MAX (5.44 GiB/s)、CD9P-R (4.86 GiB/s) 和 SN861 (4.59 GiB/s) 依序排列。 PS1030 的目標使用者群體有福了:KV 快取和日誌式資料層級的寫入操作通常以適中的執行緒數進行,此時 PS1030 的表現無可挑剔,而當機則發生在 64 個以上的 GPU 直接寫入執行緒上。我們自己的 KV 快取部署方案中,八塊這樣的硬碟連續運作數週,陣列從未出現瓶頸。但任何計劃在該平台上進行大量多執行緒 GDS 寫入流的用戶,都應該先對他們的特定操作模式進行基準測試。
結語
Solidigm D7-PS1030 能夠勝任中等耐用性第五代固態硬碟的預期任務,數據顯示它擁有獨特的性能。其亮點在於並行小塊資料處理:在 4K 隨機寫入(1,595.8K IOPS,僅次於同為 3 DWPD 的 Micron 7600 MAX)和 4K 隨機讀取(2,255.8K IOPS)方面均位列同組第二,64K 隨機讀取(2,255.8K IOPS)方面均位列同組第二,64K 隨機讀取速度高達 14,162.14,162順序讀取速度更是達到了第五代固態硬碟的滿速,達到 14,156.4 MB/s。同樣令人矚目的是它實現這些性能的方式:在 IODepth 2 或 NumJobs 8 時即可達到峰值性能,延遲僅為幾十微秒,而競爭對手則需要使用深度隊列,並為此付出了額外的延遲代價。此硬碟早期即可達到飽和狀態,保持平穩,且其最壞情況下的寫入延遲僅為同系列產品 PS1010 的一半。

XE7740 硬碟位元用於我們 KV 快取卸載工作中的八磁碟位元 PS1030 層。
然而,凡事皆有取捨。單執行緒128K順序寫入測試在所有測試產品中排名墊底,速度僅6,370.3 MB/s;而DLIO檢查點測試(此測試正是針對這種模式),其第三階段平均耗時599.2秒,在所有測試產品中最高。 16K順序寫入和讀取測試也都落後於其他產品,寫入峰值速度為5,977.7 MB/s,讀取峰值速度為11,142.8 MB/s,均在八款產品中排名第七。 GDSIO寫入測試幾乎完全復現了PS1010在高線程128K模式下的速度下降,證實這是一種平台特性而非個例;小塊GPU直接讀取測試也明顯優於KIOXIA硬碟。儘管如此,這些測試結果並未削弱PS1030的整體效能,但卻凸顯了其缺點:PS3並不適合單流資料擷取。
這款硬碟的設計用途已在比任何基準測試都更長的測試中得到驗證。在我們的 XE7740 推理測試中,八塊這樣的硬碟作為 KV 快取卸載層運行了數週,持續承受著 1.9 GB/s 的全天候寫入,佔空比略高於其 3 DWPD 的額定值,但該層從未成為瓶頸。基準測試資料解釋了其成功的原因:早期飽和的寫入行為、低佇列深度下個微秒的 4K 寫入延遲以及可控的延遲上限,正是持續寫入的快取或日誌層所需要的特性。 PS1030 適用於耐久性強、對延遲敏感、中等並發寫入工作負載、KV 快取卸載、OLTP 日誌記錄和元資料層,其 3 DWPD 的預算和 4.98 DWPD 的三年期選項使其能夠運行超出讀取密集型硬碟適用範圍的佔空比。




Amazon