三星新款 990 SSD 作为一款主流 PCIe Gen4 固态硬盘加入消费级产品线,它优先考虑能效和性价比而非极致速度。三星称其为迄今为止能效最高的 SSD,声称其能效比同类产品提升高达 38%。 990 PRO2TB 型号的顺序读取速度为 7,250MB/s,顺序写入速度为 6,450MB/s,随机 I/O 读取速度最高可达 850K IOPS,随机写入速度最高可达 1,200K IOPS。1TB 型号的性能略有下降,顺序读取速度为 7,150MB/s,随机读取速度为 700K IOPS,随机写入速度为 1,100K IOPS。该硬盘提供 1TB 和 2TB 两种容量,建议零售价分别为 269.99 美元和 529.99 美元。
这个名字需要简单解释一下。三星990系列已经包括了990 PRO、990 EVO和990 EVO Plus。这款名为“990”的产品现在作为入门级固态硬盘与它们并列,而不是开启新的产品线。它采用三星自研控制器和V-NAND闪存(稍后会详细介绍),采用无DRAM设计,依靠主机内存缓冲。它的质保为三年,而PRO系列则为五年。在1TB和2TB容量下,它的写入量分别为400TB和800TB。顺序读取速度与990 EVO Plus相同,均为7,250MB/s,但低于990 PRO的7,450MB/s。随机读取速度为850万IOPS,远低于PRO的1,400万IOPS。三星的卖点主要集中在两个数据上:顺序写入速度比 990 EVO 快 50% 以上,能效提升 38%;在三星内部测试中,2TB 读取速度达到每瓦 1,6865MB/s,而 990 PRO 的读取速度为每瓦 1,221MB/s。那些优先考虑极致速度的买家已经拥有三星第五代9100 PRO系列硬盘(我们曾在发布时评测过该系列,之后又评测了8TB 版本),因此 990 的目标并非直接与这些硬盘竞争。
三星此前也曾走过这条路。其首款无DRAM的消费级NVMe固态硬盘980于2021年送测,但表现不佳。尤其是小容量版本,在我们的测试榜单上垫底,这款硬盘也因此饱受实验室同事的嘲讽。然而,自那以后,市场发生了翻天覆地的变化。人工智能的快速发展消耗了大量的NAND和DRAM供应,组件价格不断攀升,消费者普遍感受到了成本压力。在这样的环境下,一款具备稳定顺序读写速度、低功耗和不错容量的第四代固态硬盘,如果市场价格合适,就显得颇具吸引力。
三星拒绝透露的一项具体规格是NAND闪存本身。评测指南中只列出了“三星V-NAND”。当我们直接询问时,该公司表示无法透露官方规格以外的组件细节,并让我们关注其额定性能和“最新的三星V-NAND技术”。因此,我们只能从字里行间推断,而这些字里行间指向的是TLC而非QLC。耐久性规格是关键:三年质保下400TB和800TB的写入量,相当于每年约133TB和267TB的写入量,与990 PRO五年质保下600TB和1,200TB的年写入量基本相同。最有可能的解释是,这款硬盘使用了低等级的三星TLC V-NAND闪存,或者采用了成本更低、质保期更短的方案,以降低硬盘的售价。令人费解的是,他们竟然对通常作为基础规格的信息如此讳莫如深。
我们评测的样机是 2TB 型号(MZ-V9V2T0),是运行固件 0B2QLXL7 的预生产样品,我们对其进行了 fio、GDS 和 AI 模型负载测试,详情如下。
三星 990 SSD 规格
| 规格 | 三星 990 1TB | 三星 990 2TB |
|---|---|---|
| 平台概述 | ||
| 接口 | PCIe 4.0 x4,NVMe 2.0(向下兼容 PCIe 3.0) | |
| 外形 | M.2 2280 最大尺寸 80.15 x 22.15 x 2.38 (毫米) |
|
| 控制器 | 三星内部控制器 | |
| NAND闪存 | 三星V-NAND | |
| 快取记忆体 | HMB(主机内存缓冲区),无DRAM | |
| 模型编号 | MZ-V9V1T0 | MZ-V9V2T0 |
| 性能 | ||
| 顺序阅读 | 高达7,150MB /秒 | 高达7,250MB /秒 |
| 顺序写入 | 高达6,450MB /秒 | 高达6,450MB /秒 |
| 随机阅读 | 高达700K IOPS | 高达850K IOPS |
| 随机写入 | 高达1,100K IOPS | 高达1,200K IOPS |
| 力量与耐力 | ||
| 活动功率(平均读取) | 4.0W | 4.3W |
| 有功功率(平均写入) | 3.7W | 3.8W |
| 空闲功耗(典型值) | 55mW PS3(APST开启) 3mW PS4 (L1.2) |
|
| 耐力(TBW) | 400TB | 800TB |
| 平均无故障时间 | 1.5万小时 | |
| 保修政策 | 3年限有限 | |
| 产品特性 | ||
| 配套功能 | TRIM(需要操作系统支持) 垃圾收集 聪明 |
|
| 数据保障及安全 | AES 256 位全盘加密 TCG/Opal V2.0 加密驱动器 (IEEE1667) |
|
| 软件 | 三星魔术师 9.0 | |
| 建议零售价 | $269.99 | $529.99 |
三星 990 SSD 的设计与构造
三星 990 采用常见的 M.2 2280 规格,尺寸为 80.15 x 22.15 x 2.38 毫米。它采用单面设计,并且没有配备独立散热片。这使其非常适合笔记本电脑、小型 PC 以及自带 M.2 散热的台式机主板。整体结构简洁,三星将控制器、NAND 闪存和相关电路都集中在 PCB 的一侧。
正面标签显示了三星 990 的品牌标识、2TB 容量、型号、固件版本和电气规格。由于没有集成散热片,散热依赖于系统气流和用户自行提供的 M.2 散热片。
撕掉标签后,可以看到三星自研的控制器紧邻M.2接口,周围环绕着电源组件。NAND闪存位于电路板的另一端,中间留出了相当多的空白空间。由于这是一款无DRAM内存的固态硬盘,因此PCB板上没有单独的DRAM芯片。
硬盘背面大部分被监管标签占据,下方没有任何活动元件。此外,由于990采用单面设计,因此更容易安装在M.2插槽周围空间有限的轻薄笔记本电脑和紧凑型系统中。
软件方面,990 由三星 Magician 9.0 管理,涵盖了基本功能:固件更新、硬盘健康状况和 SMART 监控、诊断扫描、基准测试和安全擦除,以及硬盘 AES 256 位加密功能的设置。由于 HMB 架构无需用户调整,因此无需对 990 进行任何特定配置。建议在首次启动时安装 Magician 以保持固件更新,而且 Magician 通常是一款功能强大的实用工具。
三星 990 性能
峰值合成性能
FIO 测试是一款灵活强大的基准测试工具,用于衡量存储设备(包括 SSD 和 HDD)的性能。它会评估带宽、IOPS 和延迟等指标,并分析不同工作负载(例如顺序和随机读/写操作)下的性能。该测试有助于评估存储系统的峰值性能,因此可用于比较不同的设备或配置。我们测量了该测试的峰值突发性能,并将两个 SSD 的工作负载限制在 10GB 以内。
峰值综合性能:三星 990 的顺序读取速度为 7,177 MB/s,顺序写入速度为 6,070 MB/s,随机读取 IOPS 为 872K,随机写入 IOPS 为 1.08M,在 PCIe Gen4/Gen5 对比测试中排名靠后。与三星 990 Pro 相比,990 的顺序读取速度落后约 4%,顺序写入速度落后 15.7%,随机读取 IOPS 落后 37.7%,随机写入 IOPS 落后 23.0%。与速度最快的 Gen5 固态硬盘 SanDisk SN8100 相比,差距显著扩大,990 的顺序读取速度低约 52%,顺序写入速度低约 57%,随机读取性能低约 62%,随机写入性能低约 50%。
| FIO 测试(MB/s/IOPS 越高越好) | 顺序 128K 读取 (1T/64Q) | 顺序 128K 写入 (1T/64Q) | 随机 4K 读取 (16T/32Q) | 随机4K写入(16T/32Q) |
|---|---|---|---|---|
| 闪迪 SN8100 | 15,000MB/s(平均延迟 0.56ms) | 14,100MB/s(平均延迟 0.59ms) | 2.312M IOPS(平均延迟 0.22ms) | 2.144M IOPS(平均延迟 0.24ms) |
| 金士顿FURY Renegade G5 | 14,600MB/s(平均延迟 0.57ms) | 14,100MB/s(平均延迟 0.59ms) | 2.028M IOPS(平均延迟 0.25ms) | 2.028M IOPS(平均延迟 0.25ms) |
| 三星9100 Pro | 14,600MB/s(平均延迟 0.57ms) | 13,300MB/s(平均延迟 0.63ms) | 2.734M IOPS(平均延迟 0.18ms) | 2.734M IOPS(平均延迟 0.19ms) |
| SK海力士白金P51 | 14,500MB/s(平均延迟 0.58ms) | 13,500 MB/s(平均延迟 0.62ms) | 2.369M IOPS(平均延迟 0.22ms) | 2.669M IOPS(平均延迟 0.19ms) |
| 关键T705 | 14,400MB/s(平均延迟 0.58ms) | 12,300MB/s(平均延迟 0.68ms) | 1.585M IOPS(平均延迟 0.32ms) | 2.703M IOPS(平均延迟 0.19ms) |
| 十铨科技 GE Pro 2TB | 13,900MB/s(平均延迟 0.60ms) | 12,800MB/s(平均延迟 0.65ms) | 2.585M IOPS(平均延迟 0.23ms) | 1.818M IOPS(平均延迟 0.28ms) |
| Lexar Professional NM1090 PRO | 13,800MB/s(平均延迟 0.61ms) | 13,600MB/s(平均延迟 0.62ms) | 2.251M IOPS(平均延迟 0.23ms) | 1.818M IOPS(平均延迟 0.28ms) |
| 十铨科技 GC Pro 2TB | 13,600MB/s(平均延迟 0.62ms) | 12,700MB/s(平均延迟 0.66ms) | 2.110M IOPS(平均延迟 0.24ms) | 1.686M IOPS(平均延迟 0.28ms) |
| PNY CS2150 | 10,400MB/s(平均延迟 0.80ms) | 8,801MB/s(平均延迟 0.95ms) | 1.379M IOPS(平均延迟 0.371ms) | 1.623M IOPS(平均延迟 0.32ms) |
| 海盗船 MP700 MICRO 4TB | 9,169MB/s(平均延迟 0.91ms) | 7,948MB/s(平均延迟 1.06ms) | 1.277M IOPS(平均延迟 0.40ms) | 1.540M IOPS(平均延迟 0.33ms) |
| 至关重要的P510 | 8,835MB/s(平均延迟 0.90 毫秒) | 9,961MB/s(平均延迟 0.80 毫秒) | 1.163M IOPS(平均延迟 0.44ms) | 1.196M IOPS(平均延迟 0.51ms) |
| 美光 3610 2TB | 6,839MB/s(平均延迟 1.23ms) | 9,673MB/s(平均延迟 0.87ms) | 1.523M IOPS(平均延迟 0.34ms) | 1.871M IOPS(平均延迟 0.27ms) |
| 三星990 Pro | 7,483MB/s(平均延迟 1.12ms) | 7,197MB/s(平均延迟 1.16ms) | 1.400M IOPS(平均延迟 0.36ms) | 1.403M IOPS(平均延迟 0.36ms) |
| 关键 P310 2TB | 7,197MB/s(平均延迟 1.16ms) | 6,376MB/s(平均延迟 1.31ms) | 1.163M IOPS(平均延迟 0.44ms) | 1.196M IOPS(平均延迟 0.43ms) |
| 三星 990 2TB | 7,177MB/s(平均延迟 1.17ms) | 6,070MB/s(平均延迟 1.38ms) | 872K IOPS(平均延迟 0.59ms) | 1.08M IOPS(平均延迟 0.47ms) |
| WD SN850X 2TB | 6,632MB/s(平均延迟 0.76ms) | 7,235MB/s(平均延迟 0.92ms) | 1.2M IOPS(平均延迟 0.43ms) | 825K IOPS(平均延迟 0.62ms) |
| 美光 2600 2TB | 5,702MB/s(平均延迟 1.47ms) | 6,612MB/s(平均延迟 1.27ms) | 1.11M IOPS(平均延迟 0.46ms) | 1.36M IOPS(平均延迟 0.38ms) |
法学硕士 (LLM) 平均加载时间
平均 LLM 加载时间测试评估了三种不同 LLM 的加载时间:DeepSeek R1 7B、Meta Llama 3.2 11B 和 DeepSeek R1 32B。每个模型测试 10 次,并计算平均加载时间。此测试衡量硬盘将大型语言模型 (LLM) 快速加载到内存中的能力。LLM 加载时间对于人工智能相关任务至关重要,尤其是在实时推理和处理大型数据集时。更快的加载速度使模型能够更快地处理数据,从而提高人工智能的响应速度并减少等待时间。
平均LLM加载时间:AI模型加载是三星990表现最差的测试项目,在所有三项工作负载测试中,该硬盘的成绩都处于垫底或接近垫底的位置。其DeepSeek R1 7B测试耗时5.06秒,Meta Llama 3.2 11B Vision测试耗时7.61秒,DeepSeek R1 32B测试耗时7.86秒。与速度最快的硬盘SK海力士Platinum P51相比,三星990加载7B模型耗时约99%,加载11B Vision模型耗时约112%,加载32B模型耗时约88%。更有意思的是三星990 Pro,它与同系列的入门级产品一样,在这些测试中排名垫底:990在7B负载测试中仅比Pro快约1%,但在11B Vision模型和32B模型测试中分别落后Pro 15%和8%。无论三星第四代硬盘在这种工作负载下性能有所下降,它们都会一起下降,因此升级到 Pro 版本对 AI 模型加载并没有太大帮助。
| 法学硕士平均加载时间(越低越好) | DeepSeek R1 7B | Meta Llama 3.2 11B 视觉 | DeepSeek R1 32B |
|---|---|---|---|
| SK海力士白金P51 | 2.5481s | 3.5809s | 4.1790s |
| 闪迪 SN8100 | 2.5702s | 3.5856s | 4.2870s |
| 三星 9100 Pro 4TB | 2.6173s | 3.6017s | 4.3735s |
| PNY CS2150 | 2.8107s | 3.6820s | 4.8962s |
| 英睿达 T705 2TB | 2.8758s | 3.6312s | 5.1080s |
| 关键 P510 1TB | 2.8817s | 3.6631s | 5.0594s |
| 十铨科技 GE Pro 2TB | 2.9092s | 3.9136s | 4.8974s |
| 十铨科技 GC Pro 2TB | 2.9379s | 3.9267s | 4.8188s |
| WD SN850X 2TB | 3.0082s | 3.6543s | 5.4844s |
| 金士顿FURY Renegade G5 | 3.1843s | 4.8009s | 4.6523s |
| 关键 P310 2TB | 3.1889s | 3.7083s | 5.4844s |
| Lexar Professional NM1090 PRO | 3.2135s | 4.9504s | 7.2108s |
| 美光 2600 2TB | 3.3178s | 3.9174s | 5.9060s |
| 海盗船 MP700 MICRO 4TB | 3.4694s | 5.2106s | 5.3990s |
| 美光 3610 2TB | 3.5348s | 5.3853s | 5.5731s |
| 三星 990 2TB | 5.0645s | 7.6087s | 7.8619s |
| 三星 990 Pro 2TB | 5.1255s | 6.6051s | 7.3021s |
该测试平台进行的测试之一是 Magnum IO GPU 直接存储 (GDS) 测试。GDS 是 NVIDIA 开发的一项功能,它允许 GPU 在访问存储在 NVMe 驱动器或其他高速存储设备上的数据时绕过 CPU。GDS 无需通过 CPU 和系统内存路由数据,即可实现 GPU 与存储设备之间的直接通信,从而显著降低延迟并提高数据吞吐量。
GPU 直接存储的工作原理
传统上,当GPU处理存储在NVMe驱动器上的数据时,数据必须先经过CPU和系统内存才能到达GPU。由于CPU充当中间人,这个过程会造成性能瓶颈,增加延迟并消耗宝贵的系统资源。GPU直接存储(GPU Direct Storage)通过允许GPU直接通过PCIe总线访问存储设备中的数据,消除了这种低效。这种直接路径减少了数据传输的开销,从而实现了更快、更高效的数据传输。
AI 工作负载(尤其是涉及深度学习的工作负载)是高度数据密集型的。训练大型神经网络需要处理数 TB 的数据,数据传输的任何延迟都可能导致 GPU 利用率不足和训练时间延长。GPU Direct Storage 通过确保尽快将数据传送到 GPU、最大限度地减少空闲时间并最大限度地提高计算效率来解决这一挑战。
此外,GDS 对于涉及流式传输大型数据集的工作负载(例如视频处理、自然语言处理或实时推理)尤其有益。通过减少对 CPU 的依赖,GDS 可加速数据移动并释放 CPU 资源以用于其他任务,从而进一步提高整体系统性能。
随着线程数的增加,读取端的吞吐量稳步提升。在 1M 块大小下,三星 990 在单线程下的吞吐量为 2.27 GiB/s,在 64 个线程时达到峰值 2.89 GiB/s,然后在 128 个线程时稳定在 2.79 GiB/s。128K 块大小的吞吐量曲线与之类似,从单线程的 1.21 GiB/s 提升至 128 个线程的 2.12 GiB/s,增幅约为 75%。16K 块大小的吞吐量表现则有所不同。它在单线程时达到峰值(0.82 GiB/s),引入并发后急剧下降,并在 8 个线程后稳定在 0.3 GiB/s 左右。这种模式与小块 I/O 的瓶颈在于单次操作的开销而非原始带宽相符。
延迟如预期般随线程数增加而上升。在 100 万线程时,平均延迟从单线程的 430 微秒增加到 128 线程的 44.7 毫秒,大约增加了 1 倍,这反映了由于并发 GPUDirect Storage 线程增多而导致的队列深度增加。128K 和 16K 块大小也呈现出相同的上升趋势,在 128 线程时分别达到 7.4 毫秒和 6.2 毫秒。值得注意的是,16K 块大小的单线程延迟最低(18 微秒),这反映了其每次操作的有效负载较小,尽管其整体吞吐量上限最低。
写入吞吐量随数据块大小而变化。1M 数据块大小的表现尤为突出,单线程时为 0.32 GiB/s,在 8 个线程时达到峰值 3.89 GiB/s,之后随着队列开销的增加略有下降,在 128 个线程时降至 3.63 GiB/s。128K 和 16K 数据块大小在整个线程范围内保持稳定,无论并发数如何,都徘徊在 0.3 GiB/s 左右。这表明,在这些数据块大小下,写入路径的限制因素是每次 I/O 操作的开销或控制器队列,而不是带宽。
写入延迟的上升速度比读取延迟更快,尤其是在 128K 块大小下,单线程延迟为 382 微秒,而 128 线程延迟则高达 51.0 毫秒,这是写入和读取测试中记录到的最高值。1M 块大小的延迟出现了一个异常的下降,单线程延迟为 3.06 毫秒,而四线程延迟为 1.03 毫秒,这可能是因为单线程运行尚未达到写入路径的饱和状态,之后延迟稳步上升,128 线程延迟达到 34.4 毫秒。16K 块大小的延迟表现最为稳定,最终为 9.1 毫秒,是三种块大小中延迟最低的。
结语
三星 990 并非性能顶尖产品,测试数据也印证了这一点。在我们进行的所有 FIO 测试中,它都落后于 990 Pro,顺序读取 IOPS 差距仅为 4%,随机读取 IOPS 差距更是高达 38%,远逊于同组最快的第四代和第五代固态硬盘。AI 模型加载测试的结果也类似,990 和 990 Pro 并列垫底;990 在 DeepSeek R1 7B 负载测试中略胜 990 Pro 一筹,但在更大容量的模型测试中则落后 8% 到 15%。需要应对高负载工作负载并追求极致吞吐量的用户,应该考虑三星产品线中的其他产品,例如第五代 9100 Pro。
话虽如此,如果将 990 与市面上速度最快的固态硬盘进行比较,那就忽略了这款硬盘的真正意义。这是一款主流的第四代固态硬盘,其设计理念是效率和性价比,而非追求极致的性能。与它的前代产品 990 EVO 相比,它的确是一次稳健的升级。顺序写入速度提升超过 50%,根据三星官方数据,能效提升了 38%,而顺序读取速度也与 990 EVO Plus 持平。三星并未透露 NAND 闪存的具体型号,但从耐久性测试来看,它采用的是性能可靠的 TLC 闪存,而非 QLC 闪存。
对于那些不需要第五代硬盘速度或专业级随机I/O,而想要一款价格合理、可靠节能的第四代硬盘的用户来说,990 是从 EVO 系列升级的明智之选。值得注意的是,升级到 990 Pro 并不会增加 AI 模型加载能力,因此两者之间的选择主要取决于随机I/O和持续写入性能,而非 AI 相关功能。1TB 版本售价 269.99 美元,2TB 版本售价 529.99 美元,这样的建议零售价更多地反映了当前的内存市场行情,而非硬盘的入门级定位,因此 990 的性价比最终将取决于实际售价。如果追求极致性能,它并非最佳选择,但它能够胜任其设计用途。









Amazon