ArmazenamentoReview.com

Análise do Solidigm D7-PS1030: 3 DWPD Gen5 que merecem estar na categoria de caches KV

Empreendimento  ◇  SSD

O Solidigm D7-PS1030 é o modelo de resistência intermediária da primeira família de data centers PCIe 5.0 da empresa, combinando a plataforma com o D7-PS1010, com classificação de 3 DWPD e um limite de gravação aleatória de até 800 mil IOPS, o dobro dos 400 mil IOPS do seu irmão de resistência padrão. A família varia de 1.6 TB a 12.8 TB nas versões E3.S e U.2, utilizando NAND TLC de 176 camadas, com desempenho nominal de até 14,500 MB/s de leitura sequencial e 10,000 MB/s de gravação sequencial. A Solidigm tem como alvo cargas de trabalho mistas e com foco em gravação: OLTP, registro de metadados, HPC e pipelines de IA/ML, onde a pressão de gravação é constante. Nossa unidade de teste é o modelo E3.S de 12.8 TB.

SSD Solidigm D7-PS1030 de 12.8 TB com processador E3.S, posicionado verticalmente no laboratório da StorageReview.

O Solidigm D7-PS1030 de 12.8 TB em um corpo E3.S de 7.5 mm.

Esta não é a primeira vez que trabalhamos com este disco; no entanto, é a primeira vez que um único disco foi testado em benchmarks. Oito dessas mesmas unidades de 12.8 TB compuseram a camada flash em nossos testes de descarregamento de cache KV no Dell PowerEdge XE7740, onde o array suportou 1.9 GB/s de gravações KV contínuas 24 horas por dia, um ciclo de trabalho que resulta em aproximadamente 3.2 gravações por dia por disco em espelhamento, ou cerca de 1.6 DWPD em RAID 0. Essa é exatamente a faixa que a classificação de 3 DWPD do PS1030 foi projetada para abranger: o descarregamento KV é uma carga de trabalho onde a resistência, e não a capacidade ou a velocidade máxima, é a restrição que define a camada. A classe de leitura intensiva que domina as manchetes da Gen5 consumiria rapidamente seu orçamento de 1 DWPD com essa carga de trabalho.

O SSD Solidigm D7-PS1030 de 12.8 TB com tecnologia E3.S está posicionado em frente ao Dell PowerEdge XE7740 no laboratório da StorageReview.

O PS1030 em frente ao Dell PowerEdge XE7740 que hospedou nossos testes de descarregamento de cache KV.

Com 12.8 TB, a Solidigm classifica o disco com 2.75 milhões de IOPS de leitura aleatória 4K e 800 mil IOPS de gravação aleatória, com o pico de 3.1 milhões de IOPS de leitura aleatória da família localizado em uma faixa de capacidade mais baixa. O consumo de energia em atividade é de 23 W (típico) e 5 W em modo ocioso, em linha com a 5ª geração de discos, com cinco estados de energia configuráveis ​​de 5 W a 25 W para operadores com orçamento fixo para racks. A Solidigm também faz duas outras afirmações importantes: eficiência energética até 70% superior à de discos comparáveis ​​e consistência de IOPS de até 90% ao longo da vida útil do disco. A durabilidade também pode ser esgotada mais rapidamente em períodos mais curtos; a mesma mídia suporta 4.98 DWPD (gravações por dia) durante um período de três anos, e o modelo de 12.8 TB é classificado para 70 PB gravados em ambos os sentidos. As especificações de confiabilidade estão em linha com a categoria: MTBF de 2.5 milhões de horas, garantia de cinco anos e teste UBER Solidigm com classificação 1E-18. As opções de segurança incluem TCG Opal 2.02 SED trim, hardware certificável pelo padrão FIPS 140-3 Nível 2, inicialização segura e assinatura de firmware de acordo com o padrão OCP, além de atestação de dispositivo e revogação de chave.

Unidade Solidigm D7-PS1030 E3.S em seu compartimento, mostrando o conector de borda EDSFF.

No compartimento Dell E3.S.

Especificações do Solidigm D7-PS1030

Especificação Solidigm D7-PS1030 (12.8 TB E3.S, gama de modelos especificada)
Visão geral da plataforma
Capacidades 1.6TB
3.2TB
6.4TB
12.8 TB (conforme testado)
Fatores de Forma E3.S 7.5 mm (conforme testado)
U.2 15mm
Interface / Protocolo PCIe 5.0 x4, NVMe
NAND Solidigm NAND 3D TLC de 176 camadas
Desempenho (até, conforme classificação do fornecedor)
Leitura sequencial (128K) 14,500 MB/s (família)
Gravação sequencial (128K) 10,000 MB/s (família)
Leitura aleatória (4K) 2,750K IOPS (12.8 TB)
Até 3,100 mil IOPS (pico familiar)
Gravação aleatória (4K) IOPS 800K
Poder e resistência
Potência (Ativo / Inativo) 23 W típico / 5 W típico
Cinco níveis de potência configuráveis, de 5 W a 25 W.
resistencia 3.0 DWPD (base de 5 anos)
4.98 DWPD (base de 3 anos)
70 PBW em 12.8 TB
Confiabilidade e Segurança
MTBF / UBER 2,500,000 horas
Testado conforme 1E-18
Total TCG Opal 2.02 (variante SED)
Certificável segundo o padrão FIPS 140-3 Nível 2
Inicialização segura padrão OCP e assinatura de firmware
Atestado de dispositivo, revogação de chave
Garantia 5 Anos

 

Dois drives Solidigm D7-PS1030, um montado em um compartimento E3.S, em frente ao rack de servidores da StorageReview.

Unidades PS1030 em E3.S; a família também é comercializada em U.2.

Desempenho do Solidigm D7-PS1030

O contexto dos gráficos a seguir é que o PS1030 entra em nosso campo de comparação como o contraponto de uso misto aos drives com foco em leitura intensiva que dominaram as análises recentes da Geração 5. Em comparação com o KIOXIA CD9P-R, que analisamos em junho, o PS1030 apresenta uma taxa de leitura sequencial nominal inferior (14,500 vs 14,800 MB/s), mas quase dobra a taxa de gravação aleatória nominal (800K vs 450K IOPS) e triplica o orçamento de gravação (3 vs 1 DWPD). Seu concorrente mais próximo em termos de desempenho no grupo é o Micron 7600 MAX , o outro drive com 3 DWPD disponível, enquanto o Micron 9550 MAX oferece desempenho semelhante em uso misto, com a mesma capacidade de 12.8 TB da nossa unidade.

Plataforma de teste de direção

Utilizamos um Dell PowerEdge R760 com Ubuntu 22.04.2 LTS como plataforma de teste para todas as cargas de trabalho desta análise. Equipado com um JBOF Gen5 da Serial Cables, ele oferece ampla compatibilidade com SSDs U.2, E1.S, E3.S e M.2. Nossa configuração de sistema está descrita abaixo:

  • 2 x Intel Xeon Gold 6430 (32 núcleos, 2.1 GHz)
  • 16 x 64GB DDR5-4400
  • SSD Dell BOSS de 480 GB
  • Cabos seriais Gen5 JBOF
  • NVIDIA L4

Unidades comparadas

Benchmark de ponto de verificação DLIO

Para avaliar o desempenho real de SSDs em ambientes de treinamento de IA, utilizamos a ferramenta de benchmark Data and Learning Input/Output (DLIO). Desenvolvida pelo Argonne National Laboratory, a DLIO foi projetada especificamente para testar padrões de E/S em cargas de trabalho de aprendizado profundo. Ela fornece informações sobre como os sistemas de armazenamento lidam com desafios como checkpointing, ingestão de dados e treinamento de modelos.

A tabela abaixo mostra o tempo médio de conclusão de cada ponto de verificação em três passagens por cada unidade; quanto menor, melhor. Uma observação sobre esses dados: o número de pontos de verificação em uma execução é proporcional à capacidade de cada unidade, portanto, unidades maiores registram mais pontos de verificação, e os resultados por ponto de verificação não são alinhados ponto a ponto entre unidades de tamanhos diferentes. É por isso que publicamos as médias de passagem, que normalizam a execução de cada unidade em um valor diretamente comparável. Ao treinar modelos de aprendizado de máquina, os pontos de verificação são essenciais para salvar periodicamente o estado do modelo, evitando a perda de progresso durante interrupções ou falhas de energia. Essa demanda de armazenamento requer um desempenho robusto, especialmente sob cargas de trabalho sustentadas ou intensivas. Utilizamos o benchmark DLIO versão 2.0, da versão de 13 de agosto de 2024.

Para garantir que nossos testes de desempenho refletissem cenários do mundo real, baseamos nossos testes na arquitetura do modelo LLAMA 3.1 405B. Implementamos o checkpointing usando `torch.save()` para capturar os parâmetros do modelo, os estados do otimizador e os estados das camadas. Nossa configuração simulou um sistema com oito GPUs, implementando uma estratégia de paralelismo híbrido com paralelismo de tensores de 4 vias e processamento paralelo de pipeline de 2 vias distribuído entre as oito GPUs. Essa configuração resultou em um tamanho de checkpoint de 1,636 GB, refletindo os requisitos para o treinamento de modelos de linguagem modernos de grande porte.

Tração Média da 1ª passagem (em segundos) Média da 2ª passagem (em segundos) Média da 3ª passagem (em segundos)
SanDisk DC SN861 7.68 TB 461.3 558.6 553.3
Micron 9550 MAX 12.8 TB 462.8 558.9 555.3
Micron 9550 Pro 7.68 TB 461.4 577.9 559.7
Solidigm PS1010 7.68 TB 458.8 561.1 564.6
Micron 7600 MAX 6.4 TB 464.2 581.5 567.3
KIOXIA CD9P-R 7.68 TB 464.7 575.6 570.6
KIOXIA CM9-R 15.36 TB 462.8 571.9 580.9
Solidigm PS1030 12.8 TB 462.3 578.0 599.2

 

Analisando as médias de tempo de leitura, o Solidigm PS1030 começou no meio do pelotão com 462.3 segundos na primeira passagem, onde todo o grupo de comparação ficou dentro de uma faixa de sete segundos, aproximadamente entre 459 e 465 segundos. A diferença veio depois. Na segunda passagem, o PS1030 subiu para 578.0 segundos, na parte superior de um grupo que variou de 558.6 segundos para o SanDisk SN861 a 581.5 segundos para o Micron 7600 MAX, e na terceira passagem, subiu para 599.2 segundos, a maior média do grupo de comparação, com o restante do grupo ficando entre 553.3 segundos para o SN861 e 580.9 segundos para o KIOXIA CM9-R.

Pontos de verificação Solidigm PS1030 DLIO

O próprio registro de checkpoints do PS1030 mostra o padrão dessa deriva. O PS1030 iniciou em 465.3 segundos e se manteve próximo a 461 segundos até o checkpoint 5, antes de aumentar o tempo. Após a transição, variou de aproximadamente 553 a 593 segundos, fechou o checkpoint 12 em 614.7 segundos e seus checkpoints mais recentes chegaram a 629.0 segundos. O resultado é consistente com a única fraqueza já conhecida do SSD, e não com uma nova: o checkpointing DLIO é exatamente o tipo de grande rajada de gravação sequencial que o teste FIO de 128K com um único processador identificou. A diferença é real, mas limitada, cerca de 5% em comparação com o KIOXIA CD9P-R nas médias da Passagem 3, e o PS1030 apresentou um desempenho previsível ao longo das passagens, sem oscilações bruscas.

Referência de desempenho da FIO

Para medir o desempenho de armazenamento de cada SSD com base em métricas comuns do setor, utilizamos a FIO. Cada unidade passa pelo mesmo processo de teste, que inclui uma etapa de pré-condicionamento com dois preenchimentos completos da unidade com uma carga de trabalho de gravação sequencial, seguida por uma medição de desempenho em estado estacionário. À medida que cada tipo de carga de trabalho medida muda, executamos outro preenchimento de pré-condicionamento com esse novo tamanho de transferência.

Nesta seção, nos concentramos nos seguintes benchmarks de FIO:

  • 128K sequencial
  • 64K aleatório
  • 16K sequencial
  • 4K aleatório

Gravação sequencial de 128K (IODepth 16 / NumJobs 1)

Gráfico de barras da largura de banda de gravação sequencial FIO 128K comparando o Solidigm D7-PS1030, o KIOXIA CM9-R e outros seis SSDs Gen5 para empresas. Gráfico de barras da latência média de gravação sequencial de 128K da FIO para o Solidigm D7-PS1030, o KIOXIA CM9-R e outros seis SSDs corporativos de 5ª geração.

O teste de gravação sequencial de 128K em estado estacionário é a única área em que o PS1030 demonstra alguma fragilidade em comparação com os outros SSDs. O drive registrou 6,370.3 MB/s com 313.7 µs, a menor largura de banda e a maior latência do grupo, ficando atrás até mesmo do KIOXIA CD9P-R, que utiliza leitura intensiva e alcançou 6,912.4 MB/s. O Micron 9550 MAX liderou com 10,957.9 MB/s, seguido pelo 9550 Pro com 10,354.6 MB/s, e o KIOXIA CM9-R ficou em terceiro lugar com 8,668.1 MB/s. O PS1010, irmão do PS1030 (7,126.5 MB/s), e o SanDisk DC SN861 (7,116.5 MB/s) ocuparam o meio da tabela, com o Micron 7600 MAX atingindo 6,960.6 MB/s.

Vale a pena observar: esta é uma carga de trabalho de tarefa única, e a arquitetura de gravação do PS1030 foi projetada para distribuir o trabalho, não para priorizar um único fluxo. As seções de gravação aleatória abaixo mostram a mesma unidade movimentando muito mais dados quando o paralelismo é introduzido, o que corresponde ao padrão de acesso gerado pelas cargas de trabalho para as quais foi projetada.

Leitura sequencial de 128K (IODepth 64 / NumJobs 1)

Gráfico de barras da largura de banda de leitura sequencial FIO 128K comparando o Solidigm D7-PS1030, o KIOXIA CM9-R e outros seis SSDs corporativos de 5ª geração. Gráfico de barras da latência média de leitura sequencial de 128K da FIO para o Solidigm D7-PS1030, o KIOXIA CM9-R e outros seis SSDs corporativos de 5ª geração.

O lado da leitura inverteu os papéis. O PS1030 atingiu 14,156.4 MB/s com um tempo de resposta de 564.8 µs, praticamente empatado com seu irmão PS1010 (14,163.3 MB/s) e a apenas 0.6% do líder do grupo, o CD9P-R (14,235.9 MB/s). O Micron 9550 Pro (14,050.1 MB/s) e o 9550 MAX (14,047.5 MB/s) completaram o grupo de cinco unidades, saturando a interface Gen5 em uma faixa de 200 MB/s. O SN861 veio em seguida, com 12,631.2 MB/s, o 7600 MAX com 11,240.5 MB/s, e o CM9-R, tão forte no teste de gravação, ficou em último lugar aqui, com 9,974.6 MB/s nesta configuração de tarefa única. Para um disco rígido vendido com base em sua capacidade de gravação, não abrir mão de nada na leitura de blocos grandes é a vitória silenciosa neste gráfico.

Gravação aleatória 64K

Gráfico de linhas da largura de banda de gravação aleatória de 64K da FIO em função da profundidade da fila e das combinações de tarefas para o Solidigm D7-PS1030, o KIOXIA CM9-R e outros seis SSDs corporativos de 5ª geração. Gráfico de latência média de gravação aleatória 64K da FIO para o Solidigm D7-PS1030, o KIOXIA CM9-R e outros seis SSDs corporativos de 5ª geração.

O teste de gravação aleatória de 64K é onde o PS1030 realmente se destaca. O SSD atingiu um pico de 7,224.0 MB/s, o quarto melhor do grupo, atrás do Micron 9550 MAX (10,878.1 MB/s), do KIOXIA CM9-R (9,635.3 MB/s) e do Micron 9550 Pro (9,069.4 MB/s), e à frente do Micron 7600 MAX (6,960.5 MB/s) e dos demais concorrentes. O que diferencia o PS1030 é o momento em que esse pico foi atingido: com IODepth 2 / NumJobs 2, com apenas 34.3 µs de latência, enquanto a maioria dos concorrentes precisou de filas profundas para alcançar seus melhores resultados. A taxa de transferência satura quase imediatamente e depois se mantém estável durante o restante da varredura, que é exatamente o perfil desejado para uma camada de gravação em estado estável, operando com concorrência moderada 24 horas por dia, 7 dias por semana. A diferença para seu irmão também se reflete na camada de resistência, que justifica seu investimento em termos de desempenho: o PS1010 atingiu um pico de 5,873.9 MB/s, 23% abaixo do PS1030.

Em termos de latência, o PS1030 iniciou com 21.1 µs em IODepth 1 / NumJobs 1, ficando atrás apenas dos 18.4 µs do CM9-R, e seu pior pico em toda a varredura foi de 2,831 µs, menos da metade do pico de 5,987 µs do PS1010. O 9550 MAX manteve-se o mais controlado em alta concorrência, atingindo um máximo de 1,714 µs.

Leitura aleatória 64K

Gráfico de linhas da largura de banda de leitura aleatória de 64K da FIO em função da profundidade da fila e das combinações de tarefas para o Solidigm D7-PS1030, o KIOXIA CM9-R e outros seis SSDs corporativos de 5ª geração. Gráfico de latência média de leitura aleatória 64K da FIO para o Solidigm D7-PS1030, o KIOXIA CM9-R e outros seis SSDs corporativos de 5ª geração.

O PS1030 obteve o melhor pico de leitura aleatória de 64K do grupo, com 14,162.9 MB/s (IODepth 32 / NumJobs 8), ligeiramente à frente do Micron 9550 Pro (14,049.9 MB/s), do 9550 MAX (14,049.7 MB/s) e do PS1010 (14,013.6 ​​MB/s), com o CM9-R a 13,402.4 MB/s e o CD9P-R a 12,036.0 MB/s mais atrás. A baixa profundidade de fila é um ponto forte dos drives KIOXIA, como vimos em nossa análise do CD9P-R: o CM9-R iniciou com 1,359.0 MB/s e o CD9P-R com 1,334.0 MB/s em IODepth 1 / NumJobs 1, aproximadamente 45 µs de latência, enquanto o PS1030 começou com 768.4 MB/s e 81.0 µs, ficando no meio do ranking. O PS1030 se destaca neste gráfico em termos de escalabilidade, não em resposta de fluxo único.

Gravação sequencial de 16K

Uma observação sobre o próprio teste: começando com este grupo de comparação, nossa cobertura de 16K é sequencial em vez de aleatória, uma carga de trabalho que analisamos pela primeira vez em nossa avaliação do Micron 9550 MAX . Fluxos sequenciais de tamanho médio representam melhor o que esses drives fazem em produção, especialmente em pipelines de IA, que transmitem dados de treinamento ordenados, geram resultados intermediários e alimentam camadas de inferência em execuções, em vez de espalhar acessos aleatórios pelo drive.

Gráfico de linhas da largura de banda de gravação sequencial de 16K da FIO em função da profundidade da fila e das combinações de tarefas para o Solidigm D7-PS1030, o KIOXIA CM9-R e outros seis SSDs corporativos de 5ª geração. Gráfico de latência média de gravação sequencial de 16K da FIO para o Solidigm D7-PS1030, o KIOXIA CM9-R e outros seis SSDs corporativos de 5ª geração.

Os resultados reorganizam o cenário em comparação com as varreduras aleatórias. O Micron 9550 MAX liderou com 10,970.8 MB/s (IODepth 32 / NumJobs 4), com o KIOXIA CM9-R quase empatando com 10,812.2 MB/s e o 9550 Pro em terceiro com 9,772.8 MB/s. O PS1030 atingiu o pico de 5,977.7 MB/s (IODepth 8 / NumJobs 4), sétimo no grupo, à frente do SanDisk DC SN861 com 5,772.5 MB/s e logo abaixo de seu irmão PS1010 com 6,271.7 MB/s. A curva de desempenho, no entanto, apresenta a mesma assinatura demonstrada nos testes aleatórios: o PS1030 já atingia 5,856.7 MB/s com IODepth 2 / NumJobs 4 e latência de 21.1 µs, mantendo-se estável entre aproximadamente 4,700 e 6,000 MB/s no restante da matriz. Sua latência de 10.9 µs para um único trabalhador o colocava no grupo líder, junto com o CM9-R (10.4 µs) e o CD9P-R (11.0 µs), bem abaixo dos Microns, que variavam de 15.1 a 17.8 µs. O limite máximo é modesto para um SSD com foco em gravação, mas é alcançado com profundidade de fila mínima e latência na ordem de microssegundos, o ponto de operação ideal para um cache ou camada de preparação sustentada, e o mesmo perfil que permitiu que este SSD suportasse semanas de fluxos contínuos de gravação sequencial em nossa implementação de cache KV.

Leitura sequencial de 16K

Gráfico de linhas da largura de banda de leitura sequencial de 16K da FIO em função da profundidade da fila e das combinações de tarefas para o Solidigm D7-PS1030, o KIOXIA CM9-R e outros seis SSDs corporativos de 5ª geração. Gráfico de latência média de leitura sequencial de 16K da FIO para o Solidigm D7-PS1030, o KIOXIA CM9-R e outros seis SSDs corporativos de 5ª geração.

Na leitura, o KIOXIA CD9P-R liderou com 13,819.7 MB/s, seguido de perto pelo CM9-R com 13,393.2 MB/s e pelo Micron 9550 Pro com 13,273.5 MB/s. O PS1030 atingiu o pico de 11,142.8 MB/s (IODepth 16 / NumJobs 8) em 179.1 µs, o sétimo melhor do grupo, à frente apenas do SN861 com 10,995.0 MB/s e logo atrás do seu irmão com 11,656.3 MB/s, cerca de um quinto abaixo do líder do grupo. O cenário de fluxo único também inverte a situação da leitura aleatória: em leituras ordenadas de 16K, o SN861 iniciou em 12.5 µs e o Micron entre 13.9 e 21.3 µs, enquanto a plataforma Solidigm iniciou perto de 59 µs, a mesma característica de leitura de baixa concorrência que ambos os drives da série PS apresentaram em 64K. Leituras de tamanho médio continuam sendo o ponto fraco desta plataforma; o lado de leitura contínua de um pipeline de IA é melhor atendido pela classe de leitura intensiva, o que não é o argumento para o qual este drive foi projetado.

Gravação aleatória 4K

Gráfico de linhas de IOPS de gravação aleatória 4K da FIO em função da profundidade da fila e combinações de tarefas para o Solidigm D7-PS1030, o KIOXIA CM9-R e outros seis SSDs corporativos de 5ª geração. Gráfico de latência média de gravação aleatória 4K da FIO para o Solidigm D7-PS1030, o KIOXIA CM9-R e outros seis SSDs corporativos de 5ª geração.

O gráfico principal para um SSD de 3 DWPD mostrou que o PS1030 correspondeu às expectativas. Seu pico de 1,595.8 mil IOPS com IODepth 16 / NumJobs 8 foi o segundo melhor do grupo, atrás apenas do Micron 7600 MAX de 3 DWPD, com 1,781.2 mil, e à frente do 9550 MAX (1,544.2 mil), PS1010 (1,504.7 mil), CM9-R (1,502.9 mil), 9550 Pro (1,467.6 mil), SN861 (1,438.3 mil) e CD9P-R (1,273.1 mil). Esse pico medido também é o dobro da taxa nominal de 800 mil IOPS do SSD, especificada pela Solidigm com uma profundidade de fila fixa; varreduras em estado estacionário revelam valores maiores.

O comportamento da latência confirma a conclusão. O PS1030 iniciou em 8.8 µs com IODepth 1, no cluster líder com o CM9-R (8.2 µs) e o PS1010 (8.3 µs), atingiu seu pico de desempenho em apenas 79.8 µs e nunca ultrapassou 359.6 µs em nenhum momento do teste. O PS1010, por outro lado, precisou de IODepth 32 / NumJobs 16 para atingir um pico de 339.7 µs, chegando a um pior caso de 735.6 µs. Para os logs OLTP e o tráfego no estilo cache KV para o qual este disco foi projetado, pequenas gravações na casa dos microssegundos, com um limite inferior a 400 µs, são o perfil que importa.

Leitura aleatória 4K

Gráfico de linhas de IOPS de leitura aleatória 4K da FIO em função da profundidade da fila e combinações de tarefas para o Solidigm D7-PS1030, o KIOXIA CM9-R e outros seis SSDs corporativos de 5ª geração. Gráfico de latência média de leitura aleatória 4K da FIO para o Solidigm D7-PS1030, o KIOXIA CM9-R e outros seis SSDs corporativos de 5ª geração.

O PS1030 confirmou seu bom desempenho em gravação com o segundo melhor pico de leitura aleatória 4K do grupo: 2,255.8K IOPS em IODepth 16 / NumJobs 16 e 112.8 µs, atrás dos 2,555.6K IOPS do SanDisk SN861 e à frente do Micron 9550 MAX (2,217.6K IOPS) e do CD9P-R (2,165.0K IOPS). Com IODepth 1 / NumJobs 1, a assinatura de baixa latência da KIOXIA liderou novamente: o CM9-R com 29.3 µs e o CD9P-R com 30.4 µs, mas o PS1030, com 56.8 µs, foi o melhor entre os demais, superando seu irmão e os dois 9550 (aproximadamente 65 µs) e o SN861 (67.8 µs). Um SSD de uso misto que fica em segundo lugar tanto em picos de leitura 4K quanto de gravação 4K em um segmento tão focado em leitura está cumprindo ambas as metades de sua função.

Armazenamento direto da GPU

Um dos testes que conduzimos neste testbench foi o teste Magnum IO GPU Direct Storage (GDS). GDS é um recurso desenvolvido pela NVIDIA que permite que GPUs ignorem a CPU ao acessar dados armazenados em unidades NVMe ou outros dispositivos de armazenamento de alta velocidade. Em vez de rotear dados pela CPU e pela memória do sistema, o GDS permite a comunicação direta entre a GPU e o dispositivo de armazenamento, reduzindo significativamente a latência e melhorando a taxa de transferência de dados.

Como funciona o armazenamento direto da GPU

Tradicionalmente, quando uma GPU processa dados armazenados em uma unidade NVMe, os dados precisam primeiro passar pela CPU e pela memória do sistema antes de chegar à GPU. Esse processo cria gargalos, pois a CPU atua como intermediária, adicionando latência e consumindo recursos valiosos do sistema. O GPU Direct Storage elimina essa ineficiência, permitindo que a GPU acesse os dados diretamente do dispositivo de armazenamento por meio do barramento PCIe. Esse caminho direto reduz a sobrecarga de movimentação de dados, permitindo transferências de dados mais rápidas e eficientes.

Cargas de trabalho de IA, especialmente aquelas que envolvem aprendizado profundo, são altamente intensivas em dados. Treinar grandes redes neurais requer o processamento de terabytes de dados, e qualquer atraso na transferência de dados pode levar a GPUs subutilizadas e tempos de treinamento mais longos. O GPU Direct Storage aborda esse desafio garantindo que os dados sejam entregues à GPU o mais rápido possível, minimizando o tempo ocioso e maximizando a eficiência computacional.

Além disso, o GDS é particularmente benéfico para cargas de trabalho que envolvem streaming de grandes conjuntos de dados, como processamento de vídeo, processamento de linguagem natural ou inferência em tempo real. Ao reduzir a dependência da CPU, o GDS acelera a movimentação de dados e libera recursos da CPU para outras tarefas, aprimorando ainda mais o desempenho geral do sistema.

Taxa de transferência de leitura sequencial GDSIO

Gráfico de desempenho de leitura sequencial GDSIO para tamanhos de bloco de 16K, 128K e 1M para os SSDs corporativos Solidigm D7-PS1030, KIOXIA CM9-R e outros seis SSDs Gen5. Gráfico de linhas da latência média de leitura sequencial GDSIO em tamanhos de bloco de 16K, 128K e 1M para o Solidigm D7-PS1030, o KIOXIA CM9-R e outros seis SSDs corporativos de 5ª geração.

No segmento de blocos de 16K, o PS1030 abriu com aproximadamente 0.2 GiB/s em um único núcleo, o ponto de entrada mais baixo do grupo, consistente com sua latência de leitura GDS de 71.6 µs em um único núcleo (seu irmão apresentou 71.1 µs, a mesma característica da plataforma que destacamos na análise do CD9P-R). Ele foi melhorando gradativamente no segmento intermediário, terminando em torno de 1.6 GiB/s em 16K/128, enquanto o par KIOXIA manteve a liderança próxima a 2.0 GiB/s. A vantagem de escalonamento de threads dos drives KIOXIA também se manteve no segmento de 128K, com o CD9P-R e o CM9-R se destacando em 128K/16, enquanto o PS1030 acompanhou o grupo principal, atingindo aproximadamente 4.7 GiB/s em 128K/64 e 5.0 GiB/s em 128K/128.

No segmento de 1M, os resultados convergiram. O PS1030 atingiu seu pico de 5.95 GiB/s (1M/32), ficando a apenas 3.5% do melhor resultado do grupo, de 6.16 GiB/s, alcançado pelo CD9P-R. O CM9-R ficou em 6.06 GiB/s, o PS1010 e o 9550 MAX em 6.05 GiB/s, e o 9550 Pro em 5.97 GiB/s. O 7600 MAX ficou em último lugar, com 5.59 GiB/s. No pico de 16K IOPS, a dupla KIOXIA liderou (136.4K para o CM9-R e 134.2K para o CD9P-R), enquanto o PS1030 apresentou o menor valor do grupo, de 101.2K; leituras diretas de pequenos blocos na GPU simplesmente não são o ponto forte desta plataforma.

Taxa de transferência de gravação sequencial GDSIO

Gráfico de desempenho de gravação sequencial GDSIO em tamanhos de bloco de 16K, 128K e 1M para os SSDs corporativos Solidigm D7-PS1030, KIOXIA CM9-R e outros seis SSDs Gen5. Gráfico de linhas da latência média de gravação sequencial GDSIO em tamanhos de bloco de 16K, 128K e 1M para o Solidigm D7-PS1030, o KIOXIA CM9-R e outros seis SSDs corporativos de 5ª geração.

O gráfico de velocidade de gravação é o que os compradores do PS1030 devem estudar, pois revela tanto os melhores resultados do drive quanto sua única anomalia. No segmento de 16K, todos os oito drives apresentaram desempenho semelhante, na faixa de 0.5 a 1.5 GiB/s, e a latência de gravação de thread único do PS1030, de 22.3 µs, ficou no grupo dos líderes, junto com os dois drives da KIOXIA (21.4 µs cada) e seu similar (21.9 µs). No segmento de 128K, o PS1030 apresentou um desempenho consistente, atingindo aproximadamente 3.95 GiB/s em 128K/32, mas depois caiu drasticamente: cerca de 2.35 GiB/s em 128K/64 e 1.55 GiB/s em 128K/128, menos de um terço do desempenho dos líderes do segmento. Este é o mesmo colapso de gravação com alta contagem de threads que documentamos no PS1010 na análise do CD9P-R, reproduzido quase ponto por ponto no PS1030 (o PS1010 caiu para 2.5 e depois para 1.65 GiB/s nas mesmas configurações). Seja qual for a causa, reside na plataforma, não no nível de resistência, e continua sendo a falha mais significativa no conjunto de dados.

O segmento de 1M apresentou uma leve queda, mas não eliminou o padrão. O PS1030 atingiu o pico de 4.22 GiB/s (1M/8), superando apenas o seu irmão, que alcançou 4.17 GiB/s, e caiu para aproximadamente 3.35 GiB/s em 1M/128, enquanto o CM9-R manteve a linha mais estável do grupo em direção ao seu pico de 5.51 GiB/s, e o 9550 MAX atingiu o pico mais alto, de 5.69 GiB/s, com sua própria volatilidade documentada, caindo para perto de 2.2 GiB/s em 1M/64. O 9550 Pro (5.54), o 7600 MAX (5.44), o CD9P-R (4.86) e o SN861 (4.59 GiB/s) completaram a ordem. A grande vantagem para o público-alvo do PS1030: o cache KV e as camadas de gravação em estilo logarítmico operam com contagens moderadas de threads por unidade, onde o PS1030 se comporta impecavelmente, e não com mais de 64 threads de gravação direta na GPU, onde o gargalo ocorre. Nossa própria implementação de cache KV executou oito dessas unidades por semanas sem que o array sequer se aproximasse do gargalo. No entanto, qualquer pessoa que planeje realizar streaming de gravação GDS multithread intenso nessa plataforma deve realizar testes de benchmark do seu padrão específico primeiro.

Conclusão

O Solidigm D7-PS1030 faz o que um SSD Gen5 de resistência média deve fazer, e os dados mostram um SSD com habilidades distintas. Sua marca registrada é o trabalho paralelo com pequenos blocos: segundo lugar no grupo tanto em gravação aleatória de 4K (1,595.8 mil IOPS, atrás apenas do concorrente Micron 7600 MAX com 3 DWPD) quanto em leitura aleatória de 4K (2,255.8 mil IOPS), o melhor desempenho do grupo em leitura aleatória de 64K com 14,162.9 MB/s e taxa de linha Gen5 completa em leituras sequenciais de 128K com 14,156.4 MB/s. Tão interessante quanto isso é como ele atinge esses resultados: picos em IODepth 2 ou NumJobs 8 com latência na casa das dezenas de microssegundos, enquanto os concorrentes precisam de filas profundas e pagam por isso com latência. O disco satura rapidamente, mantém-se estável e apresenta uma latência de gravação no pior caso de ser metade da latência do seu irmão PS1010.

Bandeja de unidades Dell PowerEdge XE7740 E3.S carregada com SSDs Solidigm D7-PS1030, duas unidades na posição vertical, no laboratório da StorageReview.

O compartimento XE7740 que hospedava o conjunto de oito discos PS1030 em nosso projeto de descarregamento de cache KV.

Existem, no entanto, algumas desvantagens. As gravações sequenciais de 128K com um único trabalhador ficaram em último lugar no grupo, com 6,370.3 MB/s, e o checkpointing DLIO, que testa exatamente esse padrão, apresentou a maior média do grupo na Passagem 3, com 599.2 segundos. Os testes sequenciais de 16K também ficaram atrás dos demais, com o pico de gravação de 5,977.7 MB/s e o pico de leitura de 11,142.8 MB/s, cada um em sétimo lugar entre oito. A varredura de gravação GDSIO reproduziu a queda de 128K com muitos threads do PS1010 quase ponto por ponto, confirmando que se trata de um comportamento da plataforma e não de um caso isolado, e as leituras diretas de pequenos blocos pela GPU favorecem os drives KIOXIA por uma ampla margem. Nada disso invalida a proposta do drive, mas a destaca: o PS1030 não é o drive ideal para ingestão de fluxo único.

Para o que foi projetado, já comprovou em estudos mais longos do que qualquer teste de benchmark. Oito desses drives passaram semanas como camada de descarregamento de cache KV em nosso trabalho de inferência XE7740 , absorvendo 1.9 GB/s de gravações sustentadas, 24 horas por dia, 7 dias por semana, com um ciclo de trabalho que ultrapassou sua classificação de 3 DWPD, e a camada nunca se tornou um gargalo. Os dados do benchmark explicam por que isso funcionou: comportamento de gravação com saturação precoce, latência de gravação 4K de um dígito em microssegundos com baixa profundidade de fila e um teto de latência controlado são exatamente as características que uma camada de cache ou log com gravação contínua oferece. Cargas de trabalho de gravação moderadamente simultâneas, sensíveis à latência e com limite de resistência, descarregamento de cache KV, registro OLTP e camadas de metadados são onde o PS1030 se encaixa, e onde seu orçamento de 3 DWPD e a opção de 4.98 DWPD por três anos permitem que ele execute ciclos de trabalho que o desqualificariam para a classe de leitura intensiva.

Página do produto Solidigm D7-PS1030

Envolva-se com a StorageReview

Newsletter | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Feed RSS

Brian Beeler

Brian está localizado em Cincinnati, Ohio e é analista-chefe e presidente da StorageReview.com.