ArmazenamentoReview.com

Análise do SSD DapuStor J5060: SSD QLC de alta densidade otimizado para cargas de trabalho centradas em leitura

Empreendimento  ◇  SSD

O SSD DapuStor J5060 é um drive NVMe de alta capacidade, voltado para empresas, projetado para atender à crescente demanda por armazenamento denso e com baixo consumo de energia em ambientes com uso intensivo de dados. Ele é baseado em 3D Enterprise QLC NAND Flash e suporta a interface PCIe 4.0 x4 com NVMe 1.4a, alojado em um formato padrão U.2 de 15 mm. O drive foi projetado para situações em que o desempenho de leitura e o custo por terabyte são essenciais. Isso o torna potencialmente adequado para aplicações como infraestrutura em nuvem, inferência de IA, plataformas de big data e pipelines de manufatura inteligentes, onde as operações de gravação são pouco frequentes ou previsíveis.

DapuStor J5060

Recursos e perfil de desempenho do DapuStor J5060

Com capacidades que podem ser expandidas até 61.44 TB, o J5060 oferece uma solução interessante para organizações que buscam consolidar o armazenamento, mantendo a densidade física e o consumo de energia sob controle. Esse nível de capacidade em um único disco U.2 é particularmente relevante para ambientes corporativos e de hiperescala que gerenciam conjuntos de dados de vários petabytes, onde o espaço em rack e a eficiência energética são restrições reais. O J5060 inclui recursos de nível empresarial, como suporte a duas portas, proteção avançada contra perda de energia e otimização de tensão em nível de flash para ajudar a garantir a integridade e a estabilidade dos dados em implantações de alta disponibilidade.

Capa traseira DapuStor J5060

Em relação ao seu desempenho, o J5060 é projetado para cargas de trabalho com alto consumo de leitura. Estima-se que ele tenha uma taxa de transferência de leitura sequencial de até 7,300 MB/s e suporte até 1.5 milhão de IOPS de leitura aleatória de 4K, o que é excelente para uma unidade baseada em QLC. No entanto, seu desempenho de gravação é significativamente mais limitado, com uma especificação de apenas 30 mil IOPS para gravações aleatórias de 16 KB, e essa limitação se manteve constante em nossos testes de carga de trabalho. A largura de banda de gravação da unidade é de 3,000 MB/s. No entanto, essa taxa não se sustenta bem em operações de gravação sustentadas ou de alta profundidade, o que pode afetar sua adequação para tarefas mistas ou com uso intensivo de gravação.

Porta DapuStor J5060

O uso do QLC NAND permite que a DapuStor ofereça essas altas capacidades a um custo menor, mas com compensações. A resistência é avaliada em apenas 0.5 DWPD (gravações por dia na unidade) ao longo de cinco anos, tornando o J5060 mais adequado para aplicações centradas em leitura com volumes de gravação baixos a moderados. Cargas de trabalho que envolvem checkpoints frequentes, registros de transações ou cache ativo podem sobrecarregar a resistência da unidade e revelar limitações no desempenho de gravação.

PCB DapuStor J5060

Em termos de energia, o disco consome aproximadamente 12 watts durante leituras, até 23 watts durante gravações e apenas 5 watts em modo inativo. Esses números atendem às expectativas dos data centers corporativos modernos, especialmente para implantações de alta densidade, onde a potência por terabyte é uma preocupação crescente.

Nesta análise, nos concentraremos no modelo de 61.44 TB e examinaremos seu perfil de desempenho no mundo real por meio de uma série de cargas de trabalho sintéticas e alinhadas ao aplicativo.

Especificações do DapuStor J5060

J5060
Capacidade (TB) 61.44
Fator de Forma U.2 15mm
Interface PCIe 4.0 x4, NVMe 1.4a, porta dupla suportada
Largura de banda de leitura/gravação (128 K) MB/s 7400 / 3000
Leitura/gravação aleatória (4 KB) K IOPS 1500 / 30 (16 KB)
Latência aleatória 4K (Tip.) R/W µs 105 (4 KB) / 33 (16 KB)
Latência sequencial 4K (típica) R/W µs 7 (4 KB) / 12 (16 KB)
Potência Típica (W) 23
Potência ociosa (W) 5
Tipo de flash Flash NAND QLC 3D Enterprise
resistencia 0.5 DWPD
MTBF 2 milhões de horas
UBER 1 setor por 10^17 bits lidos
Garantia 5 anos

Desempenho do DapuStor J5060

Ponto de verificação

Para avaliar o desempenho real do SSD Dapustor J5060 em ambientes de treinamento de IA, utilizamos a ferramenta de benchmark Data and Learning Input/Output (DLIO) . Desenvolvida pelo Argonne National Laboratory, a DLIO foi projetada especificamente para testar padrões de E/S em cargas de trabalho de aprendizado profundo. Ela fornece informações sobre como os sistemas de armazenamento lidam com desafios como checkpointing, ingestão de dados e treinamento de modelos. O gráfico abaixo ilustra como ambos os drives lidam com o processo em 99 checkpoints. Ao treinar modelos de aprendizado de máquina, os checkpoints são essenciais para salvar o estado do modelo periodicamente, evitando a perda de progresso durante interrupções ou falhas de energia. Essa demanda de armazenamento requer um desempenho robusto, especialmente sob cargas de trabalho sustentadas ou intensivas.

A plataforma escolhida para este trabalho foi o nosso Dell PowerEdge R760 com Ubuntu 22.04.02 LTS. Utilizamos o benchmark DLIO versão 2.0, lançado em 13 de agosto de 2024. A configuração do nosso sistema está descrita abaixo:

  • 2 x Intel Xeon Gold 6430 (32 núcleos, 2.1 GHz)
  • 16 x 64GB DDR5-4400
  • SSD Dell BOSS de 480 GB
  • Cabos seriais Gen5 JBOF
    • Disco Rígido Externo J61.44 de 5060 TB
    • 61.44 TB Solidigm D5-P5336

Para garantir que nosso benchmarking refletisse cenários do mundo real, baseamos nossos testes na arquitetura do modelo LLAMA 3.1 405B. Implementamos pontos de verificação usando torch.save() para capturar parâmetros do modelo, estados do otimizador e estados da camada. Nossa configuração simulou um sistema de 8 GPUs, implementando uma estratégia de paralelismo híbrido com processamento paralelo de tensor de 4 vias e processamento paralelo de pipeline de 2 vias distribuídos pelas oito GPUs. Essa configuração resultou em tamanhos de pontos de verificação de 1,636 GB, representativos dos requisitos modernos de treinamento de modelos de linguagem de grande porte.

No geral, o Dapustor J5060 demonstrou sólida consistência durante a fase inicial de testes, com tempos em torno de 575.66 segundos nos primeiros 33 pontos de verificação. O 5060J conseguiu manter um desempenho superior antes de a unidade ser preenchida pela primeira vez. Por outro lado, o Solidigm P5336, embora inicialmente mais lento que o J5060, demonstrou desempenho consistente à medida que os testes continuavam.

 

Considerando as médias gerais, o Dapustor J5060 registrou um tempo de 769.44 segundos , enquanto o Solidigm P5336 completou em 640.17 segundos . Isso coloca o Solidigm P5336 à frente em termos de velocidade de salvamento de pontos de controle.

No geral, o Dapustor J5060 lida bem com operações mais curtas, mas tem dificuldades com gravações sustentadas por mais de 30 minutos. Já o Solidigm P5336 apresenta melhor desempenho, garantindo desempenho consistente em tarefas prolongadas. Esse desempenho de gravação mais fraco do Dapustor J5060 fica evidente quando sua velocidade de checkpoint diminui à medida que o teste prossegue.

Armazenamento direto da GPU

O GPU Direct Storage é uma tecnologia que permite a transferência direta de dados entre dispositivos de armazenamento e GPUs, ignorando a CPU e a memória do sistema. Na transferência de dados tradicional, os dados são lidos do armazenamento para a memória da CPU e, em seguida, copiados para a memória da GPU. Esse processo envolve múltiplas cópias de dados, resultando em maior latência e desempenho reduzido. A CPU atua como um gargalo, pois precisa lidar com a transferência de dados entre o armazenamento e a GPU. O GDS elimina esse gargalo permitindo que os dispositivos de armazenamento transfiram dados diretamente de e para a memória da GPU.

Testamos sistematicamente cada combinação dos seguintes parâmetros em cargas de trabalho de leitura e gravação:

  • Tamanhos de bloco: 1M, 128K, 16K
  • Profundidade de IO: 128, 64, 32, 16, 8, 4, 1

Ao revisar nossos resultados do GDSIO, examinamos o desempenho de leitura e gravação do Dapustor J61.44 de 5060 TB e do Solidigm P5336.

Desempenho de leitura sequencial GDSIO

O Dapustor J5060 atinge um pico de taxa de transferência de leitura de 4.2 GiB/s em um tamanho de bloco de 1 M com profundidades de E/S de 64 e 128. No menor tamanho de bloco (16K), o desempenho varia de 0.1 GiB/s a 0.8 GiB/s conforme a profundidade de E/S aumenta. Isso demonstra uma clara preferência por tamanhos de bloco maiores com altas profundidades de E/S para uma taxa de transferência ideal. O desempenho máximo é alcançado em tamanhos de bloco grandes, indicando a eficiência da unidade no processamento de transferências de dados em massa.

Comparativamente, o Solidigm P5336 atingiu uma taxa de transferência máxima semelhante de 4.3 GiB/s no mesmo tamanho de bloco (1M), mas atingiu esse desempenho mais cedo com uma profundidade de E/S de 32 e o manteve consistentemente em profundidades de E/S mais altas. Isso sugere uma eficiência ligeiramente melhor para o Solidigm P5336 no processamento de blocos grandes em uma faixa mais ampla de profundidades de E/S.

Para uma melhor comparação, temos um gráfico diferencial comparando os dois discos. Um bloco com tonalidade mais verde demonstra uma vantagem do SSD Dapustor, enquanto um bloco que se move para o lado vermelho do espectro demonstra uma fraqueza. Aqui, o J5060 supera o P5336 no tamanho de bloco de 128K, exceto nas profundidades de E/S de 4 a 8. No entanto, quedas na taxa de transferência são observadas em profundidades de E/S mais altas com tamanhos de bloco de 16K e 1M, indicando menor eficiência nesses cenários.

Na comparação de latência de leitura sequencial, o Solidigm P5336 mantém consistentemente uma latência menor que o Dapustor J5060 em quase todos os tamanhos de bloco e profundidades de E/S. Em um tamanho de bloco de 16K, a diferença se torna mais pronunciada à medida que a profundidade da fila aumenta: o J5060 atinge o pico de 2,329 μs a uma profundidade de 128, enquanto o P5336 permanece mais baixo, em 1,365 μs. A 128K, o Solidigm novamente lidera na maioria das profundidades, com exceção de cargas altas (4,080 μs no J5060 contra 5539 μs no P5336) na profundidade de 128. No tamanho de bloco de 1M, ambas as unidades apresentam aumentos de latência, como esperado, mas o P5336 permanece ligeiramente melhor controlado, com 29,138 μs contra 29,512 μs na profundidade de fila mais alta.

 

Desempenho de gravação sequencial GDSIO

O Dapustor J5060 mostra uma taxa de transferência de gravação consistente de 2.7 a 2.8 GiB/s para tamanhos de bloco de 128K e 1M em todas as profundidades de E/S (exceto 128K, tamanho de profundidade de E/S 1, que registrou 2.2 GiB/s). Para tamanhos de bloco de 16K, o desempenho varia de 0.5 GiB/s a 1.4 GiB/s, dependendo da profundidade de E/S, atingindo o pico de 1.4 GiB/s em profundidades de E/S mais altas.

Em comparação, o Solidigm P5336 apresenta melhor desempenho em blocos de 128K e 1M, atingindo um pico de 3.2GiB/s. Para blocos menores (16K), o Solidigm P5336 também apresenta desempenho superior, atingindo um pico de 1.4GiB/s em profundidades de E/S de 16 a 64. Isso indica que o Solidigm P5336 é ligeiramente mais eficiente com blocos menores durante operações de gravação.

Passando para uma visão diferencial, observamos uma lacuna maior entre o Dapustor J5060 e o desempenho de gravação do Solidigm P5336. Nossa comparação de throughput mostra que o J5060 fica atrás do P5336 na maioria dos aspectos, particularmente com tamanhos de bloco grandes (1M) em todas as profundidades de E/S. As quedas de throughput chegam a -0.5 GiB/s nas 4 profundidades de E/S. Embora haja ganhos de desempenho em profundidades de E/S maiores com os tamanhos de bloco de 128K, eles não são significativos o suficiente para compensar o baixo desempenho geral.

Ao comparar a latência de gravação sequencial entre o Dapustor J5060 e o Solidigm P5336, ambos os drives apresentam comportamento semelhante em tamanhos de bloco menores, como 16K, com o Solidigm mantendo uma ligeira vantagem em profundidades de E/S menores, enquanto o Dapustor diminui a diferença em profundidades maiores (64 e 128). Em tamanhos de bloco de 128K, o Solidigm novamente lidera em profundidades de fila menores, mas o Dapustor consistentemente oferece latência menor à medida que a profundidade de E/S aumenta, indicando melhor escalabilidade sob carga. No entanto, com tamanhos de bloco de 1M, o Solidigm mantém uma clara vantagem de latência em todas as profundidades de E/S, mostrando tempos de resposta significativamente mais rápidos sob cargas de trabalho pesadas de gravação sequencial. No geral, o Solidigm tem um desempenho mais consistente, enquanto a força do Dapustor é mais visível em blocos de tamanho médio e filas mais profundas.

Resumo da carga de trabalho da FIO

O Flexible I/O Tester (FIO) é uma ferramenta de benchmarking padrão do setor usada para medir o desempenho de dispositivos de armazenamento em uma ampla variedade de cenários de carga de trabalho. Reconhecido por sua versatilidade e confiabilidade, o FIO simula condições reais, fornecendo insights sobre os recursos e limites de desempenho de um SSD. O StorageReview utiliza o FIO para oferecer análises abrangentes, medindo throughput, latência e IOPS em padrões de carga de trabalho, tamanhos de bloco e profundidades de fila.

Cargas de trabalho aplicadas:

  • Leitura e gravação sequencial de 128K
  • 64 mil leituras e gravações aleatórias
  • 16 mil leituras e gravações aleatórias
  • 4 mil leituras e gravações aleatórias

Essas cargas de trabalho representam um amplo espectro de casos de uso empresarial, incluindo grandes transferências sequenciais, E/S aleatórias intensivas típicas de bancos de dados e acessos aleatórios de pequenos blocos comumente vistos em ambientes virtualizados.

Esta seção de desempenho resume o desempenho do Dapustor J5060 em cargas de trabalho sintéticas essenciais, incluindo operações de leitura/gravação sequenciais e aleatórias em diferentes tamanhos de bloco e profundidades de fila. As métricas são extraídas diretamente da saída do fio analisada e incluem largura de banda (MB/s), IOPS e percentis de latência de até 99.9999%, oferecendo insights sobre o desempenho da taxa de transferência e o comportamento da cauda sob carga.

Desempenho de leitura e gravação sequencial de 128K

Tração Profundidade de thread/IO BW (MB/s) IOPS 99.0% 99.9% 99.99%
Leitura do Dapustor J5060 1T/64Q 7,482 57,081 1.66 ms 2.02 ms 2.83 ms
Leitura Solidigm P5336 1T/64Q 7,479 57,057 1.51 ms 1.66 ms 1.81 ms
Gravador Dapustor J5060 1T/16Q 3,023 23,063 0.69 ms 0.69 ms 0.70 ms
Gravação Solidigm P5336 1T/16Q 3,364 25,669 2.67 ms 3.48 ms 4.42 ms

O Dapustor J5060 oferece um desempenho impressionante de leitura sequencial a 128K, atingindo 7.48 GB/s com controle rigoroso de latência, mesmo em percentis mais altos. Comparado ao Solidigm P5336, a taxa de transferência do J5060 é essencialmente a mesma (7.48 GB/s vs. 7.47 GB/s). No entanto, o Solidigm mantém uma ligeira vantagem na consistência da latência, apresentando uma latência de cauda ligeiramente menor.

Com 128K gravações sequenciais (QD16), o J5060 atinge um desempenho sólido de 3,023 MB/s com latência baixíssima. No entanto, o Solidigm P5336 supera essa marca por uma margem moderada, atingindo 3,364 MB/s, embora com uma latência notavelmente maior, especialmente no percentil 99.99% (4.42 ms contra os notavelmente baixos 0.70 ms do Dapustor). Isso indica que o J5060 é um candidato mais forte para cenários de gravação sequencial sensíveis à latência.

Desempenho de leitura e gravação aleatória de 64K

Tração Profundidade de E/S BW (MB/s) IOPS 99.0% 99.9% 99.99%
Leitura do Dapustor J5060 8T/32Q 7,475 114,058 20.05 ms 21.89 ms 25.82 ms
Leitura Solidigm P5336 8T/32Q 7,472 114,014 21.36 ms 21.89 ms 22.68 ms
Gravador Dapustor J5060 8T/32Q 534 8,151 574.6 ms 708.8 ms 742.39 ms
Gravação Solidigm P5336 8T/32Q 857 13,070 196.1 ms 208.6 ms 221.24 ms

Em leituras aleatórias de 64K (QD256), o Dapustor J5060 se destaca com uma taxa de transferência próxima a 7.4 GB/s e latência bem controlada. Os resultados da Solidigm são bastante semelhantes (7.47 GB/s), com latência percentual máxima ligeiramente melhor. Ambas as unidades têm um desempenho excepcional, com diferenças práticas mínimas.

O desempenho de gravação a 64K aleatórios é onde o J5060 apresenta dificuldades notáveis, com a taxa de transferência caindo drasticamente para 534 MB/s e a latência aumentando significativamente (742.39 ms a 99.99%). Em comparação, o Solidigm P5336 supera significativamente o J5060, entregando 857 MB/s e latência drasticamente menor (221.24 ms no mesmo percentil), tornando-o muito mais adequado para aplicações sensíveis à latência e taxa de transferência de gravação sustentada.

Desempenho de leitura e gravação aleatória de 16K

Tração Profundidade de E/S BW (MB/s) IOPS 99.0% 99.9% 99.99%
Leitura do Dapustor J5060 8T/32Q 7,430 453,461 5.28 ms 6.39 ms 8.16 ms
Leitura Solidigm P5336 8T/32Q 7,431 453,527 5.01 ms 5.21 ms 5.47 ms
Gravador Dapustor J5060 8T/32Q 531 32,404 143.65 ms 149.94 ms 181.40 ms
Gravação Solidigm P5336 8T/32Q 847 51,724 57.9 ms 65.8 ms 71.8 ms

Na carga de trabalho de leitura aleatória de 16K (QD256), o Dapustor alcança excelentes resultados com 453K IOPS e latência controlada. O Solidigm P5336 essencialmente espelha esse desempenho, superando ligeiramente o Dapustor em latência (5.47 ms vs. 8.16 ms a 99.99%), sugerindo uma consistência de latência ligeiramente melhor para o Solidigm em cenários de leitura aleatória intensa.

O desempenho de gravação aleatória de 16K do SSD Dapustor cai significativamente para 32K IOPS, e a latência aumenta para 181.4 ms (99.99%). Novamente, a Solidigm supera significativamente a unidade Dapustor, entregando 51.7K IOPS e um perfil de latência significativamente melhorado (71.8 ms a 99.99%), ressaltando a vantagem da Solidigm para cargas de trabalho de gravação aleatória sensíveis à latência.

Desempenho de leitura e gravação aleatória de 4K

Tração Profundidade de E/S BW (MB/s) IOPS 99.0% 99.9% 99.99%
Leitura do Dapustor J5060 8T/32Q 6,941 1,694,464 1.43 ms 1.58 ms 1.79 ms
Leitura Solidigm P5336 8T/32Q 3,994 975,108 2.31 ms 2.41 ms 2.64 ms
Gravador Dapustor J5060 8T/32Q 131 31,923 143.65 ms 145.75 ms 179.31 ms
Gravação Solidigm P5336 8T/32Q 197 48,030 58.5 ms 64.2 ms 68.7 ms

O cenário de leitura aleatória em 4K é um destaque para o Dapustor J5060, com desempenho máximo superior a 1.69 milhão de IOPS em QD256, combinado com uma latência impressionantemente baixa. Em comparação, o Solidigm P5336 fica significativamente atrás, gerenciando apenas 975 mil IOPS com latência notavelmente maior em todos os percentis. Para leituras aleatórias intensivas de pequenos blocos, o Dapustor J5060 é claramente a melhor escolha.

Infelizmente, o desempenho de gravação aleatória em 5060K do J4 cai drasticamente, produzindo apenas 131 MB/s e 31.9 K IOPS com alta latência (179.31 ms a 99.99%). O SSD Solidigm lida com esse cenário com mais facilidade, entregando 197 MB/s, 48 ​​K IOPS e latência de cauda significativamente menor (68.7 ms a 99.99%). Apesar de o Solidigm também apresentar picos de latência, ele continua sendo um disco muito mais potente para cargas de trabalho exigentes de gravação aleatória em 4K.

Conclusão

Em suma, o DapuStor J5060 é um SSD QLC empresarial de alta capacidade projetado para cargas de trabalho com uso intensivo de leitura, onde a densidade de armazenamento e o custo por terabyte têm prioridade sobre o desempenho de gravação sustentado. Com capacidades de até 61.44 TB e uma interface PCIe Gen4, é mais adequado para ambientes como redes de distribuição de conteúdo, arquivos em nuvem ou sistemas de inferência de IA que dependem de grandes leituras sequenciais e gravações pouco frequentes.

Com esse objetivo em mente, submetemos o J5060 a vários testes para verificar seu desempenho na prática, especialmente em comparação com o Solidigm P5336. O J5060 oferece um desempenho sólido de leitura sequencial e oferece armazenamento de alta densidade, o que pode funcionar bem em ambientes com alta demanda de leitura. Em alguns casos, especialmente em profundidades de E/S mais baixas e tamanhos de bloco maiores, o J5060 supera o Solidigm P5336. Sua latência e taxa de transferência nesses cenários demonstram que ele foi desenvolvido para priorizar a eficiência de leitura de blocos grandes.

No entanto, o desempenho sofre um impacto significativo quando se considera a atividade de gravação. Em quase todas as métricas de gravação (incluindo IOPS, latência e taxa de transferência), o J5060 apresenta desempenho consistentemente inferior. Essa fraqueza é mais visível sob pressão de gravação sequencial em altas profundidades de E/S e tamanhos de bloco grandes, onde a latência é relativamente alta e a taxa de transferência se estabiliza. Mesmo durante cargas de trabalho de checkpoint relacionadas à IA, o J5060 começa forte, mas seu desempenho cai rapidamente, sinalizando problemas com a consistência de gravação sustentada.

Para organizações com necessidades de leitura intensa e orientadas por capacidade, o J5060 oferece valor claro, mas suas limitações o tornam mais difícil de vender para cargas de trabalho mistas ou com uso intensivo de gravação.

Envolva-se com a StorageReview

Newsletter | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Feed RSS

Lyle Smith

Lyle é redator da StorageReview, onde aborda uma ampla gama de tópicos de TI para usuários finais e empresas.