StorageReview.com

Ocena wpływu kanałów DRAM na wydajność wnioskowania AI

AI  ◇  Enterprise

Pamięć systemowa DRAM odgrywa ważną rolę w sztucznej inteligencji (AI), szczególnie w wnioskowaniu procesora (CPU). Wraz ze wzrostem złożoności aplikacji AI, zapotrzebowanie na szybsze i wydajniejsze rozwiązania pamięciowe staje się coraz bardziej krytyczne. Chcieliśmy przyjrzeć się znaczeniu pamięci systemowej DRAM w AI, koncentrując się na wnioskowaniu procesora (CPU) i kluczowej roli wykorzystania wielu kanałów pamięci.

Kingston KSM56R46BD4PMI-64HAI DDR5

Kingston KSM56R46BD4PMI-64HAI DDR5

Znaczenie pamięci DRAM w systemie AI

Pamięć DRAM systemu to centralny węzeł danych w systemach AI. Dane są tymczasowo przechowywane, co umożliwia szybki dostęp do nich przez procesor, umożliwiając szybkie przetwarzanie danych.

Jest to szczególnie istotne w aplikacjach AI, gdzie szybkie i wydajne przetwarzanie dużych zbiorów danych jest nie tylko zaletą, ale wręcz koniecznością. Przyjrzyjmy się bliżej wielopłaszczyznowej roli pamięci DRAM w systemie w zwiększaniu możliwości AI:

  • Szybkość i wydajność: Algorytmy sztucznej inteligencji (AI), szczególnie w zakresie wnioskowania, wymagają szybkiej pamięci do przetwarzania ogromnych ilości danych. Systemowa pamięć DRAM zapewnia tę szybkość, redukując opóźnienia i zwiększając ogólną wydajność systemu.
  • Pojemność: Nowoczesne aplikacje AI wymagają dużej pojemności pamięci. Pamięć DRAM o dużej pojemności umożliwia przetwarzanie większych zbiorów danych w pamięci, unikając wolniejszego procesu pobierania danych z urządzeń pamięci masowej.
  • Niezawodność: W sztucznej inteligencji integralność danych jest kluczowa. Systemowa pamięć DRAM, z funkcjami korekcji błędów, minimalizuje ryzyko uszkodzenia danych, co jest kluczowe w aplikacjach, w których dokładność ma kluczowe znaczenie.
  • Skalowalność: Wraz ze wzrostem złożoności modeli AI, możliwość skalowania zasobów pamięci staje się niezwykle istotna. Systemowa pamięć DRAM oferuje skalowalność niezbędną do sprostania rosnącym wymaganiom ewoluujących aplikacji AI i ich rosnącym potrzebom w zakresie danych.
  • Przepustowość: Większa przepustowość systemowej pamięci DRAM umożliwia szybszy transfer danych, a tym samym szybszy dostęp do danych. Jest to szczególnie przydatne w przypadku trenowania złożonych sieci neuronowych i zarządzania zadaniami przetwarzania danych na dużą skalę.

Wnioskowanie procesora i pamięć DRAM

W sztucznej inteligencji wnioskowanie procesorowe – proces wykorzystywania wytrenowanego modelu do formułowania prognoz lub decyzji – oraz rola pamięci DRAM to kluczowe elementy, które znacząco wpływają na wydajność i szybkość aplikacji AI. Ta faza wymaga dużej ilości pamięci ze względu na konieczność szybkiego dostępu do dużych zbiorów danych i ich przetwarzania. Jest ona szczególnie wymagająca dla pamięci systemowej ze względu na złożoność i rozmiar przetwarzanych danych.

Pamięć DRAM odgrywa kluczową rolę w optymalizacji wnioskowania procesora w operacjach AI dzięki kilku kluczowym udoskonaleniom. Po pierwsze, zapewnia niezbędną przepustowość, aby osiągnąć wysoką przepustowość danych, co jest niezbędne do szybkiego przetwarzania danych i podejmowania decyzji w wnioskowaniu procesora. Ta zwiększona przepustowość bezpośrednio przekłada się na szybszą realizację złożonych zadań.

Dodatkowo, dzięki przechowywaniu danych blisko procesora, systemowa pamięć DRAM znacząco skraca czas dostępu do danych, minimalizując tym samym ogólne opóźnienia w procesie wnioskowania. Ta bliskość jest kluczowa dla utrzymania szybkości i responsywności systemu. Wreszcie, dzięki szybkiemu przetwarzaniu danych i skróceniu czasu dostępu, całkowite zapotrzebowanie na moc obliczeniową procesora w procesie wnioskowania ulega znacznemu zmniejszeniu. Prowadzi to do bardziej energooszczędnego działania i zapewnia bardziej zrównoważone i ekonomiczne środowisko dla aplikacji AI.

Rola wielu kanałów pamięci

Architektura pamięci systemowej jest kluczowym elementem w definiowaniu wydajności aplikacji AI. Wykorzystanie wielu kanałów pamięci jest jak poszerzanie autostrady – umożliwia większy przepływ danych jednocześnie, znacząco poprawiając ogólną wydajność systemu. Oto, jak wykorzystanie wielu kanałów może zoptymalizować działanie AI:

  • Zwiększona przepustowość: Wiele kanałów zwiększa przepustowość pamięci. Ma to kluczowe znaczenie dla aplikacji AI, ponieważ mogą one przetwarzać i analizować więcej danych jednocześnie, co przekłada się na krótszy czas wnioskowania.
  • Przetwarzanie równoległe: Dzięki wielu kanałom dane można przetwarzać równolegle, co znacznie przyspiesza obliczenia AI obejmujące duże zbiory danych.
  • Mniejsza liczba wąskich gardeł: Wiele kanałów pamięci pomaga zredukować wąskie gardła w systemie. Rozłożenie obciążenia pamięci umożliwia wydajniejszą pracę każdego kanału, co przekłada się na poprawę ogólnej wydajności systemu.

Dane testowe

Aby potwierdzić zalety pamięci DRAM w systemach AI, szczególnie w zakresie wnioskowania procesora, przeprowadziliśmy serię testów z użyciem ośmiu modułów pamięci Kingston KSM56R46BD4PMI-64HAI DDR5 w różnych konfiguracjach kanałów.

KSM48R40BD4TMM-64HMR 64 GB 2Rx4 8G x 80-bit PC5-4800 CL40 Registered EC8 288-pinowa pamięć DIMM KSM56R46BD4PMI-64HAI 64 GB 2Rx4 8 G x 80-bit PC5-5600 CL46 Registered EC8 288-pinowa pamięć DIMM
Szybkość transferu 4800 MT / s 5600 MT / s
CL(IDD) cykle 40 cykle 46
Czas cyklu rzędowego (tRCmin) 48 ns(min) 48 ns(min)
Odśwież do czasu aktywności/czasu polecenia odświeżania (tRFCmin) 295 ns(min) 295 ns(min)
Czas aktywności rzędu 32 ns(min) 32 ns(min)
Czas wstępnego ładowania rzędu 16 ns(min) 16 ns(min)
Ocena UL 94 V – 0 94 V – 0
temperatura robocza od 0°C do +95°C od 0°C do +95°C
Temperatura przechowywania -55°C do +100°C -55°C do +100°C

Aby ustalić punkt odniesienia, przeprowadziliśmy ukierunkowane testy wydajności procesora i testy Geekbench, mierząc jego możliwości w poszczególnych konfiguracjach. Aby poważnie obciążyć cały system, w tym pamięć operacyjną i dyskową, wybraliśmy y-cruncher ze względu na jego rygorystyczne wymagania. Takie podejście pozwala nam ocenić spójność i wytrzymałość całego systemu w ekstremalnych warunkach, dając jasny obraz ogólnej wydajności i stabilności.

Ostatecznie wyniki te dostarczą konkretnych danych na temat tego, w jaki sposób pamięć DRAM systemu i liczba kanałów pamięci bezpośrednio wpływają na szybkość obliczeń, wydajność i ogólną wydajność systemu w aplikacjach AI.

Geekbench 6

Na początek Geekbench 6 , wieloplatformowy test porównawczy mierzący ogólną wydajność systemu. Porównania z dowolnym systemem można znaleźć w przeglądarce Geekbench . Im wyższy wynik, tym lepiej.

Geekbench 6 Kingston DDR5
Kanały 2
Kingston DDR5
Kanały 4
Kingston DDR5
Kanały 8
Test wydajności procesora:
Pojedynczy rdzeń
2,083 2,233 2,317
Test wydajności procesora:
Multi-Core
14,404 18,561 19,752

Wyniki Geekbench 6 dla pamięci Kingston DDR5 pokazują szereg rozbieżności w porównaniu konfiguracji 2-, 4- i 8-kanałowych. W testach jednordzeniowych wyniki rosną nieznacznie, ale konsekwentnie – z 2,083 punktów przy dwóch kanałach do 2,317 punktów przy ośmiu kanałach, co wskazuje na poprawę wydajności i przepustowości dla poszczególnych rdzeni wraz ze wzrostem liczby kanałów. Jednak najbardziej spektakularny wzrost wydajności obserwuje się w testach wielordzeniowych, gdzie wyniki skaczą z 14 404 punktów przy dwóch kanałach do aż 19 752 punktów przy ośmiu kanałach.

y-cruncher

Y-cruncher, wielowątkowy i skalowalny program, potrafi obliczać Pi i inne stałe matematyczne z dokładnością do bilionów cyfr. Od momentu premiery w 2009 roku, Y-cruncher stał się popularną aplikacją do benchmarkingu i testów obciążeniowych dla overclockerów i entuzjastów sprzętu. W tym teście im szybciej, tym lepiej.

y-cruncher
(Całkowity czas obliczeń)
Kingston DDR5
Kanały 2
Kingston DDR5
Kanały 4
Kingston DDR5
Kanały 8
1 miliard cyfr Sekundy 18.117 Sekundy 10.856 Sekundy 7.552
2.5 miliard cyfr Sekundy 51.412 31.861 sekund 20.981 sekund
5 miliard cyfr Sekundy 110.728 64.609 sekund 46.304 sekund
10 miliard cyfr Sekundy 240.666 138.402 sekund 103.216 sekund
25 miliardów cyfr Sekundy 693.835 396.997 sekund  N / A

Test porównawczy y-cruncher dla 2, 4 i 8 kanałów wykazuje wyraźną i stałą poprawę szybkości obliczeniowej wraz ze wzrostem liczby kanałów. Przy obliczaniu 1 miliarda cyfr liczby Pi, całkowity czas obliczeń znacznie się skraca, z 18.117 sekundy przy dwóch kanałach do zaledwie 7.552 sekundy przy ośmiu kanałach.

Ta tendencja do skracania czasu obliczeń utrzymuje się we wszystkich testowanych skalach – czas obliczenia 25 miliardów cyfr spadł z 693.835 sekund do 396.997 sekund w przypadku przejścia z 2 do 4 kanałów.

3DMark – profil procesora

Test profilu procesora w programie 3DMark mierzy wydajność procesora w szerokim zakresie liczby wątków, oferując szczegółowy wgląd w to, jak różne konfiguracje kanałów pamięci RAM DDR5 wpływają na obsługę obciążenia i wydajność procesora. Test ten jest przydatny do zrozumienia niuansów wydajnościowych w operacjach intensywnie wykorzystujących pamięć oraz aplikacjach wielowątkowych, przy użyciu różnych konfiguracji kanałów pamięci RAM DDR5.

3DMark – Profil procesora – Wyniki
Ilość wątków Kingston DDR5
Kanały 2
Kingston DDR5
Kanały 4
Kingston DDR5
Kanały 8
Maksymalna liczba wątków 15,822 15,547 15,457
Wątki 16 10,632 9,515 10,367
Wątki 8 4,957 6,019 5,053
Wątki 4 3,165 3,366 3,323
Wątki 2 1,726 1,765 1,781
1 wątku 907 911 884

Wyniki profilu procesora 3DMark dla pamięci RAM Kingston DDR5 przedstawiają dość złożony obraz. Wskazują, że optymalna liczba kanałów może się różnić w zależności od liczby wątków i konkretnego obciążenia.

Przy maksymalnej liczbie wątków wyniki są najwyższe przy dwóch kanałach (15 822) i nieznacznie spadają przy większej liczbie kanałów, co sugeruje, że dodatkowe kanały nie przynoszą korzyści w przypadku zadań o wysokim stopniu równoległości. Jednak przy ośmiu wątkach konfiguracja 4-kanałowa uzyskuje najwyższy wynik (6,019), co wskazuje na optymalny punkt, w którym dodatkowe kanały poprawiają obsługę paralelizmu średniego poziomu. Wyniki są podobne we wszystkich konfiguracjach kanałów przy niższej liczbie wątków (4, 2 i 1 wątek).

Wyniki te sugerują, że chociaż większa liczba kanałów może przynieść korzyści niektórym operacjom wielowątkowym, wpływ ten różni się w zależności od charakteru zadania i architektury systemu. Oznacza to, że więcej nie zawsze oznacza lepiej w każdym przypadku użycia.

Wpływ kanału DRAM na wnioskowanie AI

Wszystkie testy przeprowadzono na procesorze Intel Xeon w9-3475X, wykorzystując interfejs API Intel OpenVINO w ramach testu UL Labs Procyon Benchmark.

Test UL Procyon AI Inference Benchmark, wyposażony w szereg silników wnioskowania AI od czołowych dostawców, zaspokaja szerokie spektrum konfiguracji i wymagań sprzętowych. Wynik testu zapewnia wygodne i ujednolicone podsumowanie wydajności wnioskowania na urządzeniu. Pozwala nam to porównywać i zestawiać różne konfiguracje sprzętowe w rzeczywistych sytuacjach, bez konieczności stosowania rozwiązań wewnętrznych.

Wyniki w teście FP32 mieszczą się w granicach błędu statystycznego, ale ciekawiej robi się, gdy przejdziemy do testu INT, gdzie bierzemy pod uwagę wyniki szczegółowe, a nie wynik ogólny.

Większa liczba daje lepszy wynik ogólny, mniejsza liczba lepszy czas.

Pierwszy jest FP32 Precision

FP 32
Precyzja 8 kanału 2 kanału
Ogólna ocena 629 630
Średni czas wnioskowania MobileNet V3 0.81 0.77
Średni czas wnioskowania ResNet 50 1.96 1.82
Średni czas wnioskowania Inception V4 6.93 7.31
Średni czas wnioskowania DeepLab V3 6.27 6.17
Średni czas wnioskowania YOLO V3 12.99 13.99
Średni czas wnioskowania REAL-ESRGAN 280.59 282.45

Następny w kolejce jest FP16 Precision

FP 16
Precyzja 8 kanału 2 kanału
Ogólna ocena 645 603
Średni czas wnioskowania MobileNet V3 0.81 0.76
Średni czas wnioskowania ResNet 50 1.91 1.94
Średni czas wnioskowania Inception V4 7.11 7.27
Średni czas wnioskowania DeepLab V3 6.27 7.13
Średni czas wnioskowania YOLO V3 12.93 15.01
Średni czas wnioskowania REAL-ESRGAN 242.24 280.91

I na koniec INT

INT
Precyzja 8 kanału 2 kanału
Ogólna ocena 1,033 1004
Średni czas wnioskowania MobileNet V3 0.71 0.73
Średni czas wnioskowania ResNet 50 1.48 1.48
Średni czas wnioskowania Inception V4 4.42 4.47
Średni czas wnioskowania DeepLab V3 4.33 4.99
Średni czas wnioskowania YOLO V3 5.15 5.12
Średni czas wnioskowania REAL-ESRGAN 122.40 123.57

Przepustowość i opóźnienie pamięci DRAM

Najpierw przyjrzymy się opóźnieniom w konfiguracji DRAM z 2 i 8 kanałami. Przeprowadziliśmy profilowanie całego procesora i pamięci, ale skupiliśmy się wyłącznie na przejściu z pamięci podręcznej procesora do pamięci DRAM. Ponieważ nasz procesor Xeon W9-3475X ma tylko 82.50 MB pamięci podręcznej L3, wyciągnęliśmy wykres na początku tego przejścia.

Rozmiar testu (KB) 2-kanałowa przepustowość
Opóźnienie 8 kanałów (ns)
65,536 48.70080 47.24411
98,304 68.16823 66.25920
131,072 85.38640 82.16685
262,144 114.32570 107.57450
393,216 121.74860 115.40340
524,288 129.38970 123.22100
1,048,576 144.32880 138.28380

Tutaj możemy zobaczyć, że dodanie większej liczby kanałów nieznacznie poprawiło opóźnienie.

Przechodząc do przepustowości instrukcji AVX512, widzimy nieco bardziej drastyczną różnicę w przepustowości między 2 a 8 kanałami. Delta to spadek wydajności między 2 a 8 kanałami.

Rozmiar testu (KB) AVX512 2 przepustowości kanału (GB/s) 8 przepustowości kanału (GB/s) Delta (różnica GB/s)
65,536 3,455.28 3,767.91 -312.63
98,304 1,801.88 2,011.83 -209.95
131,072 1,009.21 1,436.50 -427.28
262,144 178.52 508.65 -330.13
393,216 114.76 433.91 -319.15
524,288 94.81 396.90 -302.09
1,048,576 71.12 293.26 -222.13
1,572,864 66.98 267.44 -200.46
2,097,152 65.08 262.50 -197.42
3,145,728 63.63 253.12 -189.50

Wniosek

Podsumowując, systemowa pamięć DRAM stanowi fundament architektury systemów AI, zwłaszcza w zakresie wnioskowania procesorów. Jej zdolność do zapewnienia szybkiej, niezawodnej i rozbudowanej pamięci jest niezbędna. Co więcej, wykorzystanie wielu kanałów pamięci może znacząco poprawić wydajność aplikacji AI poprzez zwiększenie przepustowości, umożliwienie przetwarzania równoległego i minimalizację wąskich gardeł. Wraz z rozwojem AI, optymalizacja systemowej pamięci DRAM pozostanie kluczowym elementem zapewniającym najwyższy poziom wydajności i efektywności.

Obraz generowany przez sztuczną inteligencję, stworzony przez Jordana Ranousa

Co więcej, dane testowe potwierdzają tę tezę, demonstrując namacalne korzyści płynące z ulepszonych konfiguracji pamięci. W miarę jak poszerzamy granice sztucznej inteligencji i przetwarzania danych, strategiczne zwiększanie pamięci systemowej będzie miało kluczowe znaczenie dla wspierania kolejnej generacji innowacji w dziedzinie sztucznej inteligencji i zastosowań w świecie rzeczywistym.

Skontaktuj się z StorageReview

Biuletyn | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Kanał RSS

Jordan Ranous

Specjalista ds. sztucznej inteligencji (AI); oprowadzi Cię po świecie sztucznej inteligencji w przedsiębiorstwach. Autor i analityk magazynu Storage Review, z doświadczeniem w analizie dużych zbiorów danych finansowych, operacjach centrów danych/DevOps i analityce obsługi klienta (CX). Pilot, astrofotograf, ekspert od taśm LTO i entuzjasta baterii/energii słonecznych.