Pamięć systemowa DRAM odgrywa ważną rolę w sztucznej inteligencji (AI), szczególnie w wnioskowaniu procesora (CPU). Wraz ze wzrostem złożoności aplikacji AI, zapotrzebowanie na szybsze i wydajniejsze rozwiązania pamięciowe staje się coraz bardziej krytyczne. Chcieliśmy przyjrzeć się znaczeniu pamięci systemowej DRAM w AI, koncentrując się na wnioskowaniu procesora (CPU) i kluczowej roli wykorzystania wielu kanałów pamięci.
Kingston KSM56R46BD4PMI-64HAI DDR5
Znaczenie pamięci DRAM w systemie AI
Pamięć DRAM systemu to centralny węzeł danych w systemach AI. Dane są tymczasowo przechowywane, co umożliwia szybki dostęp do nich przez procesor, umożliwiając szybkie przetwarzanie danych.
Jest to szczególnie istotne w aplikacjach AI, gdzie szybkie i wydajne przetwarzanie dużych zbiorów danych jest nie tylko zaletą, ale wręcz koniecznością. Przyjrzyjmy się bliżej wielopłaszczyznowej roli pamięci DRAM w systemie w zwiększaniu możliwości AI:
- Szybkość i wydajność: Algorytmy sztucznej inteligencji (AI), szczególnie w zakresie wnioskowania, wymagają szybkiej pamięci do przetwarzania ogromnych ilości danych. Systemowa pamięć DRAM zapewnia tę szybkość, redukując opóźnienia i zwiększając ogólną wydajność systemu.
- Pojemność: Nowoczesne aplikacje AI wymagają dużej pojemności pamięci. Pamięć DRAM o dużej pojemności umożliwia przetwarzanie większych zbiorów danych w pamięci, unikając wolniejszego procesu pobierania danych z urządzeń pamięci masowej.
- Niezawodność: W sztucznej inteligencji integralność danych jest kluczowa. Systemowa pamięć DRAM, z funkcjami korekcji błędów, minimalizuje ryzyko uszkodzenia danych, co jest kluczowe w aplikacjach, w których dokładność ma kluczowe znaczenie.
- Skalowalność: Wraz ze wzrostem złożoności modeli AI, możliwość skalowania zasobów pamięci staje się niezwykle istotna. Systemowa pamięć DRAM oferuje skalowalność niezbędną do sprostania rosnącym wymaganiom ewoluujących aplikacji AI i ich rosnącym potrzebom w zakresie danych.
- Przepustowość: Większa przepustowość systemowej pamięci DRAM umożliwia szybszy transfer danych, a tym samym szybszy dostęp do danych. Jest to szczególnie przydatne w przypadku trenowania złożonych sieci neuronowych i zarządzania zadaniami przetwarzania danych na dużą skalę.
Wnioskowanie procesora i pamięć DRAM
W sztucznej inteligencji wnioskowanie procesorowe – proces wykorzystywania wytrenowanego modelu do formułowania prognoz lub decyzji – oraz rola pamięci DRAM to kluczowe elementy, które znacząco wpływają na wydajność i szybkość aplikacji AI. Ta faza wymaga dużej ilości pamięci ze względu na konieczność szybkiego dostępu do dużych zbiorów danych i ich przetwarzania. Jest ona szczególnie wymagająca dla pamięci systemowej ze względu na złożoność i rozmiar przetwarzanych danych.
Pamięć DRAM odgrywa kluczową rolę w optymalizacji wnioskowania procesora w operacjach AI dzięki kilku kluczowym udoskonaleniom. Po pierwsze, zapewnia niezbędną przepustowość, aby osiągnąć wysoką przepustowość danych, co jest niezbędne do szybkiego przetwarzania danych i podejmowania decyzji w wnioskowaniu procesora. Ta zwiększona przepustowość bezpośrednio przekłada się na szybszą realizację złożonych zadań.
Dodatkowo, dzięki przechowywaniu danych blisko procesora, systemowa pamięć DRAM znacząco skraca czas dostępu do danych, minimalizując tym samym ogólne opóźnienia w procesie wnioskowania. Ta bliskość jest kluczowa dla utrzymania szybkości i responsywności systemu. Wreszcie, dzięki szybkiemu przetwarzaniu danych i skróceniu czasu dostępu, całkowite zapotrzebowanie na moc obliczeniową procesora w procesie wnioskowania ulega znacznemu zmniejszeniu. Prowadzi to do bardziej energooszczędnego działania i zapewnia bardziej zrównoważone i ekonomiczne środowisko dla aplikacji AI.
Rola wielu kanałów pamięci
Architektura pamięci systemowej jest kluczowym elementem w definiowaniu wydajności aplikacji AI. Wykorzystanie wielu kanałów pamięci jest jak poszerzanie autostrady – umożliwia większy przepływ danych jednocześnie, znacząco poprawiając ogólną wydajność systemu. Oto, jak wykorzystanie wielu kanałów może zoptymalizować działanie AI:
- Zwiększona przepustowość: Wiele kanałów zwiększa przepustowość pamięci. Ma to kluczowe znaczenie dla aplikacji AI, ponieważ mogą one przetwarzać i analizować więcej danych jednocześnie, co przekłada się na krótszy czas wnioskowania.
- Przetwarzanie równoległe: Dzięki wielu kanałom dane można przetwarzać równolegle, co znacznie przyspiesza obliczenia AI obejmujące duże zbiory danych.
- Mniejsza liczba wąskich gardeł: Wiele kanałów pamięci pomaga zredukować wąskie gardła w systemie. Rozłożenie obciążenia pamięci umożliwia wydajniejszą pracę każdego kanału, co przekłada się na poprawę ogólnej wydajności systemu.
Dane testowe
Aby potwierdzić zalety pamięci DRAM w systemach AI, szczególnie w zakresie wnioskowania procesora, przeprowadziliśmy serię testów z użyciem ośmiu modułów pamięci Kingston KSM56R46BD4PMI-64HAI DDR5 w różnych konfiguracjach kanałów.
| KSM48R40BD4TMM-64HMR 64 GB 2Rx4 8G x 80-bit PC5-4800 CL40 Registered EC8 288-pinowa pamięć DIMM | KSM56R46BD4PMI-64HAI 64 GB 2Rx4 8 G x 80-bit PC5-5600 CL46 Registered EC8 288-pinowa pamięć DIMM | |
| Szybkość transferu | 4800 MT / s | 5600 MT / s |
| CL(IDD) | cykle 40 | cykle 46 |
| Czas cyklu rzędowego (tRCmin) | 48 ns(min) | 48 ns(min) |
| Odśwież do czasu aktywności/czasu polecenia odświeżania (tRFCmin) | 295 ns(min) | 295 ns(min) |
| Czas aktywności rzędu | 32 ns(min) | 32 ns(min) |
| Czas wstępnego ładowania rzędu | 16 ns(min) | 16 ns(min) |
| Ocena UL | 94 V – 0 | 94 V – 0 |
| temperatura robocza | od 0°C do +95°C | od 0°C do +95°C |
| Temperatura przechowywania | -55°C do +100°C | -55°C do +100°C |
Aby ustalić punkt odniesienia, przeprowadziliśmy ukierunkowane testy wydajności procesora i testy Geekbench, mierząc jego możliwości w poszczególnych konfiguracjach. Aby poważnie obciążyć cały system, w tym pamięć operacyjną i dyskową, wybraliśmy y-cruncher ze względu na jego rygorystyczne wymagania. Takie podejście pozwala nam ocenić spójność i wytrzymałość całego systemu w ekstremalnych warunkach, dając jasny obraz ogólnej wydajności i stabilności.
Ostatecznie wyniki te dostarczą konkretnych danych na temat tego, w jaki sposób pamięć DRAM systemu i liczba kanałów pamięci bezpośrednio wpływają na szybkość obliczeń, wydajność i ogólną wydajność systemu w aplikacjach AI.
Geekbench 6
Na początek Geekbench 6 , wieloplatformowy test porównawczy mierzący ogólną wydajność systemu. Porównania z dowolnym systemem można znaleźć w przeglądarce Geekbench . Im wyższy wynik, tym lepiej.
| Geekbench 6 | Kingston DDR5 Kanały 2 |
Kingston DDR5 Kanały 4 |
Kingston DDR5 Kanały 8 |
| Test wydajności procesora: Pojedynczy rdzeń |
2,083 | 2,233 | 2,317 |
| Test wydajności procesora: Multi-Core |
14,404 | 18,561 | 19,752 |
Wyniki Geekbench 6 dla pamięci Kingston DDR5 pokazują szereg rozbieżności w porównaniu konfiguracji 2-, 4- i 8-kanałowych. W testach jednordzeniowych wyniki rosną nieznacznie, ale konsekwentnie – z 2,083 punktów przy dwóch kanałach do 2,317 punktów przy ośmiu kanałach, co wskazuje na poprawę wydajności i przepustowości dla poszczególnych rdzeni wraz ze wzrostem liczby kanałów. Jednak najbardziej spektakularny wzrost wydajności obserwuje się w testach wielordzeniowych, gdzie wyniki skaczą z 14 404 punktów przy dwóch kanałach do aż 19 752 punktów przy ośmiu kanałach.
y-cruncher
Y-cruncher, wielowątkowy i skalowalny program, potrafi obliczać Pi i inne stałe matematyczne z dokładnością do bilionów cyfr. Od momentu premiery w 2009 roku, Y-cruncher stał się popularną aplikacją do benchmarkingu i testów obciążeniowych dla overclockerów i entuzjastów sprzętu. W tym teście im szybciej, tym lepiej.
| y-cruncher (Całkowity czas obliczeń) |
Kingston DDR5 Kanały 2 |
Kingston DDR5 Kanały 4 |
Kingston DDR5 Kanały 8 |
| 1 miliard cyfr | Sekundy 18.117 | Sekundy 10.856 | Sekundy 7.552 |
| 2.5 miliard cyfr | Sekundy 51.412 | 31.861 sekund | 20.981 sekund |
| 5 miliard cyfr | Sekundy 110.728 | 64.609 sekund | 46.304 sekund |
| 10 miliard cyfr | Sekundy 240.666 | 138.402 sekund | 103.216 sekund |
| 25 miliardów cyfr | Sekundy 693.835 | 396.997 sekund | N / A |
Test porównawczy y-cruncher dla 2, 4 i 8 kanałów wykazuje wyraźną i stałą poprawę szybkości obliczeniowej wraz ze wzrostem liczby kanałów. Przy obliczaniu 1 miliarda cyfr liczby Pi, całkowity czas obliczeń znacznie się skraca, z 18.117 sekundy przy dwóch kanałach do zaledwie 7.552 sekundy przy ośmiu kanałach.
Ta tendencja do skracania czasu obliczeń utrzymuje się we wszystkich testowanych skalach – czas obliczenia 25 miliardów cyfr spadł z 693.835 sekund do 396.997 sekund w przypadku przejścia z 2 do 4 kanałów.
3DMark – profil procesora
Test profilu procesora w programie 3DMark mierzy wydajność procesora w szerokim zakresie liczby wątków, oferując szczegółowy wgląd w to, jak różne konfiguracje kanałów pamięci RAM DDR5 wpływają na obsługę obciążenia i wydajność procesora. Test ten jest przydatny do zrozumienia niuansów wydajnościowych w operacjach intensywnie wykorzystujących pamięć oraz aplikacjach wielowątkowych, przy użyciu różnych konfiguracji kanałów pamięci RAM DDR5.
| 3DMark – Profil procesora – Wyniki | |||
| Ilość wątków | Kingston DDR5 Kanały 2 |
Kingston DDR5 Kanały 4 |
Kingston DDR5 Kanały 8 |
| Maksymalna liczba wątków | 15,822 | 15,547 | 15,457 |
| Wątki 16 | 10,632 | 9,515 | 10,367 |
| Wątki 8 | 4,957 | 6,019 | 5,053 |
| Wątki 4 | 3,165 | 3,366 | 3,323 |
| Wątki 2 | 1,726 | 1,765 | 1,781 |
| 1 wątku | 907 | 911 | 884 |
Wyniki profilu procesora 3DMark dla pamięci RAM Kingston DDR5 przedstawiają dość złożony obraz. Wskazują, że optymalna liczba kanałów może się różnić w zależności od liczby wątków i konkretnego obciążenia.
Przy maksymalnej liczbie wątków wyniki są najwyższe przy dwóch kanałach (15 822) i nieznacznie spadają przy większej liczbie kanałów, co sugeruje, że dodatkowe kanały nie przynoszą korzyści w przypadku zadań o wysokim stopniu równoległości. Jednak przy ośmiu wątkach konfiguracja 4-kanałowa uzyskuje najwyższy wynik (6,019), co wskazuje na optymalny punkt, w którym dodatkowe kanały poprawiają obsługę paralelizmu średniego poziomu. Wyniki są podobne we wszystkich konfiguracjach kanałów przy niższej liczbie wątków (4, 2 i 1 wątek).
Wyniki te sugerują, że chociaż większa liczba kanałów może przynieść korzyści niektórym operacjom wielowątkowym, wpływ ten różni się w zależności od charakteru zadania i architektury systemu. Oznacza to, że więcej nie zawsze oznacza lepiej w każdym przypadku użycia.
Wpływ kanału DRAM na wnioskowanie AI
Wszystkie testy przeprowadzono na procesorze Intel Xeon w9-3475X, wykorzystując interfejs API Intel OpenVINO w ramach testu UL Labs Procyon Benchmark.
Test UL Procyon AI Inference Benchmark, wyposażony w szereg silników wnioskowania AI od czołowych dostawców, zaspokaja szerokie spektrum konfiguracji i wymagań sprzętowych. Wynik testu zapewnia wygodne i ujednolicone podsumowanie wydajności wnioskowania na urządzeniu. Pozwala nam to porównywać i zestawiać różne konfiguracje sprzętowe w rzeczywistych sytuacjach, bez konieczności stosowania rozwiązań wewnętrznych.
Wyniki w teście FP32 mieszczą się w granicach błędu statystycznego, ale ciekawiej robi się, gdy przejdziemy do testu INT, gdzie bierzemy pod uwagę wyniki szczegółowe, a nie wynik ogólny.
Większa liczba daje lepszy wynik ogólny, mniejsza liczba lepszy czas.
Pierwszy jest FP32 Precision
| FP 32 | ||
| Precyzja | 8 kanału | 2 kanału |
| Ogólna ocena | 629 | 630 |
| Średni czas wnioskowania MobileNet V3 | 0.81 | 0.77 |
| Średni czas wnioskowania ResNet 50 | 1.96 | 1.82 |
| Średni czas wnioskowania Inception V4 | 6.93 | 7.31 |
| Średni czas wnioskowania DeepLab V3 | 6.27 | 6.17 |
| Średni czas wnioskowania YOLO V3 | 12.99 | 13.99 |
| Średni czas wnioskowania REAL-ESRGAN | 280.59 | 282.45 |
Następny w kolejce jest FP16 Precision
| FP 16 | ||
| Precyzja | 8 kanału | 2 kanału |
| Ogólna ocena | 645 | 603 |
| Średni czas wnioskowania MobileNet V3 | 0.81 | 0.76 |
| Średni czas wnioskowania ResNet 50 | 1.91 | 1.94 |
| Średni czas wnioskowania Inception V4 | 7.11 | 7.27 |
| Średni czas wnioskowania DeepLab V3 | 6.27 | 7.13 |
| Średni czas wnioskowania YOLO V3 | 12.93 | 15.01 |
| Średni czas wnioskowania REAL-ESRGAN | 242.24 | 280.91 |
I na koniec INT
| INT | ||
| Precyzja | 8 kanału | 2 kanału |
| Ogólna ocena | 1,033 | 1004 |
| Średni czas wnioskowania MobileNet V3 | 0.71 | 0.73 |
| Średni czas wnioskowania ResNet 50 | 1.48 | 1.48 |
| Średni czas wnioskowania Inception V4 | 4.42 | 4.47 |
| Średni czas wnioskowania DeepLab V3 | 4.33 | 4.99 |
| Średni czas wnioskowania YOLO V3 | 5.15 | 5.12 |
| Średni czas wnioskowania REAL-ESRGAN | 122.40 | 123.57 |
Przepustowość i opóźnienie pamięci DRAM
Najpierw przyjrzymy się opóźnieniom w konfiguracji DRAM z 2 i 8 kanałami. Przeprowadziliśmy profilowanie całego procesora i pamięci, ale skupiliśmy się wyłącznie na przejściu z pamięci podręcznej procesora do pamięci DRAM. Ponieważ nasz procesor Xeon W9-3475X ma tylko 82.50 MB pamięci podręcznej L3, wyciągnęliśmy wykres na początku tego przejścia.
| Rozmiar testu (KB) | 2-kanałowa przepustowość |
Opóźnienie 8 kanałów (ns)
|
| 65,536 | 48.70080 | 47.24411 |
| 98,304 | 68.16823 | 66.25920 |
| 131,072 | 85.38640 | 82.16685 |
| 262,144 | 114.32570 | 107.57450 |
| 393,216 | 121.74860 | 115.40340 |
| 524,288 | 129.38970 | 123.22100 |
| 1,048,576 | 144.32880 | 138.28380 |
Tutaj możemy zobaczyć, że dodanie większej liczby kanałów nieznacznie poprawiło opóźnienie.
Przechodząc do przepustowości instrukcji AVX512, widzimy nieco bardziej drastyczną różnicę w przepustowości między 2 a 8 kanałami. Delta to spadek wydajności między 2 a 8 kanałami.
| Rozmiar testu (KB) AVX512 | 2 przepustowości kanału (GB/s) | 8 przepustowości kanału (GB/s) | Delta (różnica GB/s) |
| 65,536 | 3,455.28 | 3,767.91 | -312.63 |
| 98,304 | 1,801.88 | 2,011.83 | -209.95 |
| 131,072 | 1,009.21 | 1,436.50 | -427.28 |
| 262,144 | 178.52 | 508.65 | -330.13 |
| 393,216 | 114.76 | 433.91 | -319.15 |
| 524,288 | 94.81 | 396.90 | -302.09 |
| 1,048,576 | 71.12 | 293.26 | -222.13 |
| 1,572,864 | 66.98 | 267.44 | -200.46 |
| 2,097,152 | 65.08 | 262.50 | -197.42 |
| 3,145,728 | 63.63 | 253.12 | -189.50 |
Wniosek
Podsumowując, systemowa pamięć DRAM stanowi fundament architektury systemów AI, zwłaszcza w zakresie wnioskowania procesorów. Jej zdolność do zapewnienia szybkiej, niezawodnej i rozbudowanej pamięci jest niezbędna. Co więcej, wykorzystanie wielu kanałów pamięci może znacząco poprawić wydajność aplikacji AI poprzez zwiększenie przepustowości, umożliwienie przetwarzania równoległego i minimalizację wąskich gardeł. Wraz z rozwojem AI, optymalizacja systemowej pamięci DRAM pozostanie kluczowym elementem zapewniającym najwyższy poziom wydajności i efektywności.
Obraz generowany przez sztuczną inteligencję, stworzony przez Jordana Ranousa
Co więcej, dane testowe potwierdzają tę tezę, demonstrując namacalne korzyści płynące z ulepszonych konfiguracji pamięci. W miarę jak poszerzamy granice sztucznej inteligencji i przetwarzania danych, strategiczne zwiększanie pamięci systemowej będzie miało kluczowe znaczenie dla wspierania kolejnej generacji innowacji w dziedzinie sztucznej inteligencji i zastosowań w świecie rzeczywistym.




Amazon