StorageReview.com

Procesor DPU NVIDIA Bluefield-2 zapewnia rekordową wydajność

Enterprise   ◇  Sieci

NVIDIA kontynuuje ewolucję jednostki przetwarzania danych (DPU), wprowadzając na rynek układ NVIDIA BlueField-2. NVIDIA BlueField-2 DPU jest reklamowany jako infrastruktura centrum danych na chipie, zoptymalizowana pod kątem obciążeń chmurowych i HPC dla przedsiębiorstw. BlueField-2 łączy kartę sieciową NVIDIA ConnectX-6 Dx z szeregiem rdzeni ARM i odciążeniami specyficznymi dla infrastruktury, oferując specjalnie zaprojektowane, sprzętowe silniki akceleracji z pełną programowalnością. Brian rozmawiał z NVIDIA na początku tego roku w jednym ze swoich regularnych podcastów. Więcej szczegółów na temat NVIDIA DPU można znaleźć tutaj.

NVIDIA Bluefield-2

Funkcje są imponujące, ale najpierw przyjrzyjmy się ewolucji DPU. Jeśli nie interesuje Cię historia, możesz pominąć szczegóły dotyczące NVIDIA BlueField-2. Początki sięgają lat 90., kiedy procesory Intel x86 zapewniły przedsiębiorstwom niezrównaną moc obliczeniową w połączeniu z systemem operacyjnym. Następnie pojawił się model klient/serwer, a następnie nadejście przetwarzania rozproszonego. Rozwój oprogramowania i rosnące bazy danych gwałtownie przyspieszyły, co spowodowało gwałtowny wzrost liczby wdrożeń sprzętu w centrach danych.

Na początku XXI wieku firma VMware wprowadziła hiperwizor ESX i zwirtualizowała procesor x86, umożliwiając uruchamianie wielu instancji systemu operacyjnego na jednym serwerze. Maszyny wirtualne nie były nowością; IBM przez wiele lat, zanim opracowano hiperwizor ESX, uruchamiał maszyny wirtualne na swoich komputerach mainframe. Jednak ten rozwój doprowadził do wzrostu agregacji infrastruktury centrów danych.

Sprzęt stał się teraz programowalny, a programiści pisali kod, który definiował i konfigurował maszyny wirtualne bez ręcznej ingerencji. Doprowadziło to ostatecznie do nacisku na migrację do chmury obliczeniowej.

Firma VMware dostrzegła sukces swojej platformy ESX i szybko wkroczyła w wirtualizację pamięci masowej i sieci. Aby nie być w tyle, EMC nawiązało współpracę z Cisco, aby stworzyć własne zwirtualizowane rozwiązanie sieciowe i pamięci masowej. Doszło do serii przejęć. VMware opracowało vSANS zintegrowane z platformą vSphere.

Rozwój tej konwergentnej infrastruktury nazywa się Software-Defined Data Center (SDDC). Duzi gracze, tacy jak Microsoft, VMware, Cisco i EMC, walczyli o zwycięstwo na rynku SDDC. Wszystko stało się programowalne: wejście/wyjście, bezpieczeństwo, system operacyjny, aplikacje itd. SDDC było jedynie komponentem procesora, obciążającym dostępne zasoby wykorzystywane przez inne usługi.

Cała ta konwergencja i programowalność doprowadziły do ​​rozwoju sztucznej inteligencji (AI), w której procesory graficzne (GPU) zostały opracowane w celu spełnienia wymagań obliczeniowych tych intensywnie graficznie wymagających aplikacji. To z kolei doprowadziło do rozwoju sprzętu odciążającego procesor (CPU) w zakresie niektórych operacji. Funkcje sieciowe, zazwyczaj intensywnie obciążające procesor (CPU), zostały odciążone, a NVIDIA wykorzystała tę nową szansę, przejmując firmę Mellanox, aby opracować inteligentne karty sieciowe.

Procesory graficzne stały się inteligentniejsze, a inteligentne karty sieciowe odegrały kluczową rolę w wyeliminowaniu przetwarzania sieciowego i graficznego z ogólnej agregacji SDDC. Ostatecznie rozwój DPU jest wynikiem odciążenia inteligencji procesora.

Nowy procesor DPU NVIDIA BlueField-2 to system typu system-on-chip łączący wielordzeniowy procesor, wydajny interfejs sieciowy i programowalne silniki przyspieszające.

Procesor DPU NVIDIA BlueField-2 – Mięso

CPU kontra GPU kontra DPU: Czym wyróżnia się DPU? 

DPU to nowa klasa programowalnych procesorów, która łączy trzy kluczowe elementy. DPU to układ scalony (SoC), który łączy:

  1. Wysokowydajny, programowalny programowo, wielordzeniowy procesor zgodny ze standardami branżowymi, zazwyczaj oparty na powszechnie stosowanej architekturze Arm, ściśle powiązany z innymi komponentami SoC.
  2. Wysokowydajny interfejs sieciowy umożliwiający analizowanie, przetwarzanie i wydajne przesyłanie danych z szybkością łącza lub szybkością reszty sieci do procesorów graficznych i procesorów CPU.
  3. Bogaty zestaw elastycznych i programowalnych silników akceleracyjnych, które odciążają i zwiększają wydajność aplikacji z zakresu sztucznej inteligencji i uczenia maszynowego, bezpieczeństwa, telekomunikacji i pamięci masowej oraz innych.

NVIDIA® BlueField®-2 DPU to pierwsza infrastruktura centrum danych typu „na chipie” zoptymalizowana pod kątem nowoczesnych rozwiązań chmurowych i HPC. Oferuje szeroki zestaw akcelerowanych, definiowanych programowo usług sieciowych, pamięci masowej, bezpieczeństwa i zarządzania, z możliwością odciążania, przyspieszania i izolowania infrastruktury centrum danych. Wyposażona w łączność Ethernet 200 Gb/s lub InfiniBand, jednostka DPU BlueField-2 przyspiesza ścieżkę sieciową zarówno dla płaszczyzny sterowania, jak i płaszczyzny danych, a także jest wyposażona w zabezpieczenia „zero trust”, aby zapobiegać wyciekom danych i cyberatakom.

NVIDIA ConnectX®-6 Dx łączy kartę sieciową z szeregiem rdzeni Arm® i odciążeniami specyficznymi dla infrastruktury, oferując specjalnie zaprojektowane, akcelerowane sprzętowo silniki z pełną programowalnością. Umieszczony na krawędzi każdego serwera, BlueField-2 umożliwia zwinne, bezpieczne i wydajne przetwarzanie zadań w chmurze i sztucznej inteligencji (AI), a także obniża całkowity koszt posiadania (TCO), jednocześnie zwiększając wydajność centrum danych.

Platforma programowa NVIDIA DOCA™ umożliwia programistom szybkie tworzenie aplikacji i usług dla jednostki DPU BlueField-2. NVIDIA DOCA wykorzystuje akceleratory sprzętowe DPU, zwiększając wydajność, efektywność i bezpieczeństwo centrum danych.

Funkcje procesora DPU NVIDIA BlueField-2

Interfejsy sieciowe i hosta

Dyski
Interfejsy sieciowe  BlueField SNAP – NVMe™ i VirtIO-blk
 Ethernet – dwa porty 10/25/50/100 Gb/s lub jeden port 200 Gb/s  Przyspieszenie NVMe-oF™
 InfiniBand – dwa porty EDR/HDR100 lub jeden port HDR  Przyspieszenie kompresji i dekompresji
Interfejs PCI Express  Hashowanie i deduplikacja danych
 8 lub 16 linii PCIe Gen 4.0  Złącza M.2/U.2 do bezpośredniego podłączania pamięci masowej
 Rozgałęzienie przełącznika PCIe z 8 portami downstream Sieci
Podsystem ARM/DDR   RoCE, Zero Touch RoCE
Rdzenie ramion   Odciążanie bezstanowe dla:
 Potok do 8 rdzeni Armv8 A72 (64-bitowy)  TCP/UDP/IP
 1 MB pamięci podręcznej L2 na 2 rdzenie   LSO/LRO/suma kontrolna/RSS/TSS/HDS
 Pamięć podręczna L3 o pojemności 6 MB z wieloma zasadami usuwania  Wstawianie/usuwanie sieci VLAN
Obsługa pamięci DIMM DDR4   SR-IOV
 Pojedynczy kontroler pamięci DRAM DDR4   VirtIO-net
 8 GB / 16 GB / 32 GB wbudowanej pamięci DDR4   Wielofunkcyjność na port
 Obsługa ochrony przed błędami ECC   Obsługa VMware NetQueue
Przyspieszenia sprzętowe   Hierarchie wirtualizacji
Ochrona   Poziomy QoS wejścia i wyjścia 1K
 Bezpieczny rozruch z użyciem sprzętowego źródła zaufania Opcje startowe
 Bezpieczna aktualizacja oprogramowania sprzętowego  Bezpieczny rozruch (uwierzytelnianie RSA)
 Zgodny z Cerberusem  Zdalny rozruch przez Ethernet
 Przyspieszenie wyrażeń regularnych (RegEx)  Zdalny rozruch przez iSCSI
 Szyfrowanie danych w ruchu IPsec/TLS  PXE i UEFI
 Klucz AES-GCM 128/256-bitowy Zarząd
 Szyfrowanie danych w stanie spoczynku AES-XTS 256/512-bit  Port zarządzania poza pasmem 1GbE
 Przyspieszenie sprzętowe SHA 256-bit  NC-SI, MCTP przez SMBus i MCTP przez PCIe
 Sprzętowy akcelerator klucza publicznego  PLDM do monitorowania i sterowania DSP0248
 RSA, Diffie-Hellman, DSA, ECC,  PLDM dla aktualizacji oprogramowania sprzętowego DSP026
EC-DSA, EC-DH  Interfejs I2C do sterowania i konfiguracji urządzeń
 Prawdziwy generator liczb losowych (TRNG)  Interfejs SPI do flashowania
 Kontroler pamięci eMMC
 UART
 USB

Jednostka DPU do przechowywania danych, sieci i uczenia maszynowego

Przyjrzyjmy się, jak nowy BlueField-2 radzi sobie z szybkimi technologiami pamięci masowej. BlueField oferuje kompletne rozwiązanie dla platform pamięci masowej, takich jak NVMe over Fabrics (NVMe-oF), macierz All-Flash (AFA), a także kontroler pamięci masowej dla JBOF, buforowanie serwerów (Memcached), rozproszona pamięć masowa w szafach rack oraz skalowalna, bezpośrednio podłączana pamięć masowa. Inteligentne rozwiązania w tym DPU sprawiają, że jest to elastyczny wybór.

Firma NVIDIA opublikowała imponujące wyniki testu BlueField-2 tutaj . Środowisko testowe jest dostępne na blogu.

Kompleksowe rozwiązanie magazynowe

BlueField-2 wykorzystuje moc obliczeniową rdzeni Arm w aplikacjach pamięci masowej, takich jak macierze All-Flash wykorzystujące NVMe-oF, Ceph, Lustre, odciążanie iSCSI/TCP, warstwę translacji Flash, kompresję/dekompresję danych i deduplikację.

W macierzach pamięci masowej o wysokiej wydajności, BlueField-2 pełni funkcję głównego procesora systemu, obsługując zadania kontrolera pamięci masowej i terminację ruchu. Można go również skonfigurować jako koprocesor, odciążając hosta z określonych zadań pamięci masowej, izolując część nośników pamięci od hosta lub umożliwiając abstrakcję logiki pamięci masowej definiowanej programowo za pomocą rdzeni BlueField Arm.

Możliwości NVMe w sieciach szkieletowych

Wykorzystując zaawansowane możliwości protokołu NVMe-oF, technologia BlueField oparta na standardzie RDMA zapewnia wydajność zdalnego dostępu do pamięci masowej równą wydajności pamięci lokalnej, przy minimalnym obciążeniu procesora, umożliwiając wydajne, rozproszone przechowywanie i rozwiązania hiperkonwergentne.

Przyspieszenie przechowywania

Wbudowany przełącznik PCIe BlueField umożliwia klientom budowę samodzielnych urządzeń pamięci masowej i łączenie jednego urządzenia BlueField z wieloma urządzeniami pamięci masowej bez użycia zewnętrznego przełącznika.

Przekazanie podpisu

Wbudowany kontroler sieciowy BlueField umożliwia sprzętowe sprawdzanie informacji o polu integralności danych/ochronie protokołu T10 (T10-DIF/PI), co zmniejsza obciążenie oprogramowania i przyspiesza dostarczanie danych do aplikacji. Przekazywanie podpisów jest obsługiwane przez adapter w przypadku pakietów przychodzących i wychodzących, co zmniejsza obciążenie oprogramowania na komputerach inicjujących i docelowych.

BlueField dla sieci i bezpieczeństwa

Niezależnie od tego, czy działa jako karta sieciowa smartNIC, czy jako samodzielna platforma sieciowa, nowy Bluefield-2 zapewnia efektywne wdrażanie aplikacji sieciowych. Dzięki połączeniu zaawansowanych funkcji odciążania i możliwości obliczeniowych ARM, BlueField kończy protokoły sieciowe i bezpieczeństwa w trybie inline.

Karta sieciowa BlueField SmartNIC 

Jako karta sieciowa zyskujesz elastyczność w zakresie pełnej lub częściowej implementacji płaszczyzny danych i sterowania, co pozwala na efektywniejsze wykorzystanie zasobów obliczeniowych. Programowalność karty umożliwia integrację nowych funkcji płaszczyzny danych i sterowania.

Funkcje bezpieczeństwa BlueField

Jeśli chodzi o bezpieczeństwo, integracja odciążeń szyfrowania dla operacji kryptograficznych symetrycznych i asymetrycznych sprawia, że ​​jest to doskonały wybór do wdrażania aplikacji bezpieczeństwa. Bezpieczeństwo jest wpisane w DNA infrastruktury centrum danych, zmniejszając narażenie na zagrożenia, minimalizując ryzyko oraz umożliwiając zapobieganie, wykrywanie i reagowanie na potencjalne zagrożenia w czasie rzeczywistym.

Bezproblemowa wirtualizacja 

Dzięki technologii PCIe SR-IOV firmy NVIDIA administratorzy centrów danych skorzystają z lepszego wykorzystania serwerów, jednocześnie redukując koszty, zużycie energii i złożoność okablowania, co pozwoli na obsługę większej liczby maszyn wirtualnych i użytkowników na tym samym sprzęcie. To z pewnością rozwiązuje wszelkie problemy związane z całkowitym kosztem posiadania (TCO).

Sieci nakładkowe 

Operatorzy centrów danych wykorzystują technologie nakładkowe sieci (VXLAN, NVGRE, GENEVE) do pokonywania barier skalowalności. Zapewniając zaawansowane mechanizmy odciążania, które enkapsulują/dekapsulują nagłówki protokołów nakładkowych, ta jednostka DPU umożliwia tradycyjnym odciążeniom działanie na protokołach tunelowanych, a także odciąża funkcje routingu NAT.

BlueField dla środowisk uczenia maszynowego

NVIDIA oczywiście skierowała swoją ofertę na rynek sztucznej inteligencji i uczenia maszynowego, oferując nowe DPU, które oferuje ekonomiczne i zintegrowane rozwiązania dla urządzeń uczenia maszynowego. Interfejs PCIe Gen 3.0/4.0 umożliwia podłączenie wielu procesorów GPU. Dzięki technologiom RDMA i GPUDirect® RDMA, BlueField-2 oferuje wydajne dostarczanie danych do analizy i analizy danych w czasie rzeczywistym.

Przyspieszenie RDMA

Sprzęt ścieżki danych kontrolera sieciowego wykorzystuje technologię RDMA i RoCE, zapewniając niskie opóźnienia i wysoką przepustowość przy niemal zerowych cyklach procesora.

BlueField dla platform wieloprocesorowych

BlueField-2 umożliwia podłączenie wielu kart graficznych za pomocą zintegrowanego przełącznika PCIe. Obsługa BlueField PCIe 4.0 gwarantuje wsparcie dla urządzeń GPU nowej generacji.

PeerDirect®

PeerDirect, produkt firmy Mellanox, to przyspieszona architektura komunikacyjna , która obsługuje komunikację peer-to-peer między BlueField a sprzętem innych firm, takim jak karty graficzne (np. NVIDIA GPUDirect RDMA), adaptery koprocesorów (np. Intel Xeon Phi) lub adaptery pamięci masowej. PeerDirect zapewnia standardową architekturę, w której urządzenia mogą komunikować się bezpośrednio ze zdalnymi urządzeniami poprzez infrastrukturę, unikając niepotrzebnych kopii pamięci systemowej i obciążenia procesora poprzez kopiowanie danych bezpośrednio do/z urządzeń.

Technologia GPUDirect RDMA

Szybki wzrost wydajności sprzętu graficznego, w połączeniu z najnowszymi usprawnieniami w programowalności GPU, uczynił z akceleratorów graficznych atrakcyjną platformę do zadań wymagających dużych mocy obliczeniowych w szerokiej gamie zastosowań. Ponieważ GPU oferują dużą liczbę rdzeni i możliwości wykonywania operacji zmiennoprzecinkowych, do połączenia między platformami wymagana jest szybka sieć, zapewniająca wysoką przepustowość i najniższe opóźnienia w komunikacji między GPU a GPU. GPUDirect RDMA to technologia zaimplementowana w procesorach graficznych Bluefield-2 i NVIDIA, która umożliwia bezpośrednią wymianę danych między GPU a szybkim połączeniem.

Technologia GPUDirect RDMA zapewnia znaczną poprawę zarówno przepustowości komunikacji, jak i opóźnień w komunikacji między urządzeniami GPU różnych węzłów klastra.

Wniosek

Testy firmy NVIDIA ujawniły następujące parametry wydajnościowe procesora DPU BlueField:

  • Testowanie przy użyciu mniejszych rozmiarów 512B I/O skutkowało wyższym IOPS, ale niższą przepustowością niższą od szybkości łącza, podczas gdy rozmiary 4KB I/O skutkowały wyższą przepustowością, ale niższą liczbą IOPS.
  • Obciążenia odczytu i zapisu na poziomie 100% zapewniły podobną liczbę operacji wejścia/wyjścia na sekundę (IOPS) i przepustowość, podczas gdy mieszane obciążenia odczytu/zapisu na poziomie 50/50 zapewniły wyższą wydajność, wykorzystując jednocześnie oba kierunki połączenia sieciowego.
  • Użycie SPDK zapewniło wyższą wydajność niż oprogramowanie w przestrzeni jądra, ale odbyło się to kosztem większego wykorzystania procesora serwera, co jest oczekiwanym zachowaniem, ponieważ SPDK działa w przestrzeni użytkownika z ciągłym sondowaniem.
  • Nowsze jądro Linux 5.15 działało lepiej od jądra 4.18 ze względu na ulepszenia dotyczące pamięci masowej dodawane regularnie przez społeczność Linuxa.

Ogólnie rzecz biorąc, wyniki testu wewnętrznego są imponujące. BlueField-2 osiągnął 41.5 miliona IOPS , czyli ponad czterokrotnie więcej niż jakikolwiek inny DPU dostępny obecnie na rynku.

Standardowe wyniki sieciowe również były imponujące. Jednostka DPU osiągnęła ponad pięć milionów IOPS przy 4 KB i od siedmiu milionów do ponad 20 milionów IOPS przy 512 KB dla NVMe-oF . Jeśli szukasz sposobu na poprawę ogólnej wydajności w centrum danych, ta jednostka DPU powinna spełnić Twoje oczekiwania.

Skontaktuj się z StorageReview

Biuletyn | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Kanał RSS

Harold Fritts

Pracuję w branży technologicznej od czasu, gdy IBM stworzyło Selectric. Moim głównym zajęciem jest jednak pisanie. Postanowiłem więc odejść z działu przedsprzedaży i wrócić do korzeni, zajmując się trochę pisaniem, ale wciąż angażując się w technologię.