Firma Meta ogłosiła postępy w swojej infrastrukturze AI, prezentując Meta Training and Inference Accelerator (MTIA) nowej generacji. To osiągnięcie stanowi znaczący krok naprzód w działaniach Meta zmierzających do udoskonalenia produktów, usług i badań opartych na sztucznej inteligencji, odpowiadając na rosnące zapotrzebowanie na bardziej zaawansowane modele AI.
Po wprowadzeniu akceleratora pierwszej generacji, projekt MTIA udoskonala wydajność obliczeniową niezbędną dla charakterystycznych obciążeń AI Meta. Obejmuje to modele rekomendacji oparte na głębokim uczeniu, które są integralną częścią podnoszenia jakości doświadczeń użytkowników na platformach Meta.
MTIA nowej generacji kontra MTIA pierwszej generacji
Pierwsza generacja MTIA przeszła znaczące udoskonalenia technologiczne w porównaniu z następną generacją, aby sprostać rosnącym wymaganiom związanym z obciążeniami AI. Początkowo zbudowany w procesie technologicznym 7 nm firmy TSMC, MTIA pierwszej generacji miał częstotliwość taktowania 800 MHz, obsługiwał 1.12 miliarda bramek i zapewniał do 102.4 teraflopów na sekundę (TFLOPS/s) dla operacji INT8. Wyposażony był w 128 MB pamięci wbudowanej i 64 GB pamięci LPDDR5 poza układem, a jego TDP wynosiło 25 W. Konfiguracja ta została zoptymalizowana pod kątem równowagi między wydajnością a energooszczędnością, z całkowitą przepustowością pamięci wynoszącą 400 GB/s na element przetwarzający (PE) dla pamięci lokalnej i 800 GB/s dla pamięci wbudowanej.
Nowa generacja MTIA została oparta na bardziej zaawansowanym procesie technologicznym 5 nm firmy TSMC, co pozwala akceleratorowi pracować z wyższą częstotliwością 1.35 GHz. Ta modernizacja podwaja liczbę bramek do 2.35 miliarda i zwiększa liczbę FLOPS-ów do 103 milionów, co oznacza znaczny wzrost możliwości obliczeniowych układu. Nowa generacja MTIA wprowadza trzykrotny wzrost lokalnej pamięci PE i podwaja pamięć SRAM w układzie do 256 MB, a jednocześnie rozszerza pamięć LPDDR5 poza układem do 128 GB. Wzrost ten idzie w parze ze zwiększoną przepustowością pamięci, sięgającą do 1 TB/s na PE w przypadku pamięci lokalnej i 2.7 TB/s w przypadku pamięci w układzie, co zapewnia wyższą przepustowość i wydajność danych.
Ponadto, TDP wynosi teraz 90 watów, aby sprostać wyższym wymaganiom wydajności. Złącze hosta zostało również ulepszone do 8x PCIe Gen5, co podwaja przepustowość do 32 GB/s, co umożliwia szybszy transfer danych między akceleratorem a systemem hosta. Te znaczące usprawnienia zapewniają solidniejszą podstawę do tworzenia i wdrażania aplikacji i usług opartych na sztucznej inteligencji.
Funkcje MTIA nowej generacji
W swojej istocie MTIA wykorzystuje zaawansowane układy PE o strukturze siatki 8×8, które znacząco zwiększają wydajność obliczeniową zarówno w środowiskach o dużej gęstości, jak i małej gęstości. To ulepszenie przypisuje się udoskonaleniom architektonicznym oraz znacznemu zwiększeniu lokalnej pamięci PE, pamięci SRAM na układzie scalonym oraz przepustowości. Co więcej, ulepszona architektura sieci na układzie scalonym (NoC) akceleratora ułatwia szybką koordynację między układami PE, zapewniając niskie opóźnienia przetwarzania danych, niezbędne w złożonych zadaniach AI.
Podejście Meta wykracza poza innowacje krzemowe. MTIA nowej generacji jest wspierany przez solidny system rackowy, który może pomieścić do 72 akceleratorów, oferując znaczny potencjał skalowania dla ambitnych projektów Meta w dziedzinie sztucznej inteligencji. Konstrukcja systemu pozwala na wyższą częstotliwość i wydajność operacyjną, z łatwością dostosowując się do zróżnicowanej złożoności modeli.
Integracja oprogramowania odgrywa również kluczową rolę w ekosystemie MTIA. Meta wykorzystuje swoją pracę nad PyTorch, aby zapewnić bezproblemową kompatybilność i wydajność programistów. Zastosowanie zaawansowanych frameworków programistycznych i wykonawczych, takich jak Triton-MTIA, ułatwia efektywne tłumaczenie modeli sztucznej inteligencji na instrukcje obliczeń o wysokiej wydajności, usprawniając proces rozwoju oprogramowania.
Wstępne wyniki wydajności MTIA nowej generacji
Meta twierdzi, że wstępne wskaźniki wydajności wskazują na znaczną poprawę w porównaniu z pierwszą generacją, co dowodzi jego zdolności do wydajnego przetwarzania prostych i złożonych algorytmów rankingowych i rekomendacyjnych. Ten układ zarządza algorytmami, które różnią się znacznie pod względem rozmiaru i zapotrzebowania na moc obliczeniową, przewyższając standardowe komercyjne procesory graficzne dzięki zintegrowanemu podejściu technologicznemu Meta. Firma koncentruje się na zwiększeniu efektywności energetycznej, wdrażając te układy w swoich systemach.
Wstępne testy wykazały, że układ MTIA nowej generacji trzykrotnie przewyższa wydajność swojego poprzednika w kluczowych modelach. Dzięki ulepszonemu systemowi, który obejmuje dwukrotnie więcej urządzeń i wydajny dwugniazdowy procesor, Meta osiągnęła sześciokrotny wzrost przepustowości przetwarzania modeli i 50% poprawę efektywności energetycznej w porównaniu z konfiguracją MTIA pierwszej generacji. Ulepszenia te wynikają z szeroko zakrojonych optymalizacji komponentów obliczeniowych i architektury serwerów. Optymalizacja modeli stała się szybsza wraz z dojrzewaniem ekosystemu deweloperskiego, oferując jednocześnie duży potencjał dalszego wzrostu wydajności.
Układ MTIA, obecnie aktywny w centrach danych, usprawnia przetwarzanie obciążeń AI w Meta, okazując się strategicznym uzupełnieniem komercyjnych procesorów graficznych. Wraz z szeregiem inicjatyw mających na celu rozszerzenie funkcjonalności MTIA, ta wersja stanowi kolejny ważny krok w kierunku realizacji zaangażowania firmy w rozwój technologii AI i jej zastosowań.





Amazon