AMD poinformowało, że osiągnęło szacowany czterokrotny wzrost efektywności energetycznej AI od 2024 do połowy 2026 roku, przekraczając tym samym zakładany trzykrotny cel na ten okres. Firma dąży do 20-krotnej poprawy efektywności szkolenia i wnioskowania AI w szafach rack do 2030 roku , co jest celem wyznaczonym w czerwcu 2025 roku.
Firma mierzy postęp w stosunku do poziomu bazowego z 2024 roku, wykorzystując wskaźniki wydajności na wat w reprezentatywnych konfiguracjach szaf AMD. AMD zauważyło, że wyniki z 2026 roku łączą zmierzone dane produktowe z szacunkami modelowymi, w przypadku których ostateczne dane dotyczące wydajności były niedostępne. Kiedy AMD wyznaczało cel 20x, firma stwierdziła, że sam cel wyprzedził trend poprawy w branży w latach 2018–2025 o prawie 3 razy; tymczasowy wynik 4x wyprzedza nawet ten przyspieszony trend.

Superkomputer Lux jest budowany w Oak Ridge National Laboratory w Tennessee. Oparty na technologii AMD, Lux ma być pierwszą operacyjną platformą Genesis Mission i pomoże wzmocnić pozycję Departamentu Energii USA w dziedzinie sztucznej inteligencji oraz przyspieszyć postęp i innowacje w badaniach nad energią, materiałoznawstwie, medycynie i zaawansowanej produkcji. (Źródło: Oak Ridge National Laboratory)
Skala rackowa, a nie na poziomie komponentów
Inicjatywa AMD 20×30 koncentruje się na zyskach w skali szafy rack, a nie wyłącznie na ulepszeniach na poziomie komponentów. Firma opiera swoje podejście na skoordynowanych postępach w zakresie krzemu obliczeniowego, technologii procesowej, przepustowości pamięci i połączeń, oprogramowania i projektowania systemów. Odzwierciedla to rosnące znaczenie optymalizacji pełnego stosu, w miarę jak infrastruktura AI przechodzi z pojedynczych akceleratorów na gęsto zintegrowane szafy rack. „Następna fala wydajności AI będzie zależeć od ściślejszej kooptymalizacji w zakresie krzemu obliczeniowego, pamięci, połączeń, oprogramowania i projektowania systemów w skali szaf rack” – powiedział Sam Naffziger, starszy wiceprezes AMD i ekspert ds. korporacyjnych, w ogłoszeniu. Jest to ta sama prezentacja pełnego stosu, która stoi za Lux, systemem opartym na technologii AMD, który stał się pierwszym superkomputerem Genesis Mission w Oak Ridge National Laboratory.
Firma spodziewa się, że wyższa efektywność energetyczna przyniesie dwa rezultaty do 2030 roku, w zależności od sposobu, w jaki klienci wykorzystają dostępną wydajność. W jednym ze scenariuszy AMD prognozuje, że około dwie przyszłe szafy rack mogłyby zapewnić taką samą moc obliczeniową, jak 570 szaf rack od 2024 roku, zmniejszając zużycie energii elektrycznej w fazie użytkowania o 20 razy i emisję dwutlenku węgla o 28 razy. Alternatywnie, przewidywane ulepszenia mogłyby umożliwić 20-krotnie większą moc obliczeniową, mierzoną w operacjach zmiennoprzecinkowych na sekundę na wat, przy takim samym zużyciu energii.
Technologie pamięci i połączeń są kluczowe dla tych działań. AMD zidentyfikowało pamięć o dużej przepustowości, większe pamięci podręczne i ściślejszą integrację pamięci z obliczeniami jako mechanizmy zapewniające zasilanie zasobów obliczeniowych przy jednoczesnym zmniejszeniu energochłonnego przesyłu danych. Oczekuje się również, że szybkie połączenia skalowalne , stanowiące podstawę stelaża AMD MI455X Helios z 72 procesorami graficznymi, będą zyskiwać na znaczeniu, ponieważ większe obciążenia AI wymagają wydajniejszej komunikacji między procesorami graficznymi, procesorami, pamięcią i innymi komponentami na poziomie stelaża.
Oprogramowanie może zwiększyć jego wydajność do 100x
Oprogramowanie pozostaje kolejnym elementem strategii efektywności firmy. AMD twierdzi, że stos oprogramowania ROCm, otwarte standardy i działania optymalizacyjne dla klientów mają na celu poprawę przepustowości szkolenia i wnioskowania AI, przy jednoczesnym zmniejszeniu zużycia energii na wygenerowany token. Firma spodziewa się, że postęp w oprogramowaniu, algorytmach i modelach pogłębi korzyści sprzętowe i systemowe, potencjalnie przyczyniając się do nawet stukrotnej poprawy efektywności energetycznej AI do 2030 roku.
Coraz większy nacisk kładzie się na użyteczną moc obliczeniową w przeliczeniu na dostępny wat. Ponieważ dostarczanie energii, wydajność chłodzenia i infrastruktura fizyczna stają się ograniczeniami dla rozwoju sztucznej inteligencji, poprawa wydajności w skali szafy w przeliczeniu na wat mogłaby zmniejszyć zużycie energii elektrycznej i poprawić wykorzystanie infrastruktury bez konieczności liniowego skalowania zużycia energii wraz z zapotrzebowaniem na moc obliczeniową.




Amazon