StorageReview.com

WEKApod 3 firmy WEKA przełamuje barierę eksabajtów w jednym stojaku, a NeuralMesh 6 staje się wielodostępny

Enterprise   ◇  Pamięć masowa przedsiębiorstwa  ◇  Oprogramowanie

Firma WEKA wprowadziła na rynek dwa połączone produkty: NeuralMesh 6, swoją najważniejszą jak dotąd wersję oprogramowania, oraz WEKApod 3, nową generację urządzeń pamięci masowej zaprojektowanych i skonstruowanych przez WEKA do jego obsługi. NeuralMesh 6 można nadal wdrażać na sprzęcie wybranym przez klienta, natomiast WEKApod zapewnia gotową ścieżkę, dostarczaną z preinstalowanym oprogramowaniem. NeuralMesh 6 wprowadza natywną obsługę wielu najemców, połączony stos protokołów plików i obiektów, mobilność danych opartą na metadanych, ciągłą redukcję danych z gwarancjami umownymi, natywne operacje Kubernetes oraz zintegrowaną obserwację. WEKApod 3 to sprzęt zaprojektowany na zamówienie, który, jak twierdzi firma, zapewnia najwyższą pojemność i gęstość wydajności dostępną w jednej szafie rack. Dostępne są trzy konfiguracje: Nitro, Prime i Prime Max, które zapewniają odpowiednio maksymalną wydajność, zrównoważoną pojemność i maksymalną gęstość.

WEKA NeuralMesh 6

Oba ogłoszenia odzwierciedlają powszechnie panującą zmianę na rynku: w miarę jak obciążenia AI przechodzą od uczenia do wnioskowania opartego na długim kontekście, agentach i pobieraniu w skali produkcyjnej, infrastruktura pamięci masowej i operacyjnej, a nie tylko liczba procesorów GPU, coraz częściej decyduje o koszcie na token i możliwej do osiągnięcia przepustowości.

NeuralMesh 6: obsługa wielu dzierżaw, protokoły zunifikowane i mobilność danych

NeuralMesh 6 łączy w sobie funkcje, które według WEKA operatorzy infrastruktury AI tradycyjnie musieli składać ze sobą, korzystając z rozwiązań różnych dostawców: obsługę wielu dzierżaw, ujednolicony stos protokołów dla plików i obiektów, mobilność danych między lokalizacjami, ciągłą redukcję danych, zarządzanie natywne dla Kubernetesa oraz zintegrowaną obserwację. Wszystkie te funkcje są zintegrowane w jednym stosie oprogramowania, a nie składane z oddzielnych części.

Multi-tenancy jest podzielony na dwa poziomy, które można łączyć. Klastry Composable zapewniają izolację na poziomie sprzętowym, z dedykowanym procesorem, pamięcią i dyskami pamięci masowej dla każdego dzierżawcy, przeznaczoną dla dzierżawców głównych, którzy potrzebują gwarantowanych zasobów i przewidywalnej wydajności. Virtual Multi-Tenancy dodaje izolację sieciową w stylu VPC poprzez zwirtualizowaną strukturę danych RDMA firmy WEKA, obsługującą prywatne sieci VLAN, nakładające się przestrzenie adresów IP, jakość usług i szyfrowanie dla każdego dzierżawcy z niezależnym zarządzaniem kluczami oraz niezależne uwierzytelnianie LDAP lub Active Directory dla każdego dzierżawcy. Virtual Multi-Tenancy skaluje się do ponad 1,000 odizolowanych logicznych dzierżawców na klaster, a przydzielanie nowych dzierżawców zajmuje mniej niż 30 minut. Dwa poziomy się łączą, więc pojedynczy klaster sprzętowy WEKA z 50 klastrami Composable może obsługiwać do 50 000 logicznie odizolowanych dzierżawców na tej samej infrastrukturze fizycznej, umożliwiając wzrost z kilkudziesięciu do dziesiątek tysięcy bez konieczności przeprojektowywania systemu.

Panel WEKA NeuralMesh 6

Po stronie protokołu, NeuralMesh 6 implementuje natywny stos S3, w którym te same fizyczne bloki danych są adresowalne jednocześnie przez S3 i POSIX, a nie przez bramkę, która dokonuje między nimi translacji. Plik zapisany przez NFS lub POSIX jest natychmiast odczytywalny z S3 i odwrotnie, eliminując duplikaty pełnych kopii zbioru danych, które zazwyczaj kumulują się podczas przesyłania danych między etapami treningu, dostrajania i wnioskowania. WEKA opracowała implementację S3 specjalnie dla wzorców dostępu AI, obsługując od 2,000 do 5,000 równoczesnych połączeń S3 na węzeł, czyli około pięciokrotnie więcej niż w przypadku konwencjonalnych architektur S3. S3 przez RDMA umożliwia transfer bez kopii bezpośrednio do pamięci GPU.

Mobilność danych jest obsługiwana poprzez replikację opartą na metadanych, dzięki czemu środowisko docelowe można natychmiast przeglądać, bez konieczności tworzenia pełnej kopii danych przed uruchomieniem obciążenia. Dane są przetwarzane na żądanie, co zmniejsza ruch w sieci WAN i pozwala organizacjom na umieszczanie obciążeń w dowolnym miejscu, w którym dostępne są zasoby GPU, a nie tam, gdzie dane zostały pierwotnie zapisane. Ta wersja dodaje asynchroniczną replikację i zdalne buforowanie jako pierwszy krok w kierunku szerszej federacji i globalnej przestrzeni nazw obejmującej różne lokalizacje i chmury.

Możliwość replikacji stanowi już podstawę rzeczywistych wdrożeń: Sam Tabar, dyrektor generalny WhiteFiber, powiedział, że inteligentna replikacja NeuralMesh umożliwia firmie udostępnianie zestawów danych w różnych lokalizacjach i pobieranie dokładnie tych danych, których potrzebuje każde zadanie, do kolejnego przydziału GPU — tej samej architektury, która stoi za projektem Redwood , superklastrem o przepustowości 111.2 Tbps obejmującym wiele centrów danych, który omawialiśmy na początku tego miesiąca.

Redukcja danych do 6X Oszczędności pojemności

NeuralMesh 6 umożliwia również redukcję danych, w tym odcisk palca, haszowanie podobieństw, deduplikację i kompresję, domyślnie w każdym wdrożeniu, z narzutem zapisu poniżej 5%, nawet sześciokrotną oszczędnością pojemności danych szkoleniowych AI oraz gwarancją umowną obejmującą zarówno współczynnik redukcji, jak i wpływ na wydajność. Nowy operator Kubernetes automatyzuje wdrażanie klastrów i zarządzanie cyklem życia w organizacjach korzystających z Kubernetes jako standardowego modelu operacyjnego, co, jak twierdzi WEKA, skraca czas wdrożenia z tygodni do godzin. NeuralMesh Observe, dołączany bezpłatnie do każdego wdrożenia, oferuje oparte na SaaS pulpity nawigacyjne dla wielu klastrów, diagnostykę na poziomie klienta oraz alerty kierowane do Slacka, PagerDuty lub poczty e-mail.

Firma WEKA informuje o wykorzystaniu w środowisku produkcyjnym funkcji Augmented Memory Grid , która rozszerza pamięć GPU poprzez przyspieszenie trwałego dostępu do pamięci podręcznej KV (Key-V) do zarządzanej przez NeuralMesh pamięci masowej NVMe w infrastrukturze Oracle Cloud Infrastructure. Testy porównawcze infrastruktury OCI H100 wykazały 10-krotnie wyższą przepustowość tokenów, 10-krotnie większą liczbę obsługiwanych jednocześnie użytkowników i 7-krotnie większą liczbę tokenów na GPU, co według WEKA jest wynikiem porównywalnym z alternatywnymi rozwiązaniami opartymi na pamięci DRAM. Pablo Selem, starszy dyrektor ds. rozwoju oprogramowania w OCI, określił to podejście jako eliminację wąskich gardeł pamięci, dzięki czemu klienci mogą osiągnąć wyższą przepustowość i większą liczbę użytkowników przy tym samym obciążeniu GPU.

WEKApod 3: Niestandardowy sprzęt zbudowany wokół oprogramowania

WEKApod 3 to autorski projekt sprzętowy firmy WEKA, a nie architektura referencyjna oparta na obudowach OEM innych firm. Firma twierdzi, że pojedyncza szafa WEKApod oferuje 1.1 eksabajta efektywnej pojemności przy 441.5 PB pojemności surowej, co czyni ją pierwszym systemem jednoskrzydłowym, którego efektywna pojemność przekracza eksabajt. Przepustowość na szafę wynosi 10.2 TB/s przy 210 milionach operacji wejścia/wyjścia na sekundę (IOPS). WEKA informuje o 267% wyższej efektywnej gęstości pojemności i 114% wyższej gęstości przepustowości na jednostkę szafy niż druga najlepsza publicznie dostępna alternatywa w każdej kategorii.

Projekt opiera się na wewnętrznej strukturze PCIe Gen 6, kablowym połączeniu dysków zamiast płyty montażowej, sieci NVIDIA ConnectX SuperNIC zapewniającej łączność Spectrum-X Ethernet oraz programowo zarządzanej architekturze termicznej, przystosowanej do pracy w temperaturze otoczenia 35°C, która ogranicza moc NVMe pod wpływem obciążenia termicznego zamiast wyłączać dysk. WEKA posiada wiele patentów zgłoszonych do rozpatrzenia w zakresie obudowy, połączeń dysków, zarządzania temperaturą i konstrukcji ułatwiającej serwisowanie. Funkcje serwisowe obejmują podłączane na gorąco dyski rozruchowe z procesem wymiany sterowanym przez graficzny interfejs użytkownika (GUI), który według WEKA zajmuje około 10 minut zamiast wielogodzinnego okna serwisowego, a także bezobsługowe, chmurowe wdrożenie w skali rack za pośrednictwem NeuralMesh Home.

Trzy konfiguracje dla różnych priorytetów obciążenia

WEKApod Nitro został zaprojektowany do obciążeń, w których przepustowość pamięci masowej ma kluczowe znaczenie, zapewniając pełne wykorzystanie mocy obliczeniowej procesorów graficznych. Posiada dwurzędową, czterowęzłową obudowę z czterema niezależnymi domenami awaryjnymi i 56 dyskami TLC, obsługiwanymi przez dwuportową sieć NVIDIA ConnectX, która zapewnia przepustowość 800 Gb/s. WEKApod Prime kładzie nacisk na zrównoważoną pojemność i wydajność dzięki połączeniu dysków AlloyFlash TLC i QLC, umieszczonych w podobnej, czterowęzłowej, dwurzędowej obudowie obsługującej 56 dysków. WEKApod Prime Max maksymalizuje pojemność w kompaktowej formie: dwurzędowa, dwuwęzłowa obudowa zawierająca 70 dysków NVMe, wykorzystująca dyski SSD 6600 ION o pojemności 245.76 TB firmy Micron , w połączeniu z technologiami obiektowego przechowywania danych i redukcji danych NeuralMesh, pozwala osiągnąć efektywną pojemność 1.1 eksabajta w pojedynczej obudowie 56U. Aby zorientować się, jak ten dysk wpływa na obliczenia w szafie, nasz raport dotyczący mocy i gęstości dysku 6600 ION oblicza eksabajt na podstawie sześciu szaf zamiast 22.

AlloyFlash, funkcja warstwowania, która umożliwia konfiguracje Prime i Prime Max, automatycznie kieruje operacje wrażliwe na opóźnienia do pamięci flash TLC, jednocześnie kierując dane o dużej pojemności do pamięci QLC, co jest tańsze o około 30-40% w przeliczeniu na terabajt i nie wymaga konfiguracji przez klienta. To najwyraźniejszy punkt, w którym wersja oprogramowania NeuralMesh 6 i wersja sprzętowa WEKApod 3 stanowią jeden produkt: logika warstwowania oprogramowania sprawia, że ​​konfiguracje sprzętowe o wyższej gęstości są użyteczne na poziomie wydajności produkcyjnej, a nie tylko podają większą pojemność w specyfikacji.

WEKA opiera swoją decyzję sprzętową na obecnych ograniczeniach centrów danych: budowa centrów danych w USA spadła w 2025 roku po raz pierwszy od 2020 roku, kolejki do sieci na głównych rynkach trwają obecnie od czterech do siedmiu lat, a Morgan Stanley prognozuje 49-gigawatowy niedobór mocy w USA do 2028 roku. Dochodzi do tego ciągły problem z dostawami pamięci NAND i dłuższy czas realizacji zamówień OEM. WEKA argumentuje, że pamięć masowa, która jest nieefektywna pod względem miejsca w szafie i mocy, bezpośrednio konkuruje z procesorami graficznymi o ograniczone zasoby fizyczne. Zarządzając własnym łańcuchem dostaw sprzętu, zamiast polegać na kanałach OEM, firma wierzy, że może zaoferować bardziej przewidywalne ceny i terminy realizacji dla klientów planujących projekty infrastrukturalne na dużą skalę.

Jason Hardy, wiceprezes ds. technologii pamięci masowej w firmie NVIDIA, powiedział, że sieć Ethernet Spectrum-X zapewnia WEKApod 3 strukturę o wysokiej przepustowości i niskich opóźnieniach, niezbędną do utrzymania wolnej ścieżki danych od pamięci masowej do procesora graficznego w dużej skali. Steve McDowell, główny analityk w NAND Research, argumentował, że wnioskowanie w skali produkcyjnej to inny problem infrastrukturalny niż szkolenie, a miarami, które mają znaczenie, są tokeny na szafę, tokeny na wat oraz koszt wnioskowania przy stałym obciążeniu – to właśnie te wskaźniki, jego zdaniem, powinny być brane pod uwagę przez każdego dostawcę. Jeremy Werner, starszy wiceprezes i dyrektor generalny działu Core Data Center w firmie Micron, dodał, że nowa architektura WEKApod z dyskami SSD Micron o pojemności 245 TB oferuje 15.8 petabajtów w obudowie 2U, oszczędzając energię i przestrzeń na dodatkowe obliczenia.

Dostępność:

Oczekuje się, że NeuralMesh 6 będzie powszechnie dostępny w drugiej połowie 2026 roku. Obecni klienci WEKA mogą dokonać aktualizacji bez dodatkowych kosztów za pośrednictwem standardowych kanałów. WEKApod Nitro, Prime i Prime Max są już dostępne do zamówienia za pośrednictwem sieci dystrybutorów WEKA i VAR, a dostawy rozpoczną się jesienią 2026 roku, a NeuralMesh 6 będzie już zainstalowany. Ponadto, po raz pierwszy w tej generacji, WEKApod jest oferowany w konfigurowalnych jednostkach SKU, umożliwiając klientom wybór typu obudowy, pamięci, pojemności i liczby dysków, obsługując systemy o pojemności od poniżej 1 PB do 100 PB lub więcej w jednej konfiguracji.

Skontaktuj się z StorageReview

Biuletyn | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Kanał RSS

Harold Fritts

Pracuję w branży technologicznej od czasu, gdy IBM stworzyło Selectric. Moim głównym zajęciem jest jednak pisanie. Postanowiłem więc odejść z działu przedsprzedaży i wrócić do korzeni, zajmując się trochę pisaniem, ale wciąż angażując się w technologię.