Amazon Web Services (AWS) ogłosił ogólną dostępność instancji AWS EC2 Trn1. Instancje Trn1, oparte na układach Trainium zaprojektowanych przez AWS, zostały zaprojektowane specjalnie z myślą o wydajnym szkoleniu modeli uczenia maszynowego (w chmurze). Amazon deklaruje redukcję kosztów szkolenia o 50% w porównaniu z podobnymi instancjami opartymi na GPU.
Instancje AWS EC2 Trn1 zapewniają najszybszy czas trenowania popularnych modeli uczenia maszynowego w AWS. Pozwala to klientom skrócić czas trenowania, szybko iterować modele w celu zwiększenia dokładności oraz poprawić ogólną wydajność w przypadku obciążeń takich jak przetwarzanie języka naturalnego, rozpoznawanie mowy i obrazu, wyszukiwanie semantyczne, silniki rekomendacji, wykrywanie oszustw i prognozowanie.
Instancje Trn1 są również bardzo elastyczne pod względem cenowym, ponieważ nie ma minimalnych zobowiązań ani opłat początkowych. Klienci płacą tylko za wykorzystaną ilość mocy obliczeniowej.
Rozmiary i specyfikacje instancji AWS EC2 Trn1
| Nazwa instancji | vCPU | Chipy AWS Trainium | Pamięć akceleratora | NeuronLink | Pamięć instancji | Sieć instancji | Lokalna pamięć masowa instancji |
| trn1.2xduży | 8 | 1 | 32 GB | N / A | 32 GB | Do 12.5 Gb / s | 1x 500 GB NVMe |
| trn1.32xduży | 128 | 16 | 512 GB | Utrzymany | 512 GB | 800 Gbps | 4x 2 TB NVMe |
Wcześniej, nawet jeśli organizacje korzystały z najszybszych dostępnych instancji przyspieszonych, szkolenie bardziej złożonych modeli uczenia maszynowego było nadal niezwykle kosztowne i czasochłonne. Dzięki nowym instancjom AWS EC2 Trn1, Amazon może pochwalić się najlepszym stosunkiem ceny do jakości i najszybszym szkoleniem modeli uczenia maszynowego w AWS.
Inne godne uwagi cechy to m.in.:
- Osoby chcące zacząć bez znaczących zmian w kodzie mogą skorzystać z AWS Neuron, zestawu narzędzi programistycznych (SDK) dla instancji Trn1. Jest on również zintegrowany z popularnymi frameworkami do uczenia maszynowego, takimi jak PyTorch i TensorFlow.
- Instancje Trn1 obejmują maksymalnie 16 akceleratorów AWS Trainium, które zostały zaprojektowane specjalnie do wdrażania modeli głębokiego uczenia.
- Aby zwiększyć wydajność, Trn1 jest pierwszą instancją Amazon EC2 oferującą przepustowość sieciową do 800 Gb/s za pośrednictwem 2nd-gen Interfejs sieciowy AWS Elastic Fabric Adapter (EFA).
- Aby przyspieszyć szkolenie, instancje Trn1 korzystają również z NeuronLink — szybkiego połączenia wewnątrzinstancyjnego.
Klastry Amazon EC2 Ultra
Klienci mogą wdrażać instancje Trn1 w klastrach Amazon EC2 UltraClusters (składających się z dziesiątek tysięcy akceleratorów Trainium), aby szybko trenować najbardziej złożone modele głębokiego uczenia, nawet te z bilionami parametrów. Dzięki klastrom EC2 UltraClusters organizacje mogą skalować trening modeli uczenia maszynowego, wykorzystując do 30 000 akceleratorów Trainium połączonych siecią EFA o przepustowości petabitów. Amazon wskazuje, że organizacje te będą miały dostęp na żądanie do wydajności klasy superkomputerów, co może znacznie skrócić czas szkolenia, który zazwyczaj trwa od miesięcy do zaledwie dni.
Każda instancja AWS EC2 Trn1 obsługuje do 8 TB szybkiej lokalnej pamięci masowej NVMe SSD, a AWS Trainium obsługuje szeroki zakres typów danych (FP32, TF32, BF16, FP16 i konfigurowalny FP8). Obsługuje również zaokrąglanie stochastyczne, metodę opartą na prawdopodobieństwie, co zapewnia wysoką wydajność i dokładność. Ponadto AWS Trainium obsługuje dynamiczne kształty tensorów i niestandardowe operatory, co sprzyja elastycznej infrastrukturze, która dostosowuje się do potrzeb szkoleniowych klientów.
System AWS Nitro
Instancje Trn1 są zbudowane w oparciu o AWS Nitro System, zbiór innowacyjnych rozwiązań sprzętowych i programowych opracowanych przez AWS, które usprawniają dostarczanie izolowanej obsługi wielu najemców, sieci prywatnych i szybkiej lokalnej pamięci masowej. Aby zapewnić wymaganą wydajność, Nitro System przenosi wirtualizację procesora, pamięć masową i funkcje sieciowe na dedykowany sprzęt i oprogramowanie.
Dostępność instancji AWS EC2 Trn1
Instancje AWS Trn1 można teraz kupić jako instancje na żądanie (z planami oszczędnościowymi), instancje rezerwowe lub instancje spot. Obecnie są one dostępne w regionach US East (Północna Wirginia) i US West (Oregon), a wkrótce będą dostępne również w innych regionach AWS.
Będą one również dostępne za pośrednictwem następujących innych usług AWS:
- Amazon Sage Maker
- Usługa Amazon Elastic Kubernetes (Amazon EKS)
- Usługa elastycznych pojemników Amazon (Amazon ECS)
- Partia AWS




Amazon