StorageReview.com
AI  ◇  Entreprise

Chemin optimisé pour l'inférence de contexte long : déchargement du cache KV vers la mémoire flash

L'infrastructure d'IA d'entreprise est passée de l'optimisation des modèles d'entraînement à leur déploiement, ce qui modifie la donne économique. L'entraînement est un investissement initial avec un objectif final. L'inférence, quant à elle, est une charge de travail de production qui s'exécute tant que le service est opérationnel, et dont le résultat est mesuré en jetons. C'est le problème de la tokenomics auquel sont désormais confrontés les opérateurs d'IA : une fois que…

AI  ◇  Entreprise

Test du cluster NVIDIA DGX Spark : inférence distribuée sur Dell, GIGABYTE et HP

Deux choses reviennent systématiquement lorsqu'on aborde le sujet de la NVIDIA DGX Spark. La première concerne sa principale caractéristique : 128 Go de mémoire unifiée dans un boîtier de bureau à environ 4 000 $, une capacité qui aurait semblé inconcevable il y a encore deux ans. La seconde est son débit de 200 Go.

AI  ◇  Entreprise

Comment Metrum AI et l'Université d'État de l'Oregon établissent la nouvelle norme en matière d'évaluation académique

Lorsque nous avons publié notre article sur les recherches de l'Université d'État de l'Oregon en imagerie du plancton en novembre dernier, le titre principal mettait l'accent sur la science : une infrastructure accélérée par l'IA à bord des navires de recherche, traitant des téraoctets de données océaniques en temps quasi réel avant même que le navire n'atteigne le port. Mais quelque chose d'autre s'est produit discrètement dans les semaines qui ont suivi. La nouvelle s'est répandue sur le campus :

AI  ◇  Entreprise

Test du Supermicro JumpStart : H14 avec AMD Instinct MI350X

Le programme JumpStart de Supermicro s'est imposé comme l'un des outils les plus utiles pour l'évaluation préalable à l'achat d'infrastructures d'IA. Plutôt qu'une simple démonstration dans un environnement partagé, JumpStart offre aux utilisateurs qualifiés un accès gratuit et limité dans le temps à de véritables serveurs de production via SSH, IPMI et VNC, leur permettant ainsi d'exécuter des charges de travail sur du matériel réel.