CTERA lance Fusion Direct, une architecture de données fédérée conçue pour combler le fossé persistant entre les systèmes de fichiers d'entreprise et le stockage objet. Cette nouvelle offre vient enrichir la gamme CTERA Fusion, qui comprend déjà CTERA Fusion Gateway, et se positionne comme un composant essentiel de la plateforme de données intelligentes CTERA. L'objectif est de proposer une infrastructure de données unique et performante, capable de gérer aussi bien les charges de travail de fichiers centrées sur l'humain que les pipelines d'IA pilotés par machine, sans duplication de données ni refonte des applications.
Unification des fichiers et des objets sous un seul espace de noms
Les équipes informatiques des entreprises ont traditionnellement dû gérer deux environnements de stockage distincts. Les systèmes NAS offrent un accès SMB et NFS pour la collaboration des utilisateurs et les applications métiers existantes. Le stockage objet, généralement accessible via S3, est utilisé pour les charges de travail volumineuses, natives du cloud et analytiques. L'interconnexion de ces environnements a souvent impliqué la mise en place d'infrastructures parallèles, la copie des données entre elles ou le recours à des passerelles traduisant les requêtes de fichiers en API objet. Ces couches de traduction peuvent engendrer une latence, une complexité et un risque opérationnel supplémentaires, notamment à grande échelle.
Fusion Direct résout ce problème en exposant un espace de noms global fédéré unique où fichiers et objets coexistent nativement. Les données peuvent être écrites sur la plateforme sous forme de fichiers et lues sous forme d'objets, ou écrites sous forme d'objets et lues sous forme de fichiers. Le système prend en charge une lecture et une écriture bidirectionnelles complètes sans convertir les fichiers en fragments d'objets propriétaires ni acheminer l'accès via une passerelle de traduction distincte. CTERA précise qu'il n'y a aucun goulot d'étranglement lié à la conversion de fichiers en objets ni aucun mécanisme d'encapsulation propriétaire.
Du point de vue de l'accès, les applications et utilisateurs d'entreprise existants continuent de fonctionner via SMB et NFS comme actuellement. Parallèlement, les clusters d'entraînement d'IA, les environnements HPC et les services cloud natifs peuvent accéder aux mêmes ensembles de données via S3 et S3 sur RDMA, conçu pour fournir un débit maximal aux clusters GPU et autres environnements de calcul haute performance.
Exploiter les systèmes de stockage d'objets existants et la périphérie distribuée
Un point de conception important réside dans la possibilité de connecter directement des compartiments S3 existants à l'infrastructure de données Fusion Direct. Plutôt que de migrer ou de réhydrater les données d'objets vers un nouveau système, les entreprises peuvent présenter leurs espaces de noms de stockage d'objets actuels comme faisant partie de l'espace global de fichiers/objets. Une fois connectés, les objets contenus dans ces compartiments sont accessibles comme des fichiers standard depuis les sites périphériques et les déploiements multicloud.
Cette approche permet aux équipes informatiques d'exposer les données d'objets sous forme de fichiers aux utilisateurs et aux applications du monde entier, tout en les présentant nativement comme S3 aux charges de travail d'IA et d'analyse. Elle réduit également le besoin d'infrastructures dupliquées qui seraient autrement déployées dans plusieurs régions ou sites périphériques pour le stockage intermédiaire ou le reformatage des données. Au final, l'empreinte de stockage est simplifiée pour les ensembles de données distribués sur plusieurs zones géographiques.
Architecture pour les performances à l'ère de l'IA
CTERA Fusion Direct s'appuie sur la plateforme de données intelligente existante de CTERA et est protégée par le brevet américain n° 12 007 9521. Son architecture met l'accent sur la prise en charge simultanée des charges de travail collaboratives sur les fichiers et sur la consommation de données à haut débit et à l'échelle de la machine.
L'une des fonctionnalités essentielles est l'accès natif sans copie. Les données écrites sur la plateforme CTERA sous forme de fichiers sont immédiatement disponibles en tant qu'objets S3 standard, sans aucune copie secondaire ni conversion en arrière-plan. Inversement, les compartiments S3 peuvent être connectés directement, et leur contenu devient immédiatement accessible comme des fichiers dans l'espace de noms global. Ceci permet d'éviter la latence et la surcharge de stockage liées aux copies dupliquées ou aux caches intermédiaires.
Le streaming de fichiers à haut débit est un autre axe de développement. Les ressources multimédias volumineuses, les jeux de données d'entraînement et autres contenus gourmands en ressources peuvent être diffusés directement depuis le stockage objet vers les applications de fichiers. Cette approche élimine le besoin de téléchargements locaux massifs ou d'étapes de préparation, qui peuvent ralentir les flux de travail et consommer davantage d'espace de stockage en périphérie ou dans les clusters de calcul.
Côté performances, Fusion Direct expose les objets natifs de manière à prendre en charge les protocoles S3 sur RDMA et l'accès direct aux GPU. Pour les clusters d'IA, cela signifie que les GPU peuvent lire et écrire des données à une vitesse proche de celle du réseau à partir d'ensembles de données orientés objet, sans traduction de protocole supplémentaire dans le chemin des données. Ceci est particulièrement pertinent pour les tâches d'entraînement et d'inférence limitées par le débit d'E/S plutôt que par la puissance de calcul brute.
CTERA souligne également l'importance de la souveraineté des données. Grâce au stockage des données dans des compartiments S3 standard, sans encapsulation propriétaire ni passerelle détenant les métadonnées, les organisations conservent la maîtrise de leurs informations, qu'il s'agisse de déploiements sur site ou de clouds publics. L'architecture vise à minimiser la dépendance vis-à-vis d'un fournisseur de données et à préserver la flexibilité face à l'évolution des stratégies d'infrastructure.
Effacement des silos de données humaines et machine
Selon Oded Nagel, PDG de CTERA, le principal obstacle à l'adoption de l'IA en entreprise n'est pas la pénurie de données, mais la difficulté à les exploiter efficacement. Il souligne que la séparation des données destinées à l'usage humain et de celles destinées à l'analyse automatique engendre des frictions. La maintenance d'environnements et d'ensembles de données distincts ralentit le déploiement de l'IA. Nagel propose de les combiner au sein d'une plateforme unique prenant en charge SMB/NFS et S3 via RDMA, offrant ainsi aux entreprises un accès direct des données brutes aux ensembles de données prêts pour l'IA. Une plateforme unifiée peut aider les organisations à mieux exploiter leurs données et à rester compétitives sur un marché dominé par l'apprentissage automatique et l'automatisation.
Disponibilité
CTERA Fusion Direct est désormais disponible au sein de la plateforme de données intelligentes CTERA et constitue un élément essentiel de la suite CTERA Fusion pour l'unification des fichiers et des objets. Pour plus d'informations, veuillez consulter le site web de CTERA.




Amazon