Mise à jour du 16 août 2026 : Publication initiale. Les dimensions et la mémoire des modèles ont été vérifiées à partir des données officielles en vigueur à cette date ; ce tableau est mis à jour trimestriellement en raison de l’évolution des dimensions des modèles.
Tout guide matériel pour l'IA locale se résume finalement à une question : le modèle est-il compatible ? Cette page y répond par des chiffres, et va même plus loin que les simples calculs des fiches techniques. Lorsqu'une classe de modèle apparaît dans les tableaux ci-dessous, nous l'avons testée dans le laboratoire StorageReview, et les recommandations matérielles renvoient à des systèmes que nous avons effectivement testés sur nos plateformes de test d'IA locale ( ordinateurs de bureau et portables) .
En résumé : le nombre de paramètres à lui seul ne permet plus de prédire les besoins matériels. La quantification réduit les poids d'environ quatre fois, les modèles de type « mélange d'experts » sont bien plus légers que ne le suggère leur nombre total de paramètres, et les charges de travail multi-agents engendrent une consommation de mémoire que la plupart des guides de dimensionnement ignorent. Voici comment prendre en compte ces trois éléments.
Exigences de mémoire du modèle
Les tailles de fichiers ci-dessous correspondent aux versions quantifiées Q4_K_M courantes (ou au format natif lorsque cela est indiqué) telles que publiées sur Ollama et Hugging Face en août 2026. La colonne « Mémoire pour l'exécution » ajoute la surcharge de travail et une fenêtre de contexte modérée ; les chiffres marqués d'un astérisque sont des estimations calculées, tandis que les chiffres GPT-OSS et DeepSeek 671B sont les déclarations des fournisseurs.
| Modèle | Paramètres | Q4 / Téléchargement natif | Mémoire pour fonctionner* | Fonctionne sur |
|---|---|---|---|---|
| Lama 3.1 8B | 8B | 4.9 GB | ~6 à 8 Go | Ordinateurs portables avec 8 Go de VRAM et jusqu'à |
| Phi-4 14B | 14.7B | 9.1 GB | ~11 à 12 Go | 16 Go de VRAM ou Ordinateurs portables à mémoire partagée de 64 Go |
| GPT-OSS 20B (MXFP4) | 21B (3.6B actif) | 12 à 14 Go | ~13 à 16 Go | 16 Go de mémoire vidéo, ordinateurs portables à mémoire partagée |
| Mistral Small 3.2 24B | 24B | 15 GB | ~18 à 20 Go | Ordinateurs portables RTX PRO 24 Go |
| Gemma 3 27B | 27B | 17 GB | ~20 à 22 Go | Ordinateurs portables RTX PRO 24 Go, ordinateurs de bureau à mémoire unifiée |
| Qwen3 30B-A3B | 30.5B (3.3B actif) | 19 GB | ~22 à 24 Go | 24 Go de VRAM (limité) ou mémoire unifiée |
| QwQ 32B / DeepSeek-R1 32B | 32B | 20 GB | ~22 à 24 Go | 24 Go de VRAM (limité) ou mémoire unifiée |
| Llama 3.3 70B / R1 Distill 70B | 70B | 43 GB | ~48 à 50 Go | 96 Go et plus de mémoire unifiée, Tours RTX PRO 6000 |
| GPT-OSS 120B (MXFP4) | 117B (5.1B actif) | 65 GB | ~65 à 80 Go | Mémoire unifiée de 96 Go à 128 Go, GPU de 96 Go |
| DeepSeek-R1 671B (complet) | 671B (37B actif) | 404 GB | 450+ Go | Hors de portée des ordinateurs de bureau ; domaine des racks |
Ces estimations supposent environ 8 Ko de contexte actif et une surcharge d'exécution d'environ 15 % en plus du fichier de poids. Les contextes plus volumineux engendrent des coûts nettement supérieurs ; voir la taxe d'agent ci-dessous.
Deux points méritent d'être soulignés. Premièrement, l'utilisation de plusieurs experts modifie les calculs : GPT-OSS 120B comporte 117 milliards de paramètres, mais n'en active que 5.1 milliards par jeton. Il s'exécute donc sur une seule mémoire de 96 à 128 Go, alors qu'OpenAI recommande un GPU de 80 Go. Nous l'avons testé sur un HP Z2 Mini G1a , un ordinateur d'un litre sans carte graphique dédiée. Deuxièmement, DeepSeek-R1 complet, avec ses 671 milliards de paramètres, est d'une toute autre envergure : 404 Go rien que pour le télécharger au quatrième trimestre, et environ 450 Go de mémoire combinée pour un fonctionnement acceptable. Aucun ordinateur de nos classements ne l'exécute, et aucun ordinateur de bureau ne devrait tenter le coup.
Ce qui court où
Ordinateurs portables avec 8 Go de VRAM (cartes graphiques RTX PRO 500 à 2000). Compatibles avec les modèles 7B et 8B du quatrième trimestre et les versions plus compactes Phi et Gemma. Attention cependant : lors de nos tests, un modèle 13B nécessitant environ 12 Go de mémoire graphique n'a pas pu atteindre sa capacité maximale avec des cartes de 8 Go. Notre page « Meilleurs ordinateurs portables pour l'IA locale » couvre l'ensemble du secteur.
Systèmes dotés de 24 Go de VRAM (ordinateurs portables RTX PRO 5000, cartes graphiques RTX de bureau). Le compromis idéal pour les modèles de 14 à 27 milliards de jetons, avec une marge de manœuvre suffisante, et la solution la plus rapide pour les exécuter ; notre Dell Pro Max 18 Plus domine ce segment avec 185 jetons par seconde sur Phi. La classe 32 milliards s'intègre parfaitement au quatrième trimestre, mais laisse peu de place au contexte, pourtant crucial une fois les agents impliqués.
Systèmes de mémoire unifiée et partagée (de 96 Go à 128 Go). Les machines AMD Strix Halo peuvent allouer jusqu'à 96 Go de RAM système au GPU, tandis que les systèmes GB10, comme le NVIDIA DGX Spark, embarquent 128 Go de mémoire cohérente. Cette catégorie prend en charge les modèles 70B au quatrième quartile et GPT-OSS 120B, privilégiant la capacité à la vitesse. Ces systèmes sont classés dans le palmarès des meilleurs ordinateurs de bureau pour l'IA locale , et la même architecture équipe les ordinateurs portables, notamment le HP ZBook Ultra G1a 14 , qui a exécuté DeepSeek-R1 70B lors de nos tests.
Tours de stations de travail RTX PRO 6000 (96 Go par carte, jusqu'à 384 Go testés). Vitesse et capacité réunies : modèles 70 bits avec quantification élevée et contexte complet, GPT-OSS 120 bits avec marge de manœuvre, ou plusieurs modèles résidant simultanément pour les pipelines multi-agents. Notre classement des meilleures stations de travail de bureau couvre cette catégorie, avec en tête la HP Z8 Fury G6i, compatible avec quatre GPU.
La taxe agentique : le contexte est un second budget de mémoire
Le dimensionnement basé uniquement sur le fichier de poids fonctionne pour les sessions de chat courtes. Cependant, les agents remettent en question cette hypothèse. Un agent fonctionne en boucle : il lit les résultats des outils, les fichiers et les étapes précédentes dans sa fenêtre de contexte, et chaque jeton stocké dans le contexte consomme de la mémoire dans le cache clé-valeur, en plus des poids. Ces coûts sont loin d'être négligeables.
| Classe de modèle | Cache KV à 32 Ko de contexte | Cache KV à 128 Ko de contexte | Coût approximatif pour 1 000 jetons |
|---|---|---|---|
| 8B (Llama 3.1 8B, FP16 KV) | 4.19 GB | 16.78 GB | ~ 0.13 Go |
| 70B (Llama 3.3 70B, FP16 KV) | 10.49 GB | 41.94 GB | ~ 0.33 Go |
Comparez ce tableau à celui de dimensionnement ci-dessus et le problème apparaît clairement. Un modèle de 70 bits au quatrième trimestre (Q4) utilise 43 Go de poids, mais avec un contexte complet de 128 Ko, il nécessite environ 85 Go au total, soit le double des poids. Un modèle de 8 bits à 128 Ko consacre davantage de mémoire au contexte (16.78 Go) qu’à ses propres poids au quatrième trimestre (4.9 Go). La quantification du cache KV atténue ce problème : FP8 divise ces chiffres par deux et INT4 par quatre, au prix d’une certaine perte de qualité. Toutefois, la règle de planification demeure : pour les tâches automatisées, allouez le contexte comme un second modèle.
La mise en service alourdit encore la facture. Si un système héberge plusieurs agents ou utilisateurs simultanément, chaque requête utilise son propre cache clé-valeur. vLLM, la pile de service que nous utilisons pour nos tests de performance dans les classements Local AI, pré-alloue par défaut 90 % de la mémoire GPU, car l'espace disponible dans le cache clé-valeur détermine le nombre de requêtes simultanées pouvant être traitées sans interruption de débit. Une machine capable de gérer une seule conversation sans problème peut s'avérer sous-dimensionnée pour trois agents.
RAM système : le troisième pilier oublié
Pour l'inférence exclusivement sur GPU, la RAM système doit simplement être disponible, et 32 à 64 Go constituent un minimum confortable sur les machines que nous testons. Ce point devient crucial dans deux cas. Le déchargement, où les couches qui ne tiennent pas dans la VRAM sont exécutées par le CPU, utilise des fichiers de modèle mappés en mémoire ; la RAM système doit donc au moins correspondre à la taille du fichier de modèle plus la marge du système d'exploitation. De plus, sur les machines à mémoire unifiée, la RAM système est la mémoire du GPU, ce qui explique pourquoi les configurations de 64 et 128 Go dominent nos classements Local AI. Les recommandations d'Ollama préconisent 8 Go de RAM pour les modèles de 7 milliards d'unités, 16 Go pour ceux de 13 milliards et 32 Go pour ceux de 33 milliards ; il s'agit de valeurs minimales, et non d'objectifs.
Le rangement : la jambe que tout le monde zappe
Les bibliothèques de modèles atteignent rapidement une taille conséquente. Les dix modèles de notre tableau de dimensionnement totalisent environ 240 Go dans leurs quantifications courantes, et une bibliothèque fonctionnelle avec quelques variantes, des modèles d'intégration pour la recherche et des espaces de stockage vectoriels pour la mémoire des agents peut dépasser 500 Go avant même l'arrivée des données du projet. De plus, les flux de travail impliquant des agents génèrent un trafic de travail important : journaux, points de contrôle et index de recherche coexistent avec les modèles.
Le temps de chargement est un facteur déterminant pour la qualité du disque. Le calcul est simple : un fichier GPT-OSS de 65 Go (120 octets) se lit en environ 109 secondes à vitesse SATA, environ 17 secondes sur un disque NVMe Gen3 et moins de 9 secondes à vitesse Gen4 (premier chargement uniquement, car le cache de pages du système d’exploitation rend les rechargements quasi instantanés). Les chargeurs utilisés en conditions réelles n’atteignent pas toujours la vitesse maximale du disque ; nous prévoyons donc de publier nos propres mesures de chargement pour différentes classes de disques. Consultez le journal des modifications. Notre classement des performances de stockage concerne les disques eux-mêmes.
Conseils pratiques : 2 To NVMe constituent le minimum raisonnable pour une station de travail dédiée à l’IA, 4 To si la machine héberge des agents qui accumulent des données, et Gen4 ou supérieur si vous alternez régulièrement entre de grands modèles.
FAQ sur le matériel d'IA agentique
De combien de VRAM ai-je besoin pour exécuter un modèle 70B en local ?
Environ 48 à 50 Go au Q4 avec un contexte modéré, ce qui explique pourquoi cette catégorie est plutôt destinée aux machines dotées de 96 Go de mémoire unifiée et aux GPU de stations de travail de 96 Go qu'aux cartes grand public. En augmentant le contexte à 128 Ko, le total avoisine les 85 Go. En Q8, les seuls poids représentent 75 Go.
Puis-je exécuter la version complète de DeepSeek-R1 en local ?
Il ne figure sur aucun classement de ce site. Le modèle complet de 671 octets nécessite 404 Go de RAM au quatrième trimestre et environ 450 Go de mémoire vive pour fonctionner correctement. La solution la plus pratique consiste à utiliser les versions officielles, tandis que les versions 32 octets et 70 octets de notre tableau de dimensionnement offrent une grande partie des performances requises pour une utilisation bureautique.
Les modèles faisant intervenir un mélange d'experts modifient-ils les calculs mathématiques relatifs au matériel ?
De manière significative. Les modèles MoE n'activent qu'une fraction de leurs paramètres par jeton ; la mémoire requise est donc proportionnelle au nombre total de paramètres, tandis que la vitesse est davantage proportionnelle au nombre de paramètres actifs. GPT-OSS 120B (5.1 milliards de paramètres actifs) et Qwen3 30B-A3B (3.3 milliards de paramètres actifs) fonctionnent tous deux plus rapidement que leur taille ne le laisse supposer sur les pools de mémoire adaptés. La mémoire nécessaire pour tous les poids reste indispensable ; on bénéficie simplement d'une vitesse accrue par gigaoctet.
De combien de stockage un poste de travail IA a-t-il besoin ?
Prévoyez un minimum de 2 To de SSD NVMe, et 4 To pour les hôtes agents. Une bibliothèque de modèles de taille modeste occupe à elle seule des centaines de gigaoctets, les agents accumulent des journaux et des bases de données vectorielles, et les fichiers les plus volumineux (65 Go et plus) mettent à rude épreuve les disques lents à chaque chargement ou remplacement de modèle.
Quel matériel dois-je acheter spécifiquement pour les agents locaux ?
Privilégiez la mémoire à la vitesse brute. Les agents gèrent des contextes longs et s'exécutent parfois simultanément ; le budget alloué au cache KV est donc aussi important que le budget alloué aux poids. Un système avec une mémoire unifiée de 96 à 128 Go, figurant dans notre classement Local AI pour ordinateurs de bureau, représente la solution la plus économique, tandis que les tours RTX PRO 6000, présentes dans le classement des stations de travail, sont la solution idéale lorsque la vitesse et la concurrence sont toutes deux essentielles.
Testé : Les chiffres du GB300 sont arrivés
Tout ce qui précède reflète le matériel que nous avons testé, et le système que nous avions annoncé comme susceptible de changer la donne a bel et bien fait son apparition. Notre test de la MSI XpertStation WS300 , la première station GB300 DGX que nous avons eu entre les mains, est en ligne : elle dispose d'une mémoire cohérente de 748 Go répartie entre 252 Go de HBM3e et 496 Go de LPDDR5X, d'une puissance de calcul de 20 pétaFLOPS en FP4, et lors de nos tests, elle a géré un point de contrôle GLM-5.2 de 433 Go, une opération qui n'a pas sa place sur une station de travail, avec 216 Go de poids d'experts stockés dans la mémoire Grace.
L'importance de la mémoire dans ce guide réside dans toutes les recommandations qui en découlent. Chaque recommandation de cette page contourne une limite stricte : répartition des modèles entre les GPU, recours à la quantification ou utilisation du CPU lorsque les poids et le cache KV ne tiennent plus. NVIDIA spécifie que les systèmes de bureau GB300 disposent de plusieurs centaines de gigaoctets de mémoire cohérente adressable par l'accélérateur, ce qui représente un ordre de grandeur différent des cartes de 96 Go qui constituent la base des tableaux précédents. Les classes de modèles qui nécessitent actuellement une tour multi-GPU, ou que nous jugeons impraticables en local, deviennent compatibles avec un seul boîtier.
Nous ne fournirons aucun chiffre avant d'avoir effectué les tests. Les données de cette page ne sont pas basées sur le test GB300 et n'ont fait l'objet d'aucun ajustement en prévision de ce test. Dès la publication du test, ce guide sera mis à jour en fonction des résultats mesurés et les modifications seront consignées dans le journal ci-dessous.
Comment nous maintenons ce guide
Les tailles des modèles et la liste des modèles populaires évoluent chaque trimestre, plus rapidement que n'importe quel cycle de renouvellement matériel. Nous revérifions le tableau des tailles par rapport aux versions officielles tous les trimestres, et les résultats des tests en laboratoire sont ajoutés dès que de nouveaux systèmes réussissent nos tests Local AI. Les modifications sont consignées dans la note datée en haut de la page. Les tailles indiquées comme estimations utilisent le fichier de poids publié, auquel s'ajoutent les coûts mesurés du cache KV et la surcharge d'exécution standard ; les chiffres fournis par les fournisseurs sont clairement identifiés.




Amazon