Tutorials · 19 lecture minimale · Jul 31, 2026

Quelle quantité de VRAM est nécessaire pour exécuter un LLM ? Le tableau de référence 2026

MillionMiner Team

MillionMiner Team

Mining Hardware Operators

Quelle quantité de VRAM est nécessaire pour exécuter un LLM ? Le tableau de référence 2026
Le modèle phare de DeepSeek possède 671 milliards de paramètres, dont seulement 37 milliards s'activent pour chaque jeton.. Combien de VRAM cela nécessite-t-il ? La valeur de tous les 671 milliards de paramètres : environ 382 Go même quantifiés en 4 bits, car un modèle de type mixture-of-experts doit contenir chaque expert en mémoire, que ce jeton l'utilise ou non. Les paramètres actifs vous offrent de la vitesse. Ils n'achètent pas de mémoire, et cette simple erreur de compréhension est la raison pour laquelle plus de budgets hardware d'IA sont perdus que n'importe où ailleurs.

La VRAM est la contrainte principale lors de l'exécution de modèles linguistiques : une carte avec trop peu de mémoire ne fait pas simplement fonctionner le modèle lentement, elle ne l'exécute pas du tout ou le décharge dans la RAM système et ralenti considérablement. Ce guide vous donne la réponse complète pour 2026 : la formule en dix secondes qui dimensionne n'importe quel modèle, le tableau de référence couvrant tous les grands modèles ouverts à chaque niveau de quantification pertinent, les calculs du cache KV qui prennent de court les utilisateurs de contexte long, et quel niveau de GPU, d'une carte grand public de 24 GB à une 96 GBRTX Pro 6000, correspond réellement à votre charge de travail.

La réponse courte

  • La formule :VRAM pour les poids ≈ paramètres (en milliards) × octets par paramètre : 2,0 en FP16, 1,0 en Q8, 0,57 en Q4_K_M. Ajoutez la cache KV et 15 à 20 % de surcharge.
  • Niveaux rapides (quantification Q4):Les modèles 8B nécessitent environ 6 GB ; les modèles 32B nécessitent environ 20 GB (une carte de 24 à 32 GB) ; les modèles 70B nécessitent environ 40 GB (une carte de 48 GB) ; Llama 4 Scout nécessite environ 60 GB (une carte de 96 GB, confortablement).
  • Le piège du MoE :Les modèles mixture-of-experts chargent TOUS les paramètres. DeepSeek-R1 671B nécessite environ 382 Go au T4, malgré 37B actifs.
  • Les secteurs porteurs en 2026 :24 GB fonctionne parfaitement avec les modèles de classe 32B ; 48 GB est la limite à partir de laquelle le Miner monocard 70B commence ; 96 GB fait fonctionner Llama 4 Scout sur une seule carte.


La formule : octets par paramètre décide de tout

Les poids d'un modèle sont ses paramètres stockés avec une certaine précision, donc l'arithmétique est réellement aussi simple que celle-ci : paramètres multipliés par le nombre d'octets par paramètre. À pleine précision FP16, chaque paramètre occupe 2 octets ; Q8 et FP8 stockent un octet ; les quantifications GGUF, dans la plupart des configurations locales, utilisent encore moins, environ 0,68 octet en efficacité pour Q5_K_M et 0,57 pour Q4_K_M une fois que leurs couches à précision mixte s'équilibrent.
The LLM VRAM formula: weights in GB equal parameters in billions times bytes per parameter (FP16 = 2.0, Q8 = 1.0, Q5_K_M = 0.68, Q4_K_M = 0.57), plus KV cache and 15 to 20 percent overhead for activations and framework buffers.
Un exemple suffit pour que la habitude s’installe : Llama 3.1 8B à Q4_K_M représente 8 × 0,57 ≈ 4,6 Go de poids ; en ajoutant une cache de contexte modeste et une surcharge d'exécution, cela se situe autour de 6 Go, ce qui explique pourquoi il fonctionne confortablement sur une carte de 8 Go. La même arithmétique à l’autre extrémité : Llama 3.3 70B atteint 140 Go en FP16 et environ 40 Go en Q4_K_M, et en utilisation en production, son empreinte totale peut dépasser 200 Go une fois que la cache et la surcharge du framework s’accumulent. Deux autres consommateurs partagent la carte avec les poids : le cache KV, qui sera abordé dans la section ci-dessous car il évolue avec le contexte, et la surcharge d’exécution, le contexte CUDA, les activations et les buffers du framework représentant environ 1 à 2 Go, davantage sous des moteurs de service qui pré-allouent.

Le tableau de référence : chaque modèle principal, mi-2026

Chiffres uniquement en poids aux trois précisions importantes, avec la classe de carte que chaque modèle ajuste au T4. Les modèles marqués MoE chargent tous les paramètres, quelle que soit leur activation par jeton.
VRAM requirements table for mid-2026 models: Llama 3.1 8B (4.3 GB Q4) through Qwen3 32B (19 GB), Llama 3.3 70B (40 GB, fits a 48 GB card), gpt-oss 120B (65 GB native), Llama 4 Scout (55 to 62 GB, fits a 96 GB RTX Pro 6000), up to DeepSeek-R1 671B at roughly 382 GB requiring a multi-GPU server.
Trois lignes méritent une attention particulière. Llama 3.3 70B à environ 40 GB est la raison pour laquelle les cartes de 48 GB ont changé le marché de l'IA locale : la classe 70B, où les modèles open commencent à rivaliser avec les API cloud en termes de qualité, peut désormais tenir sur une seule carte. Llama 4 Scout (109B au total, 17B actifs) à 55-62 GB fonctionne sur une RTX Pro 6000 de 96 GB, offrant une capacité pour un contexte long, une MoE de classe frontier sur une carte de station de travail. Et gpt-oss 120B est livré nativement en MXFP4 à environ 65 GB, conçu délibérément pour s’adapter à un seul A100 ou H100 de 80 GB. Le schéma commun à ces trois : l’action intéressante en 2026 se situe entre 48 et 96 GB, la plage où les modèles sérieux n’ont plus besoin de serveurs.

Cache KV : le second consommateur caché

Les poids ne sont que les frais d'entrée. Lors de l'inférence, le modèle stocke l'état d'attention, le cache de clés-valeurs, pour chaque jeton dans le contexte, et ce cache augmente linéairement avec la longueur du contexte et avec chaque utilisateur concurrent. C'est la principale raison pour laquelle un modèle qui « tient » plante dès qu'on colle un long document.
 KV cache VRAM by context length: Llama 3.1 8B grows from 0.5 GB at 4K context to about 17 GB at 128K, and Llama 3.3 70B from 1.3 GB to about 42 GB, with GQA providing a built-in 8x saving and FP8 cache quantization another 2x.
Les chiffres concrets donnent une idée précise. Llama 3.1 8B possède environ la moitié d'un GB de cache à un contexte de 4K, environ 4,2 GB à 32K, et environ 17 GB à 128K, à partir duquel le cache dépasse les poids Q4. La version 70B s'étend à environ 42 GB de cache à un contexte complet de 128K, ce qui nécessite la mémoire d'un second GPU rien que pour l'état. Deux marées permettent de garder cela gérable. Les modèles modernes sont livrés avecattention par requête groupée: Llama 3.1 70B utilise 8 têtes KV au lieu de 64, une réduction de cache de 8x qui est la raison discrète pour laquelle le service single-GPU 70B fonctionne tout simplement. Et le cache lui-même peut être quantifié en FP8 ou INT8 pour un autre facteur 2x avec un impact minimal sur la qualité, supporté nativement par vLLM. Règle du budget : peu importe les besoins en poids, réservez de la marge pour le contexte que vous souhaitez réellement utiliser, et multipliez le cache par le nombre d'utilisateurs concurrents si vous servez.
 Memory chips up close: VRAM capacity is the hard physical constraint that decides which language models a GPU can load at all.

Ce que la quantification vous coûte (et quand elle devient trop chère)

Q4_K_M est la norme locale pour une raison : elle réduit la mémoire de 3,5 fois par rapport à FP16 tout en perdant moins de 5 % sur les références de qualité, un compromis que presque tout le monde devrait adopter. Les formats que vous rencontrerez : GGUF (la famille llama.cpp et Ollama, quantification gérée automatiquement), AWQ et GPTQ (formats de service GPU courants sous vLLM), et des modèles de plus en plus natifs en faible précision, comme gpt-oss publié directement en MXFP4 sans version en précision complète destinée au déploiement. La règle unique qui évite aux gens de faire une mauvaise configuration : la qualité chute brutalement en dessous de 4 bits, et un Miner de 8 milliards bien entraîné en Q4 surpassera un Miner de 14 milliards compressé en Q3 presque à chaque fois. Choisissez le modèle le plus grand qui tient en Q4 ou mieux, pas seulement le plus grand qui se charge techniquement. Ce que cette qualité représente réellement par classe de modèle est le sujet de notremeilleurs classements de LLM locaux.

Prêt à démarrer Mining ?

livraison DDP gratuite dans le monde entier. Hébergement professionnel à partir de 0,055$/kWh.

Correspondance des niveaux de mémoire VRAM avec le matériel réel

The VRAM tier ladder: 8 to 12 GB runs 8B models, 16 to 24 GB runs the 32B class, 32 GB adds long context, 48 GB is where single-card 70B begins, 80 GB adds FP8 serving and gpt-oss 120B, and 96 to 141 GB runs Llama 4 Scout and 235B MoE models.
L'échelle comporte une marche qui compte plus que les autres en 2026 :48 Go, où commence le Minier à une seule carte 70B. En dessous, la gamme grand public de 16 à 24 Go est véritablement capable, exécutant la classe 32B exceptionnelle (Qwen3 32B, Gemma 3 27B) qui couvre la majorité des usages personnels et en petite équipe, et la RTX 5090 de 32 Go ajoute l'espace de contexte que les cartes de 24 Go manquent. Au-dessus, les cartes data-center de 80 Go offrent le service FP8 et gpt-oss 120B, et la RTX Pro 6000 de 96 Go exécute Llama 4 Scout, une sortie de classe frontier, sur une seule carte de station de travail. La question de savoir quelle carte spécifique remporte chaque niveau en termes de prix et de vitesse est ce que leoutil d’évaluation GPUclassement parmi 78 cartes, et leGuide de sélectionse transforme en décision.

Le niveau que tout le monde demande : une carte de 48 Go exécute Llama 3.3 70B au T4 avec environ 6 Go de marge pour le contexte. Une carte de 24 Go ne peut pas la charger du tout.
The NVIDIA RTX Pro 6000 workstation GPU with 96 GB of VRAM: the single-card flagship tier, with enough memory to run Llama 4 Scout at Q4 on one card.

Le piège MoE : les paramètres actifs achètent la vitesse, pas la mémoire

Les modèles de mélange d'experts dominent la frontière de 2026 (DeepSeek-R1 et V3.2, Llama 4, Qwen3 235B, gpt-oss 120B), et ils partagent tous une propriété qui défie l'intuition : chaque expert doit résider dans la VRAM, car le routeur choisit différents experts token par token. Le nombre de paramètres actifs détermine votre vitesse, puisque chaque token ne passe que par ce sous-ensemble, et la logique de bande passante mémoire de notreexplication des référencess'applique à la tranche active. Mais le nombre total de paramètres fixe votre mémoire, point final. DeepSeek-R1 671B fonctionne de manière étonnamment rapide pour sa taille précisément parce que seulement 37B paramètres traitent par token ; il a encore besoin d'environ 382 GB chargés, ce qui en pratique signifie unServeur H200 avec 8 GPULorsque vous évaluez un MoE, examinez le total, et non le chiffre marketing.

Lorsque une seule carte ne suffit pas : division et déchargement

Il existe deux voies de sortie lorsque un modèle dépasse la VRAM, et elles ne sont pas équivalentes.Répartition multi-GPU(parallélisme tensoriel ou en pipeline) partage les poids entre les cartes et fonctionne bien : deux cartes de 48 Go contiennent ce qu'une seule carte de 96 Go peut contenir, au prix d'un trafic inter-GPU, c'est pourquoi les configurations connectées par NVLink couvertes dans notreGuide pour serveur multi-GPUprendra de l'avance sur les configurations uniquement PCIe.Délestage CPUdésinsère des couches dans la RAM du système et constitue la dernière option : la bande passante de la mémoire du système est une faible fraction de celle de la VRAM, donc chaque couche déchargée retarde tout le pipeline vers la vitesse du CPU. Un modèle 10 % trop grand pourrait perdre la moitié de sa vitesse. La hiérarchie honnête : tenez-le dans une seule carte si vous le pouvez, répartissez-le entre plusieurs GPU si nécessaire, et considérez le déchargement comme un moyen de tester un modèle, pas de l'exécuter. À l’échelle de la flotte, la même contrainte est la raison pour laquelleLa mémoire reste en tête dans chaque nouvelle génération de GPU.

Ce que ce tableau ne peut pas décider pour vous

Trois limites, énoncés simplement. Premièrement, les chiffres représentent des poids en quantifications standard ; votre fichier GGUF exact, la pré-allocation de votre moteur et le paramètre de contexte font varier le total, il faut donc considérer le tableau comme un plancher plus la formule, non une garantie, et vérifier la taille réelle des fichiers dans la fiche du modèle avant d’acheter quoi que ce soit. Deuxièmement, l’ajustement n’est pas la même chose que l’exécution : un modèle qui se charge avec zéro marge de manœuvre sera à la limite dès que le contexte augmente, et la vitesse que vous obtenez d’un modèle ajusté est une question distincte, couverte par le calcul des tokens par seconde dans laméthodologie des benchmarkset mesuré par carte dans leoutil.

Ensuite, ce guide couvre l'inférence ; la formation et le réglage fin nécessitent plusieurs fois plus de mémoire pour les gradients et les états de l'optimiseur, un budget entièrement différent, esquissé dans notreGuide de formation GPUTaille pour la charge de travail que vous exécuterez réellement, puis ajoutez la marge de sécurité dont vous aurez inévitablement besoin.

Le résultat net

La taille du VRAM ne relève plus du simple guessing dès lors que vous avez la formule en main : paramètres multipliés par octets par paramètre, plus cache, plus surcharge. À partir de là, la carte 2026 est rapidement définie. Une carte de 8 Go constitue un véritable point d'entrée à 8B ; 24 Go gère la classe 32B qui accomplit la majorité du travail réel ;48 GB est la nouvelle ligne qui compte, en mettant une qualité de classe 70B sur une seule carte ; 80 Go ajoutent une marge pour le service et GPT-OSS 120B ; et 96 Go exécutent un MoE frontière sur une station de travail. Respectez le piège MoE, budgétisez le cache KV pour le contexte que vous utiliserez réellement, et ne planifiez jamais en fonction du déchargement CPU. Ensuite, associez le niveau à une carte spécifique avec leoutil de référenceet en en le prix dans leMagasin GPU, et si la réponse s'avère être « plus d'une carte », ce n'est pas un échec de la planification ; c'est simplement ce que coûtent les modèles de classe frontier en silicium.

Questions fréquemment posées

Combien de VRAM faut-il pour exécuter un LLM ?

Cela dépend de la taille du modèle et de la quantification. Guide rapide sur Q4_K_M (le standard local) : les modèles 8B nécessitent environ 6 Go au total, les 14B environ 10 Go, la classe 32B environ 20 à 22 Go, les modèles 70B environ 40 à 45 Go, et les modèles frontier MoE comme Llama 4 Scout environ 60 Go. La formule pour tout le reste : paramètres en milliards multipliés par le nombre d'octets par paramètre (2,0 en FP16, 1,0 en Q8, 0,57 en Q4_K_M), plus le cache KV et entre 15 et 20 % de surcharge.

Combien de VRAM faut-il pour Llama 3.3 70B ?

Environ 40 GB à Q4_K_M, 74 GB à Q8 et 140 GB en FP16, uniquement les poids ; ajoutez le cache et les surcoûts en plus. En pratique, cela signifie qu'une seule carte de 48 GB l'exécute en Q4 avec un contexte modeste, une carte de 80 GB l'exécute confortablement en FP8, et l'FP16 nécessite de répartir le traitement sur deux GPU de 80 GB. C'est la gamme de modèles où les cartes de 48 GB justifient leur prix.

Combien de VRAM le DeepSeek-R1 nécessite-t-il ?

Les versions distillées sont modestes : la distillation 8B nécessite environ 5 Go au T4 et la distillation 32B environ 18 à 20 Go, correspondant à une carte de 24 à 32 Go. Le modèle complet 671B est un autre monde : environ 370 à 382 Go au T4 et environ 671 Go en FP8, nécessitant un serveur multi-GPU (généralement 8x H200 pour la production). Seuls 37B de paramètres s'activent par jeton, ce qui le rend rapide, mais chaque paramètre doit être chargé, ce qui le rend énorme.

Puis-je exécuter un modèle 70B avec 24 Go de VRAM ?

Pas uniquement sur le GPU. Un modèle 70B nécessite environ 40 Go même avec Q4_K_M, donc une carte de 24 Go doit transférer environ la moitié des couches vers la RAM système, ce qui réduit généralement la vitesse à quelques jetons par seconde. Les options réalistes : utiliser plutôt la classe 32B excellente (Qwen3 32B tient dans 24 Go et dépasse un 70B fortement compressé), passer à une carte de 48 Go, ou répartir entre deux GPU de 24 Go.

Qu'est-ce que le cache KV et combien de VRAM utilise-t-il ?

Le cache des clés d’attention et des valeurs que le modèle conserve pour chaque jeton dans le contexte. Il croît de manière linéaire avec la longueur du contexte et avec le nombre d’utilisateurs simultanés : Llama 3.1 8B occupe environ 0,5 GB à un contexte de 4K, mais ~17 GB à 128K ; la version 70B atteint ~42 GB avec un contexte complet. Les modèles modernes le réduisent 8 fois via l’attention par requête groupée, et la quantification du cache en FP8 le divise encore de moitié. Prévoyez toujours un cache en fonction du contexte que vous prévoyez réellement d’utiliser.

Les modèles MoE ont-ils besoin de moins de VRAM ?

Non, et c'est la misconception la plus coûteuse dans l'IA locale. Les modèles à mélange d’experts calculent uniquement à travers leurs paramètres actifs par jeton (ce qui les rend rapides), mais doivent charger chaque expert dans la VRAM (ce qui les rend volumineux). DeepSeek-R1 671B avec 37B actifs nécessite encore environ 382 Go au T4. Lors de la détermination de la taille d’un MoE, utilisez le nombre total de paramètres ; le nombre actif prévoit la vitesse, pas la mémoire.

Quelle perte de qualité puis-je observer avec la quantification Q4 ?

Généralement moins de 5 % sur les bancs d'essai par rapport à FP16, c'est pourquoi Q4_K_M est la valeur par défaut pour le déploiement local ; la plupart des utilisateurs ne peuvent pas faire la différence en utilisation normale. La qualité se dégrade rapidement en dessous de 4 bits, donc la règle de fonctionnement est : utilisez le plus grand modèle qui tient en Q4 ou mieux plutôt que de réduire un modèle plus grand à Q3 ou Q2. Un Miner bien entraîné de 8B à Q4 dépasse presque toujours un de 14B à Q3.

Cela dépend de vos besoins spécifiques en matière d'IA. 48 Go de VRAM peuvent être très avantageux pour des tâches exigeantes comme l'apprentissage profond à grande échelle, la modélisation complexe ou le traitement de données volumineuses. Si vous travaillez sur des projets nécessitant une grande capacité de mémoire et une performance optimale, investir dans une carte graphique avec 48 Go de VRAM peut en valoir la peine. Cependant, pour des applications plus légères ou un usage moins intensif, une capacité inférieure pourrait suffire et être plus rentable.

En 2026, c'est la ligne de mise à niveau la plus significative, car c'est là que commence le 70B à carte unique : Llama 3.3 70B et Qwen2.5 72B s'intègrent au quatrième trimestre avec une marge, dans la catégorie où les modèles ouverts commencent à rivaliser avec les API cloud en termes de qualité. En dessous de 48 Go, vous évoluez dans le monde (très bon) du 32B ; au-delà, 80 à 96 Go ajoutent le service FP8, gpt-oss 120B et Llama 4 Scout. Si l'objectif est une production de classe 70B, 48 Go est la solution.

Que se passe-t-il si mon modèle ne tient pas dans la VRAM ?

Une erreur de mémoire insuffisante ou un déchargement automatique du CPU, en fonction du moteur. Le déchargement transfère des couches dans la RAM du système, dont la bande passante est une petite fraction de celle de la VRAM, ce qui entraîne une chute de la vitesse vers celle du CPU : un modèle 10 % trop volumineux peut perdre la moitié de son débit. Le déchargement est adapté pour tester si un modèle vous convient ; pour une utilisation réelle, quantifiez-le davantage, choisissez un modèle plus petit ou augmentez la VRAM via une carte plus grande ou une répartition multi-GPU.

Ai, pour le fine-tuning, vous aurez généralement besoin de plus de VRAM que pour l'inférence.

Substantiellement plus. La formation conserve les gradients et les états de l'optimizer ainsi que les poids, ce qui multiplie l'empreinte plusieurs fois en précision totale ; même les méthodes efficaces en paramètres comme QLoRA, qui gèle le modèle de base à 4 bits, nécessitent un espace significatif au-dessus de l'inférence. À titre indicatif, un fine-tuning QLoRA confortable d'un modèle de 70 milliards nécessite 48 à 80 Go, alors que l'inférence Q4 nécessite 40. La taille des budgets de formation doit être considérée séparément de ce tableau.

Sources et notes
Chiffres de mémoire du modèle compilés à partir de guides de déploiement publiés, de fichiers de version quantifiés et de documentation du framework (llama.cpp/GGUF, vLLM), mi-2026 ; les valeurs de bytes-par-parameter reflètent les moyennes standard de quantification GGUF (Q4_K_M ≈ 0,57, Q5_K_M ≈ 0,68). Les chiffres du cache KV utilisent des architectures de l'ère GQA avec une précision de cache FP16 et sont dimensionnés selon la formule par token indiquée. Les exigences exactes varient selon le fichier quantifié spécifique, la pré-allocation du moteur et les paramètres du contexte ; vérifiez la taille des fichiers du modèle avant d’acheter du matériel. La figure de perte de qualité Q4 reflète les écarts de benchmark généralement rapportés. Photo principale : Geekerwan, CC BY 3.0, via Wikimedia Commons. Photo de corps : PantheraLeo1359531, CC BY 4.0, via Wikimedia Commons. Visualisation du produit : catalogue MillionMiner (RTX Pro 6000). Diagrammes : graphiques originaux de MillionMiner, libres de droit avec attribution et lien vers cette page. Contenu informatif, non un conseil d’achat.

Prêt à démarrer Mining ?

livraison DDP gratuite dans le monde entier. Hébergement professionnel à partir de 0,055$/kWh.

MillionMiner Team

Écrit par

MillionMiner Team

Mining Hardware Operators

The MillionMiner editorial team is made up of professional miners who collectively operate over 30,000 ASICs and ship hardware to clients worldwide every day.

Commentaires 0

Veuillez s'il vous plaît se connecter pour laisser un commentaire

Supprimer le commentaire ?

Cette action ne peut pas être annulée.