Un tableau clair pour la vitesse d'inférence AI, la VRAM et le débit de formation à travers les GPU actuels — des cartes de station de travail au matériel Blackwell pour centres de données. Numéros de référence pour vous aider à choisir le GPU adapté à votre charge de travail.
Indice d'inférence AI le plus élevé dans le domaine. Chaque chiffre ci-dessous est calibré par rapport à la RTX 3090 à 100.
Filtrez par VRAM, triez n'importe quelle colonne, et appuyez sur le + sur deux lignes pour les envoyer directement dans l'arène tête-à-tête ci-dessous.
| Choisir | GPU ↕ | VRAM ↕ | Indice IA ▼ | FP16 TFLOPS ↕ | Entraînement ↕ | Meilleur pour |
|---|---|---|---|---|---|---|
| 96 GB |
403
|
— | — | Largest LLMs without quantization, multi-tenant serving | ||
|
RTX Pro 5000 Blackwell
Flagship
|
48 GB |
285
|
— | — | High-throughput production inference | |
| 48 GB |
238
|
— | — | Best price-to-performance for serious inference | ||
| 32 GB |
207
|
419.1 | — | Fastest single-GPU inference & image generation | ||
| 40 GB |
152
|
312.0 | 1,396 img/s | Proven data-center training workhorse | ||
| 32 GB |
146
|
— | — | Balanced training + inference workstation | ||
|
RTX 4080 Super Pro
Mid
|
32 GB |
139
|
— | — | Mid-range inference & light fine-tuning | |
| 24 GB |
133
|
165.2 | 1,301 img/s | Best all-round price-to-performance card | ||
| 24 GB |
100
|
35.6 | 905 img/s | Budget-friendly entry into serious AI work | ||
|
V100 32GB
Entry
|
32 GB |
84
|
125.0 | — | Legacy data-center training | |
| 24 GB |
83
|
— | — | Compact workstation inference | ||
|
V100 16GB
Entry
|
16 GB |
62
|
125.0 | 833 img/s | Light training / dev environments | |
|
RTX 4070 Ti Super
Mid
|
16 GB |
56
|
— | — | Hobbyist projects & prototyping | |
|
RTX A4000
Entry
|
16 GB |
51
|
19.2 | — | Entry-level dev work, small models | |
| 96 GB | — | — | — | Power-efficient Max-Q variant for dense workstation builds | ||
| 96 GB | — | — | — | Boxed workstation edition, same silicon as Server Edition | ||
|
B200 SXM
Flagship
|
180 GB | — | 2,250.0 | — | Largest-scale multi-GPU training clusters | |
| 192 GB | — | 1,750.0 | — | Massive-context LLM training & serving | ||
|
Instinct MI350X
Flagship
|
288 GB | — | 2,306.9 | — | Massive VRAM pool for huge models, AMD ROCm stacks | |
|
Instinct MI325X
Flagship
|
256 GB | — | 1,307.4 | — | Large-model inference with huge memory headroom | |
| 141 GB | — | 989.5 | — | High-bandwidth-memory LLM serving at scale | ||
| 141 GB | — | 989.5 | — | PCIe/NVLink-bridge alternative to SXM for air-cooled racks | ||
|
Gaudi 3
Flagship
|
128 GB | — | 1,835.0 | — | Intel-based large-scale training alternative | |
|
Instinct MI300X
Flagship
|
192 GB | — | 1,307.4 | — | Single-GPU serving of very large open-weight models | |
| 80 GB | — | 989.5 | — | Industry-standard large-model training & inference | ||
|
RTX 6000 Ada
Flagship
|
48 GB | — | — | — | Top-tier workstation for training & rendering | |
| 32 GB | — | 419.1 | — | Blower-style RTX 5090 for dense multi-GPU builds | ||
| 24 GB | — | — | — | China-compliant RTX 5090 variant, cost-efficient rigs | ||
| 94 GB | — | 835.5 | — | Dual-GPU NVLink inference for very large models | ||
|
H100 PCIe
High-end
|
80 GB | — | 756.5 | — | PCIe-server LLM training & inference | |
| 80 GB | — | 756.5 | — | China-compliant H100 equivalent, reduced NVLink bandwidth | ||
| 80 GB | — | 312.0 | — | Export-compliant A100 alternative for restricted regions | ||
| 80 GB | — | 312.0 | — | Proven large-batch training workhorse | ||
| 40 GB | — | 312.0 | — | China-compliant A100 equivalent for large-scale training | ||
| 48 GB | — | 733.0 | — | Mixed training + inference + rendering server card | ||
| 32 GB | — | — | — | High-end workstation training & inference | ||
|
Instinct MI250X
High-end
|
128 GB | — | 383.0 | — | Large-memory AMD training clusters | |
|
RTX 4070 Ti
Mid
|
12 GB | — | 40.1 | — | Strong price-to-performance for local inference | |
|
L4
Mid
|
24 GB | — | 242.0 | — | Low-power inference & video AI at scale | |
| 48 GB | — | 181.1 | — | Graphics + AI mixed workloads on one card | ||
| 64 GB | — | 181.0 | — | PCIe AMD training/inference card | ||
|
Instinct MI100
Mid
|
32 GB | — | 184.6 | — | Earlier-gen AMD CDNA training/inference card | |
| 48 GB | — | 119.5 | — | Efficient server inference with large VRAM | ||
|
Radeon RX 7900 XTX
Mid
|
24 GB | — | 122.8 | — | AMD consumer flagship for local inference | |
|
RTX 4080 Super
Mid
|
16 GB | — | 104.4 | — | Strong mid-range inference & gaming/AI hybrid use | |
|
Radeon RX 7900 XT
Mid
|
20 GB | — | 103.2 | — | AMD mid-high consumer inference card | |
|
RTX 4080
Mid
|
16 GB | — | 97.5 | — | Solid mid-range inference workstation card | |
| 48 GB | — | 32.6 | — | Large-VRAM legacy workstation for bigger models | ||
|
A40
Mid
|
48 GB | — | 149.7 | — | Large-VRAM data-center inference card | |
| 24 GB | — | 165.0 | — | Efficient shared-server inference | ||
| 24 GB | — | 125.0 | — | Cost-efficient cloud inference card | ||
| 24 GB | — | 39.6 | — | Workstation training with large VRAM headroom | ||
|
RTX A6000
Mid
|
48 GB | — | 38.7 | — | Large-VRAM workstation for bigger models | |
|
RTX 3090 Ti
Mid
|
24 GB | — | 40.0 | — | High-VRAM consumer card for local models | |
|
RTX 3080 Ti
Mid
|
12 GB | — | 34.1 | — | Strong mid-range gaming/AI hybrid card | |
|
Arc A770
Mid
|
16 GB | — | 39.4 | — | Budget Intel card for OpenVINO/local inference | |
|
T4
Entry
|
16 GB | — | 65.0 | — | Very low-power cloud inference card | |
|
RTX A5000
Entry
|
24 GB | — | 27.8 | — | Reliable mid-VRAM workstation card | |
| 20 GB | — | 23.6 | — | Small-batch workstation training | ||
| 20 GB | — | 26.7 | — | Compact single-slot workstation inference | ||
| 20 GB | — | 38.4 | — | Small-form-factor workstation inference | ||
|
RTX 3080
Entry
|
10 GB | — | 29.8 | — | Affordable gaming/AI hybrid card | |
| 16 GB | — | 24.0 | — | Low-power small-form-factor inference | ||
| 16 GB | — | 22.3 | — | Legacy Turing workstation card, small models | ||
| 16 GB | — | 138.0 | — | Media/video-AI inference card | ||
|
RTX 3070
Entry
|
8 GB | — | 20.3 | — | Cheapest realistic entry point for small models | |
|
RTX 4060 Ti 16GB
Entry
|
16 GB | — | 22.1 | — | Budget 16GB card for local LLM experiments | |
| 12 GB | — | 8.0 | — | Ultra-low-power dev / edge inference | ||
|
RTX 4070
Entry
|
12 GB | — | 29.1 | — | Affordable current-gen dev/inference card | |
|
Radeon RX 7800 XT
Entry
|
16 GB | — | 74.4 | — | AMD mid-tier card with generous VRAM | |
| 16 GB | — | 18.7 | — | Legacy Pascal data-center training card | ||
|
RTX 4060
Entry
|
8 GB | — | 15.1 | — | Cheapest current-gen entry inference card | |
|
Instinct MI50
Entry
|
32 GB | — | 26.8 | — | Cheap secondhand AMD VRAM for local inference | |
|
Radeon RX 7600
Entry
|
8 GB | — | 43.5 | — | Budget AMD card for light local inference | |
| 8 GB | — | — | — | Ultra-low-power display/dev card, not AI-focused | ||
| 5 GB | — | — | — | Legacy budget workstation card, minimal AI use | ||
| 4 GB | — | 2.2 | — | Display-output card, not suitable for real AI workloads | ||
| 4 GB | — | — | — | Ultra-budget entry GPU, not recommended for AI workloads |
Affichage :le nombre de 78 cartes
Un serveur multi-GPU n'est pas jugé comme une seule carte — ce qui compte, c'est sa puissance de calcul combinée sur chaque GPU qu'il contient. Le calcul total ci-dessous prend la valeur FP16 TFLOPS par carte correspondant dans le tableau ci-dessus et la multiplie par le nombre de GPU, afin que les serveurs restent sur la même échelle de référence. 48 systèmes actuellement dans notre catalogue Matériel IA — tapez sur un nom pour voir les spécifications complètes et les prix.
| Serveur | Configuration GPU | VRAM total | Calcul total (FP16 TFLOPS) | Prix |
|---|---|---|---|---|
|
NVIDIA DGX B200
DGX / Desktop
|
8x Blackwell GPUs, 1,440GB | 1,440 GB | 18,000.0 | $515,000 |
|
Gigabyte G893-SD1-AAX5
Rack Server
|
8x B200 SXM (HGX B200) | 1,440 GB | 18,000.0 | Demandez un devis |
|
Gigabyte G893-ZD1-AAX5
Rack Server
|
8x B200 SXM (HGX B200) | 1,440 GB | 18,000.0 | Demandez un devis |
|
HGX B200 8-GPU Baseboard
Baseboard
|
8x B200, 1,536GB HBM3e | 1,536 GB | 18,000.0 | Demandez un devis |
|
NVIDIA DGX H100
DGX / Desktop
|
8x H100 SXM5, 640GB | 640 GB | 7,916.0 | $6,700 |
|
NVIDIA DGX H200
DGX / Desktop
|
8x H200 SXM5, 1,128GB | 1,128 GB | 7,916.0 | Demandez un devis |
|
ASRock Rack 6U8X-EGS2
Rack Server
|
8x H200 SXM | 1,128 GB | 7,916.0 | $2,500 |
|
ASUS ESC N8-E11
Rack Server
|
8x H200 SXM (HGX) | 1,128 GB | 7,916.0 | $2,600 |
|
Dell PowerEdge XE9680
Rack Server
|
8x H100 SXM | 640 GB | 7,916.0 | $22,000 |
|
Gigabyte G593-SD2-AAX1
Rack Server
|
8x H100 SXM, 640GB | 640 GB | 7,916.0 | $5,600 |
|
Gigabyte G593-ZD2 (H100 Barebone)
Rack Server
|
8x H100 SXM5 (barebone) | 640 GB | 7,916.0 | $45,000 |
|
Gigabyte G593-ZD2 (H200 Barebone)
Rack Server
|
8x H200 SXM5 (barebone) | 1,128 GB | 7,916.0 | Demandez un devis |
|
Lenovo ThinkSystem SR675 V3
Rack Server
|
8x H100 SXM | 640 GB | 7,916.0 | $300,000 |
|
Lenovo HGX H200 8-GPU Server
Rack Server
|
8x H200 SXM, 141GB each | 1,128 GB | 7,916.0 | Demandez un devis |
|
Quanta S7PH H100
Rack Server
|
8x H100 SXM | 640 GB | 7,916.0 | $280,000 |
|
Quanta S7PH H200 (Barebone)
Rack Server
|
8x H200 SXM (barebone) | 1,128 GB | 7,916.0 | $20,000 |
|
HGX H100 Baseboard (Liquid)
Baseboard
|
8x H100 SXM5, 640GB, liquid-cooled | 640 GB | 7,916.0 | $3,400 |
|
HGX H100 8-GPU Baseboard
Baseboard
|
8x H100 SXM5, 640GB | 640 GB | 7,916.0 | $3,400 |
|
HGX H200 8-GPU Baseboard (Air)
Baseboard
|
8x H200 SXM, 1,128GB, air-cooled | 1,128 GB | 7,916.0 | Demandez un devis |
|
HGX H200 8-GPU Baseboard (Liquid)
Baseboard
|
8x H200 SXM, 1,128GB, liquid-cooled | 1,128 GB | 7,916.0 | Demandez un devis |
|
NVIDIA DGX H800
DGX / Desktop
|
8x H800 SXM5, 640GB | 640 GB | 6,052.0 | Demandez un devis |
|
Supermicro HGX H800 SYS-821GE
Rack Server
|
8x H800 SXM | 640 GB | 6,052.0 | $5,499 |
|
HGX H200 4-GPU Baseboard
Baseboard
|
4x H200 SXM, 564GB | 564 GB | 3,958.0 | $180,000 |
|
Lenovo HGX H200 4-GPU Board
Baseboard
|
4x H200 SXM, liquid-cooled | 564 GB | 3,958.0 | $7,800 |
|
Supermicro SYS-741GE-TNRT
Compact
|
4x H100 PCIe | 320 GB | 3,026.0 | $5,999 |
|
NVIDIA DGX A100
DGX / Desktop
|
8x A100 SXM4, 640GB | 640 GB | 2,496.0 | Demandez un devis |
|
Exeton Quasar 640X
Rack Server
|
8x A100 SXM, 640GB NVLink | 640 GB | 2,496.0 | Demandez un devis |
|
Gigabyte G492-ZD0 (Used)
Rack Server
|
8x A100 SXM | 640 GB | 2,496.0 | Demandez un devis |
|
Supermicro AS-4124GO-NART+
Rack Server
|
8x A100 HGX | 640 GB | 2,496.0 | $13,000 |
|
HGX A100 8-GPU Baseboard (640GB)
Baseboard
|
8x A100 SXM4, 640GB | 640 GB | 2,496.0 | $5,600 |
|
HGX A100 8-GPU Baseboard (320GB)
Baseboard
|
8x A100 SXM4 40GB, 320GB total | 320 GB | 2,496.0 | Demandez un devis |
|
NVIDIA DGX Station A100
DGX / Desktop
|
4x A100, 160GB | 160 GB | 1,248.0 | $85,000 |
|
RTX 5090 Full System
Compact
|
Pre-built RTX 5090 AI workstation | 32 GB | 419.1 | $6,000 |
|
ASUS Ascent GX10
DGX / Desktop
|
GB10 Grace Blackwell Superchip | 128 GB | — | Demandez un devis |
|
ASUS ESC8000A-E12P
Rack Server
|
Dual EPYC 9004, up to 8x GPU | — | — | Demandez un devis |
|
ASUS XA NB3I-E12
Rack Server
|
8x B300 NVL (HGX B300 NVL8) | — | — | $7,999 |
|
Gigabyte H263-S67 (2U 4-Node)
Compact
|
2U 4-node high-density chassis | — | — | $18,000 |
|
NVIDIA DGX Spark
DGX / Desktop
|
GB10 Grace Blackwell Superchip | 128 GB | — | Demandez un devis |
| Edge AI module, 64GB | 64 GB | — | Demandez un devis | |
|
QuantaGrid D74H-7U
Rack Server
|
8-GPU chassis (barebone) | — | — | Demandez un devis |
|
Supermicro AS-8125GS-TNHR (Refurb)
Rack Server
|
8-GPU server (refurbished) | — | — | Demandez un devis |
|
Supermicro AS-8126GS-NB3RT
Rack Server
|
8x B300 NVL (HGX B300 NVL8) | — | — | $450,000 |
|
Supermicro GH200 SuperServer
DGX / Desktop
|
NVIDIA GH200 Grace Hopper Superchip (used) | — | — | Demandez un devis |
|
Supermicro SYS-111C-NR-G1
Compact
|
1U GPU-ready server | — | — | $5,600 |
|
Supermicro SYS-212H-TN-G1
Compact
|
2U GPU-ready server | — | — | Demandez un devis |
|
Supermicro SYS-511E-WR-G1
Compact
|
1U GPU-ready server | — | — | $3,500 |
|
Supermicro SYS-521C-NR-G1
Compact
|
2U GPU-ready server | — | — | $4,500 |
|
Supermicro SYS-522GA-NRT
Compact
|
RTX PRO 6000 / L40S multi-GPU | — | — | Demandez un devis |
Avez-vous déjà repéré quelques favoris ci-dessus ? Choisissez deux GPU et voyez-les s'affronter sur la VRAM, l'indice d'inférence, le calcul FP16 et le débit de formation — avec un verdict en langage clair sur celui qui gagne, et pourquoi.
Nous partons de données de référence publiques sur le cloud GPU — des chiffres vérifiables que chacun peut vérifier, sans conjectures internes.

Chaque carte est évaluée dans l'inférence LLM, la génération d'images et la vision — le travail que le matériel AI accomplit réellement toute la journée.
Vitesse de génération de jetons parmi les modèles open-weight populaires, des assistants légers 8B aux poids lourds 70B+
Débit et latence du modèle de diffusion, couvrant tout, des pipelines turbo rapides aux rendus de qualité production.
Compréhension multimodale des images et débit OCR de documents sous une charge concurrente réaliste.

Tous les scores sont exprimés sur une échelle de 100 points, avec le RTX 3090 comme référence — ainsi, deux cartes peuvent être comparées en un coup d'œil.
Une figure indépendante publiée par GPU unique (images/sec), affichée lorsque un benchmark correspondant existe pour cette carte précise.

Données de référence à titre d'orientation uniquement — les résultats réels varient en fonction de la pile logicielle, des pilotes, de la taille du lot et de la charge de travail. Ce n'est pas une garantie de performance.
Vous êtes nouveau dans ces termes ? Lisez le guide en langage simple pour choisir un GPU AI
Que vous ayez besoin d'une GPU spécifique, d'une configuration complète de serveur ou que vous ayez simplement une question concernant les chiffres de cette page — envoyez-la et un ingénieur qualifié répondra, généralement dans un délai de deux heures.
Un guide approximatif pour associer le niveau GPU à ce que vous prévoyez réellement d'exploiter.
Le niveau supérieur absolu — conçu pour les entreprises fournissant de l'IA à des milliers d'utilisateurs en même temps.
Puissance de production sérieuse pour des équipes exigeantes et des charges de travail quotidiennes importantes.
Le point idéal — de solides performances à un prix qu'une petite équipe peut justifier.
Une solution abordable — apprenez, prototypez et exécutez des modèles plus petits localement.
Il s'agit d'un seul chiffre relatif montrant la performance d'une GPU dans l'inférence LLM, la génération d'images et les charges de travail de vision combinées, normalisé de sorte que la RTX 3090 équivaille toujours à 100. Un score de 200 signifie environ deux fois le débit global d'une RTX 3090.
le RTX Pro 6000 Blackwell occupe actuellement la première place de notre classement avec un indice d'inférence AI de 403 — environ quatre fois le débit d'inférence total du RTX 3090 de référence — associé à 96 Go de VRAM pour les plus grands LLMs sans quantification.
La RTX 5090 (Index d'inférence IA 207, 32 Go) et la RTX 4090 (index 133, 24 Go) offrent le meilleur rapport qualité-prix pour l'inférence sur GPU unique et la génération d'images. La variante RTX 4090 Pro ajoute 48 Go de VRAM pour des modèles plus volumineux tout en conservant une valeur de gamme grand public.
Pour les plus grands LLM servis sans quantification, les cartes phares de centres de données comme la RTX Pro 6000 Blackwell (96 GB), la H200 (141 GB) et l'Instinct MI300X (192 GB) vous offrent la marge mémoire nécessaire pour maintenir des modèles entiers en résident. Pour des modèles de 8 milliards à 30 milliards de paramètres, une seule RTX 5090 ou RTX 4090 offre un excellent débit à une fraction du coût.
Oui — les GPU NVIDIA de génération actuelle et les serveurs AI complets sont disponibles via notre catalogue Hardware AI, avec livraison DDP dans le monde entier et des tarifs B2B sur demande.
C'est l'un des GPU capables d'IA déployés le plus largement, ce qui en fait un point de référence pratique et bien compris pour comparer le matériel plus récent et plus ancien.
Non. La VRAM détermine quels modèles et tailles de batch peuvent être utilisés — elle ne détermine pas elle-même la vitesse. Une carte avec moins de VRAM peut toujours afficher un indice d'inférence plus élevé si son architecture et sa bande passante mémoire sont plus performantes.
L'AMD Instinct MI350X domine avec 288 Go, suivi par la MI325X avec 256 Go. Parmi les cartes NVIDIA, la B100 SXM offre 192 Go et la H200 fournit 141 Go de mémoire à large bande passante. Plus de VRAM permet de charger des modèles plus grands et des lots plus volumineux sans les répartir sur plusieurs GPU.
FP16 TFLOPS est une mesure de pico de calcul théorique publiée par le fabricant — un plafond matériel brut. L’indice d’Inference AI est un score mesuré, basé sur la charge de travail, construit à partir de benchmarks publiés pour les tâches LLM, image et vision. Une carte peut montrer un TFLOPS théorique élevé, mais un indice réel inférieur lorsque la bande passante mémoire ou le support logiciel la retient.
Les deux sont des GPU de data centre Hopper-architecture évalués à 989,5 TFLOPS FP16. La différence réside dans la mémoire : le H200 possède 141 Go de HBM3e plus rapide contre 80 Go sur le H100, ce qui lui permet de traiter des modèles plus grands et des fenêtres de contexte plus longues avec un débit soutenu plus élevé. Pour la majorité des déploiements de nouveaux LLM, le H200 est le choix le plus judicieux.
Oui. Utilisez la comparaison Arena sur cette page pour choisir deux de nos 78 GPU répertoriés et voir leur indice d'inférence AI, VRAM, TFLOPS FP16 et débit de formation côte à côte, avec le gagnant de chaque métrique mis en évidence.
La formation est bien plus gourmande en mémoire et en calcul que l'inférence, ce qui favorise les cartes phares avec une grande VRAM et de hautes TFLOPS FP16 telles que la classe H100, H200, B200 ou Instinct MI300X. Notre colonne Débit de Formation affiche des images par seconde par GPU unique lorsqu’un benchmark publié existe — par exemple 1 396 img/s sur l’A100 40 Go contre 905 sur la RTX 3090.
Oui. Outre 78 GPU individuels, nous répertorions 48 serveurs AI multi-GPU complets, y compris des systèmes de classe HGX et DGX construits autour des accélérateurs H100, H200 et Blackwell, prêts pour une formation à grande échelle et l'inférence en production. Contactez-nous pour la configuration et les prix B2B.
Les trois sont couverts. En plus de la gamme complète NVIDIA, nous incluons des accélérateurs AMD Instinct (MI350X, MI325X, MI300X, MI250X) et des cartes Radeon, ainsi que Intel Gaudi 3 et Arc, afin que vous puissiez comparer les fournisseurs sur un indice cohérent.
Chaque chiffre est tiré de données publiques de référence et de fabricants, agrégées en un indice cohérent pour l'orientation. Les résultats du monde réel varient en fonction de la pile logicielle, des pilotes, de la taille du lot et de la charge de travail, il convient donc de considérer ces chiffres comme un guide comparatif plutôt qu'une garantie de performance.
Nous réévaluons et mettons à jour les chiffres à mesure que de nouvelles générations de GPU sont lancées et que davantage de données de référence deviennent disponibles.
Envoyez votre question via le formulaire de contact ci-dessus — ou envoyez-nous un message sur WhatsApp et obtenez une réponse en quelques minutes.