Eén overzichtelijke tabel voor AI inference snelheid, VRAM en trainingsdoorvoer van de huidige GPU's — van werkstationskaarten tot Blackwell hardware in datacenters. Referentienummers om u te helpen de juiste GPU voor uw werklast te kiezen.
Beste AI Inference Index in het veld. Elk getal hieronder is geschaald ten opzichte van de RTX 3090 op 100.
Filter op VRAM, sort op een kolom en tik op het + bij twee rijen om ze rechtstreeks naar de head-to-head arena hieronder te sturen.
| Kies | GPU ↕ | VRAM ↕ | AI Index ▼ | FP16 TFLOPS ↕ | Training ↕ | Het beste voor |
|---|---|---|---|---|---|---|
| 96 GB |
403
|
— | — | Largest LLMs without quantization, multi-tenant serving | ||
|
RTX Pro 5000 Blackwell
Flagship
|
48 GB |
285
|
— | — | High-throughput production inference | |
| 48 GB |
238
|
— | — | Best price-to-performance for serious inference | ||
| 32 GB |
207
|
419.1 | — | Fastest single-GPU inference & image generation | ||
| 40 GB |
152
|
312.0 | 1,396 img/s | Proven data-center training workhorse | ||
| 32 GB |
146
|
— | — | Balanced training + inference workstation | ||
|
RTX 4080 Super Pro
Mid
|
32 GB |
139
|
— | — | Mid-range inference & light fine-tuning | |
| 24 GB |
133
|
165.2 | 1,301 img/s | Best all-round price-to-performance card | ||
| 24 GB |
100
|
35.6 | 905 img/s | Budget-friendly entry into serious AI work | ||
|
V100 32GB
Entry
|
32 GB |
84
|
125.0 | — | Legacy data-center training | |
| 24 GB |
83
|
— | — | Compact workstation inference | ||
|
V100 16GB
Entry
|
16 GB |
62
|
125.0 | 833 img/s | Light training / dev environments | |
|
RTX 4070 Ti Super
Mid
|
16 GB |
56
|
— | — | Hobbyist projects & prototyping | |
|
RTX A4000
Entry
|
16 GB |
51
|
19.2 | — | Entry-level dev work, small models | |
| 96 GB | — | — | — | Power-efficient Max-Q variant for dense workstation builds | ||
| 96 GB | — | — | — | Boxed workstation edition, same silicon as Server Edition | ||
|
B200 SXM
Flagship
|
180 GB | — | 2,250.0 | — | Largest-scale multi-GPU training clusters | |
| 192 GB | — | 1,750.0 | — | Massive-context LLM training & serving | ||
|
Instinct MI350X
Flagship
|
288 GB | — | 2,306.9 | — | Massive VRAM pool for huge models, AMD ROCm stacks | |
|
Instinct MI325X
Flagship
|
256 GB | — | 1,307.4 | — | Large-model inference with huge memory headroom | |
| 141 GB | — | 989.5 | — | High-bandwidth-memory LLM serving at scale | ||
| 141 GB | — | 989.5 | — | PCIe/NVLink-bridge alternative to SXM for air-cooled racks | ||
|
Gaudi 3
Flagship
|
128 GB | — | 1,835.0 | — | Intel-based large-scale training alternative | |
|
Instinct MI300X
Flagship
|
192 GB | — | 1,307.4 | — | Single-GPU serving of very large open-weight models | |
| 80 GB | — | 989.5 | — | Industry-standard large-model training & inference | ||
|
RTX 6000 Ada
Flagship
|
48 GB | — | — | — | Top-tier workstation for training & rendering | |
| 32 GB | — | 419.1 | — | Blower-style RTX 5090 for dense multi-GPU builds | ||
| 24 GB | — | — | — | China-compliant RTX 5090 variant, cost-efficient rigs | ||
| 94 GB | — | 835.5 | — | Dual-GPU NVLink inference for very large models | ||
|
H100 PCIe
High-end
|
80 GB | — | 756.5 | — | PCIe-server LLM training & inference | |
| 80 GB | — | 756.5 | — | China-compliant H100 equivalent, reduced NVLink bandwidth | ||
| 80 GB | — | 312.0 | — | Export-compliant A100 alternative for restricted regions | ||
| 80 GB | — | 312.0 | — | Proven large-batch training workhorse | ||
| 40 GB | — | 312.0 | — | China-compliant A100 equivalent for large-scale training | ||
| 48 GB | — | 733.0 | — | Mixed training + inference + rendering server card | ||
| 32 GB | — | — | — | High-end workstation training & inference | ||
|
Instinct MI250X
High-end
|
128 GB | — | 383.0 | — | Large-memory AMD training clusters | |
|
RTX 4070 Ti
Mid
|
12 GB | — | 40.1 | — | Strong price-to-performance for local inference | |
|
L4
Mid
|
24 GB | — | 242.0 | — | Low-power inference & video AI at scale | |
| 48 GB | — | 181.1 | — | Graphics + AI mixed workloads on one card | ||
| 64 GB | — | 181.0 | — | PCIe AMD training/inference card | ||
|
Instinct MI100
Mid
|
32 GB | — | 184.6 | — | Earlier-gen AMD CDNA training/inference card | |
| 48 GB | — | 119.5 | — | Efficient server inference with large VRAM | ||
|
Radeon RX 7900 XTX
Mid
|
24 GB | — | 122.8 | — | AMD consumer flagship for local inference | |
|
RTX 4080 Super
Mid
|
16 GB | — | 104.4 | — | Strong mid-range inference & gaming/AI hybrid use | |
|
Radeon RX 7900 XT
Mid
|
20 GB | — | 103.2 | — | AMD mid-high consumer inference card | |
|
RTX 4080
Mid
|
16 GB | — | 97.5 | — | Solid mid-range inference workstation card | |
| 48 GB | — | 32.6 | — | Large-VRAM legacy workstation for bigger models | ||
|
A40
Mid
|
48 GB | — | 149.7 | — | Large-VRAM data-center inference card | |
| 24 GB | — | 165.0 | — | Efficient shared-server inference | ||
| 24 GB | — | 125.0 | — | Cost-efficient cloud inference card | ||
| 24 GB | — | 39.6 | — | Workstation training with large VRAM headroom | ||
|
RTX A6000
Mid
|
48 GB | — | 38.7 | — | Large-VRAM workstation for bigger models | |
|
RTX 3090 Ti
Mid
|
24 GB | — | 40.0 | — | High-VRAM consumer card for local models | |
|
RTX 3080 Ti
Mid
|
12 GB | — | 34.1 | — | Strong mid-range gaming/AI hybrid card | |
|
Arc A770
Mid
|
16 GB | — | 39.4 | — | Budget Intel card for OpenVINO/local inference | |
|
T4
Entry
|
16 GB | — | 65.0 | — | Very low-power cloud inference card | |
|
RTX A5000
Entry
|
24 GB | — | 27.8 | — | Reliable mid-VRAM workstation card | |
| 20 GB | — | 23.6 | — | Small-batch workstation training | ||
| 20 GB | — | 26.7 | — | Compact single-slot workstation inference | ||
| 20 GB | — | 38.4 | — | Small-form-factor workstation inference | ||
|
RTX 3080
Entry
|
10 GB | — | 29.8 | — | Affordable gaming/AI hybrid card | |
| 16 GB | — | 24.0 | — | Low-power small-form-factor inference | ||
| 16 GB | — | 22.3 | — | Legacy Turing workstation card, small models | ||
| 16 GB | — | 138.0 | — | Media/video-AI inference card | ||
|
RTX 3070
Entry
|
8 GB | — | 20.3 | — | Cheapest realistic entry point for small models | |
|
RTX 4060 Ti 16GB
Entry
|
16 GB | — | 22.1 | — | Budget 16GB card for local LLM experiments | |
| 12 GB | — | 8.0 | — | Ultra-low-power dev / edge inference | ||
|
RTX 4070
Entry
|
12 GB | — | 29.1 | — | Affordable current-gen dev/inference card | |
|
Radeon RX 7800 XT
Entry
|
16 GB | — | 74.4 | — | AMD mid-tier card with generous VRAM | |
| 16 GB | — | 18.7 | — | Legacy Pascal data-center training card | ||
|
RTX 4060
Entry
|
8 GB | — | 15.1 | — | Cheapest current-gen entry inference card | |
|
Instinct MI50
Entry
|
32 GB | — | 26.8 | — | Cheap secondhand AMD VRAM for local inference | |
|
Radeon RX 7600
Entry
|
8 GB | — | 43.5 | — | Budget AMD card for light local inference | |
| 8 GB | — | — | — | Ultra-low-power display/dev card, not AI-focused | ||
| 5 GB | — | — | — | Legacy budget workstation card, minimal AI use | ||
| 4 GB | — | 2.2 | — | Display-output card, not suitable for real AI workloads | ||
| 4 GB | — | — | — | Ultra-budget entry GPU, not recommended for AI workloads |
Weergeven 78 van 78 kaarten
Een multi-GPU server wordt niet beoordeeld zoals een enkele kaart — wat ertoe doet is het gecombineerde rekenvermogen van alle GPU's erin. Totale Compute hieronder neemt de overeenkomstige per-kaart FP16 TFLOPS-waarde uit de bovenstaande tabel en vermenigvuldigt deze met het aantal GPU's, zodat servers op dezelfde benchmark-schaal blijven. 48 systemen momenteel in onze AI Hardware-catalogus — tik op een naam voor volledige specificaties en prijzen.
| Server | GPU-configuratie | Totaal VRAM | Totale rekenkracht (FP16 TFLOPS) | Prijs |
|---|---|---|---|---|
|
NVIDIA DGX B200
DGX / Desktop
|
8x Blackwell GPUs, 1,440GB | 1,440 GB | 18,000.0 | $515,000 |
|
Gigabyte G893-SD1-AAX5
Rack Server
|
8x B200 SXM (HGX B200) | 1,440 GB | 18,000.0 | Offerte aanvragen |
|
Gigabyte G893-ZD1-AAX5
Rack Server
|
8x B200 SXM (HGX B200) | 1,440 GB | 18,000.0 | Offerte aanvragen |
|
HGX B200 8-GPU Baseboard
Baseboard
|
8x B200, 1,536GB HBM3e | 1,536 GB | 18,000.0 | Offerte aanvragen |
|
NVIDIA DGX H100
DGX / Desktop
|
8x H100 SXM5, 640GB | 640 GB | 7,916.0 | $6,700 |
|
NVIDIA DGX H200
DGX / Desktop
|
8x H200 SXM5, 1,128GB | 1,128 GB | 7,916.0 | Offerte aanvragen |
|
ASRock Rack 6U8X-EGS2
Rack Server
|
8x H200 SXM | 1,128 GB | 7,916.0 | $2,500 |
|
ASUS ESC N8-E11
Rack Server
|
8x H200 SXM (HGX) | 1,128 GB | 7,916.0 | $2,600 |
|
Dell PowerEdge XE9680
Rack Server
|
8x H100 SXM | 640 GB | 7,916.0 | $22,000 |
|
Gigabyte G593-SD2-AAX1
Rack Server
|
8x H100 SXM, 640GB | 640 GB | 7,916.0 | $5,600 |
|
Gigabyte G593-ZD2 (H100 Barebone)
Rack Server
|
8x H100 SXM5 (barebone) | 640 GB | 7,916.0 | $45,000 |
|
Gigabyte G593-ZD2 (H200 Barebone)
Rack Server
|
8x H200 SXM5 (barebone) | 1,128 GB | 7,916.0 | Offerte aanvragen |
|
Lenovo ThinkSystem SR675 V3
Rack Server
|
8x H100 SXM | 640 GB | 7,916.0 | $300,000 |
|
Lenovo HGX H200 8-GPU Server
Rack Server
|
8x H200 SXM, 141GB each | 1,128 GB | 7,916.0 | Offerte aanvragen |
|
Quanta S7PH H100
Rack Server
|
8x H100 SXM | 640 GB | 7,916.0 | $280,000 |
|
Quanta S7PH H200 (Barebone)
Rack Server
|
8x H200 SXM (barebone) | 1,128 GB | 7,916.0 | $20,000 |
|
HGX H100 Baseboard (Liquid)
Baseboard
|
8x H100 SXM5, 640GB, liquid-cooled | 640 GB | 7,916.0 | $3,400 |
|
HGX H100 8-GPU Baseboard
Baseboard
|
8x H100 SXM5, 640GB | 640 GB | 7,916.0 | $3,400 |
|
HGX H200 8-GPU Baseboard (Air)
Baseboard
|
8x H200 SXM, 1,128GB, air-cooled | 1,128 GB | 7,916.0 | Offerte aanvragen |
|
HGX H200 8-GPU Baseboard (Liquid)
Baseboard
|
8x H200 SXM, 1,128GB, liquid-cooled | 1,128 GB | 7,916.0 | Offerte aanvragen |
|
NVIDIA DGX H800
DGX / Desktop
|
8x H800 SXM5, 640GB | 640 GB | 6,052.0 | Offerte aanvragen |
|
Supermicro HGX H800 SYS-821GE
Rack Server
|
8x H800 SXM | 640 GB | 6,052.0 | $5,499 |
|
HGX H200 4-GPU Baseboard
Baseboard
|
4x H200 SXM, 564GB | 564 GB | 3,958.0 | $180,000 |
|
Lenovo HGX H200 4-GPU Board
Baseboard
|
4x H200 SXM, liquid-cooled | 564 GB | 3,958.0 | $7,800 |
|
Supermicro SYS-741GE-TNRT
Compact
|
4x H100 PCIe | 320 GB | 3,026.0 | $5,999 |
|
NVIDIA DGX A100
DGX / Desktop
|
8x A100 SXM4, 640GB | 640 GB | 2,496.0 | Offerte aanvragen |
|
Exeton Quasar 640X
Rack Server
|
8x A100 SXM, 640GB NVLink | 640 GB | 2,496.0 | Offerte aanvragen |
|
Gigabyte G492-ZD0 (Used)
Rack Server
|
8x A100 SXM | 640 GB | 2,496.0 | Offerte aanvragen |
|
Supermicro AS-4124GO-NART+
Rack Server
|
8x A100 HGX | 640 GB | 2,496.0 | $13,000 |
|
HGX A100 8-GPU Baseboard (640GB)
Baseboard
|
8x A100 SXM4, 640GB | 640 GB | 2,496.0 | $5,600 |
|
HGX A100 8-GPU Baseboard (320GB)
Baseboard
|
8x A100 SXM4 40GB, 320GB total | 320 GB | 2,496.0 | Offerte aanvragen |
|
NVIDIA DGX Station A100
DGX / Desktop
|
4x A100, 160GB | 160 GB | 1,248.0 | $85,000 |
|
RTX 5090 Full System
Compact
|
Pre-built RTX 5090 AI workstation | 32 GB | 419.1 | $6,000 |
|
ASUS Ascent GX10
DGX / Desktop
|
GB10 Grace Blackwell Superchip | 128 GB | — | Offerte aanvragen |
|
ASUS ESC8000A-E12P
Rack Server
|
Dual EPYC 9004, up to 8x GPU | — | — | Offerte aanvragen |
|
ASUS XA NB3I-E12
Rack Server
|
8x B300 NVL (HGX B300 NVL8) | — | — | $7,999 |
|
Gigabyte H263-S67 (2U 4-Node)
Compact
|
2U 4-node high-density chassis | — | — | $18,000 |
|
NVIDIA DGX Spark
DGX / Desktop
|
GB10 Grace Blackwell Superchip | 128 GB | — | Offerte aanvragen |
| Edge AI module, 64GB | 64 GB | — | Offerte aanvragen | |
|
QuantaGrid D74H-7U
Rack Server
|
8-GPU chassis (barebone) | — | — | Offerte aanvragen |
|
Supermicro AS-8125GS-TNHR (Refurb)
Rack Server
|
8-GPU server (refurbished) | — | — | Offerte aanvragen |
|
Supermicro AS-8126GS-NB3RT
Rack Server
|
8x B300 NVL (HGX B300 NVL8) | — | — | $450,000 |
|
Supermicro GH200 SuperServer
DGX / Desktop
|
NVIDIA GH200 Grace Hopper Superchip (used) | — | — | Offerte aanvragen |
|
Supermicro SYS-111C-NR-G1
Compact
|
1U GPU-ready server | — | — | $5,600 |
|
Supermicro SYS-212H-TN-G1
Compact
|
2U GPU-ready server | — | — | Offerte aanvragen |
|
Supermicro SYS-511E-WR-G1
Compact
|
1U GPU-ready server | — | — | $3,500 |
|
Supermicro SYS-521C-NR-G1
Compact
|
2U GPU-ready server | — | — | $4,500 |
|
Supermicro SYS-522GA-NRT
Compact
|
RTX PRO 6000 / L40S multi-GPU | — | — | Offerte aanvragen |
Houdt u al een paar favorieten hierboven in de gaten? Kies twee GPU's en zie hoe ze het tegen elkaar opnemen op het gebied van VRAM, inferentie-index, FP16-rekenkracht en trainingdoorvoer — met een eenvoudige conclusie over welke wint en waarom.
Wij beginnen met openbaar beschikbare benchmarkgegevens voor GPU-cloud — verifieerbare cijfers die iedereen kan controleren, zonder interne gissingen.

Elke kaart wordt gemeten op het gebied van LLM-inferentie, beeldgeneratie en visie — het werk dat AI-hardware de hele dag daadwerkelijk doet.
Token-generatiesnelheid bij populaire open-weight modellen, van lichte 8B assistenten tot 70B+ zwaargewichten.
Durchsatz en latentie van diffusion-modellen, allesomvattend van snelle turbo-pijplijnen tot productieklare renders.
Multimodale beeldverwerking en document OCR-doorvoer onder realistische gelijktijdige belasting.

Alle scores worden weergegeven op één 100-puntsschaal met de RTX 3090 als basislijn — zodat twee kaarten in één oogopslag met elkaar vergeleken kunnen worden.
Een onafhankelijk gepubliceerd enkel-GPU figuur (beelden/sec), weergegeven waar een overeenkomende benchmark bestaat voor die exacte kaart.

Referentiegegevens enkel ter oriëntatie — resultaten in de praktijk variëren afhankelijk van de softwarestack, drivers, batchgrootte en werklast. Geven geen garantie op prestaties.
Nieuw met deze termen? Lees de gids in eenvoudige taal voor het kiezen van een AI GPU
Of u nu een specifieke GPU, een volledige serveropbouw nodig hebt, of gewoon een vraag hebt over de cijfers op deze pagina — stuur het op en een echte ingenieur zal antwoorden, meestal binnen twee uur.
Een ruwe gids voor het afstemmen van GPU-tiers op wat u daadwerkelijk van plan bent te draaien.
De absolute topklasse — ontworpen voor bedrijven die AI leveren aan duizenden gebruikers tegelijk.
Serieuze productiekracht voor veeleisende teams en zware dagelijkse workloads.
De perfecte balans — goede prestaties tegen een prijs die een klein team kan rechtvaardigen.
Een betaalbare manier om binnen te stappen — leer, modelleer en draai kleinere modellen lokaal.
Het is een enkel relatieve getal dat weergeeft hoe een GPU presteert bij LLM-inference, beeldgeneratie en visie-workloads gecombineerd, geschaald zodat de RTX 3090 altijd gelijk is aan 100. Een score van 200 betekent ongeveer het dubbele van de totale doorvoer van een RTX 3090.
De RTX Pro 6000 Blackwell leidt momenteel onze ranglijst met een AI Inference Index van 403 — ongeveer vier keer de totale inference doorvoer van de RTX 3090-baseline — gecombineerd met 96 GB VRAM voor de grootste LLM's zonder quantisatie.
Die RTX 5090 (AI Inference Index 207, 32 GB) und RTX 4090 (Index 133, 24 GB) bieten das beste Preis-Leistungs-Verhältnis für Single-GPU-Inference und Bildgenerierung. Die RTX 4090 Pro Variante fügt 48 GB VRAM für größere Modelle hinzu, während sie weiterhin den Wert der Consumer-Klasse beibehält.
Voor de grootste LLM's die zonder kwantisatie worden bediend, bieden vlaggenschip data centre kaarten zoals de RTX Pro 6000 Blackwell (96 GB), H200 (141 GB) en Instinct MI300X (192 GB) de geheugenruimte om volledige modellen resident te houden. Voor modellen van 8B tot 30B levert een enkele RTX 5090 of RTX 4090 een uitstekende doorvoer tegen een fractie van de kosten.
Ja — grafische kaarten van NVIDIA van de huidige generatie en volledige AI-servers zijn beschikbaar via onze AI Hardware-catalogus, met wereldwijde DDP-verzending en B2B-prijzen op aanvraag.
Het is één van de meest breed inzetbare AI-capabele GPU's, waardoor het een praktisch en goed bekend referentiepunt is voor het vergelijken van nieuwere en oudere hardware.
Nr. VRAM bepaalt welke modelgroottes en batchgroottes überhaupt passen — het bepaalt niet op zichzelf de snelheid. Een kaart met minder VRAM kan nog steeds een hogere inference-index behalen als de architectuur en geheugenbandbreedte sterker zijn.
De AMD Instinct MI350X leidt met 288 GB, gevolgd door de MI325X met 256 GB. Onder NVIDIA-kaarten biedt de B100 SXM 192 GB en de H200 beschikt over 141 GB high-bandwidth geheugen. Meer VRAM stelt u in staat om grotere modellen en grotere batches te laden zonder ze over meerdere GPU's te splitsen.
FP16 TFLOPS is een theoretisch piekberekeningscijfer dat door de fabrikant wordt gepubliceerd — een ruwe hardware limiet. De AI Inference Index is een gemeten, workload-gebaseerde score die is opgebouwd uit gepubliceerde benchmarks voor LLM-, beeld- en visie-taken. Een kaart kan een hoge theoretische TFLOPS tonen, maar een lagere real-world index hebben als geheugenbandbreedte of softwareondersteuning dat belemmert.
Beide zijn Hopper-architectuur GPU's van datacenter met een beoordeling van 989,5 FP16 TFLOPS. Het verschil zit in het geheugen: de H200 beschikt over 141 GB snellere HBM3e versus 80 GB op de H100, zodat deze grotere modellen en langere contextvensters kan bedienen met hogere aanhoudende doorvoer. Voor de meeste nieuwe LLM-serveerimplementaties is de H200 de sterkere keuze.
Ja. Gebruik de vergelijking Arena op deze pagina om twee van onze 78 vermelde GPU's te selecteren en hun AI Inference Index, VRAM, FP16 TFLOPS en trainingsdoorvoer naast elkaar te bekijken, waarbij de winnaar van elke score wordt gemarkeerd.
Training is veel minder geheugen- en rekenintensief dan inferentie, dus het heeft de voorkeur voor vlaggenschipkaarten met grote VRAM en hoge FP16 TFLOPS zoals de H100, H200, B200 of Instinct MI300X klasse. Onze Training Throughput kolom toont single-GPU afbeeldingen per seconde waar een gepubliceerde benchmark bestaat — bijvoorbeeld 1.396 img/s op de A100 40GB versus 905 op de RTX 3090.
Ja. Naast 78 individuele GPU's vermelden wij 48 complete multi-GPU AI-servers, inclusief HGX- en DGX-class systemen gebouwd rond H100, H200 en Blackwell accelerators, klaar voor grootschalige training en productie-inferentie. Neem contact met ons op voor configuratie en B2B-prijzen.
Alle drie zijn gedekt. Naast de volledige NVIDIA-serie omvatten wij AMD Instinct-accelerators (MI350X, MI325X, MI300X, MI250X) en Radeon-kaarten, plus Intel Gaudi 3 en Arc, zodat u leveranciers kunt vergelijken op één consistent index.
Elk cijfer is gebaseerd op openbaar gepubliceerde benchmark- en fabrikantgegevens, samengevoegd tot een consistente index voor oriëntatie. Resultaten in de praktijk variëren afhankelijk van de softwarestack, drivers, batchgrootte en workload, dus behandel de cijfers als een vergelijkende leidraad in plaats van een garantie voor prestaties.
Wij beoordelen en actualiseren de cijfers wanneer nieuwe GPU-generaties worden gelanceerd en wanneer er meer benchmarkgegevens beschikbaar komen.
Stuur uw vraag via het contactformulier hierboven — of bericht ons op WhatsApp en ontvang binnen enkele minuten een antwoord.