Jedna přehledná tabulka rychlosti inferenčního procesu AI, VRAM a průtoku tréninku napříč současnými GPU — od pracovních stanicových karet po hardware Blackwell v datových centrech. Referenční čísla, která vám pomohou vybrat správný GPU pro vaše zatížení.
Nejvyšší index umělé inteligence v oboru. Každé číslo níže je škálováno vůči RTX 3090 na 100.
Filtrovat podle VRAM, seřadit jakoukoli sloupec a klepněte na + u jakýchkoli dvou řádků, abyste je přímo poslali do arény head-to-head níže.
| Vyberte | GPU ↕ | VRAM ↕ | AI Index ▼ | FP16 TFLOPS ↕ | Školení ↕ | Nejlepší pro |
|---|---|---|---|---|---|---|
| 96 GB |
403
|
— | — | Largest LLMs without quantization, multi-tenant serving | ||
|
RTX Pro 5000 Blackwell
Flagship
|
48 GB |
285
|
— | — | High-throughput production inference | |
| 48 GB |
238
|
— | — | Best price-to-performance for serious inference | ||
| 32 GB |
207
|
419.1 | — | Fastest single-GPU inference & image generation | ||
| 40 GB |
152
|
312.0 | 1,396 img/s | Proven data-center training workhorse | ||
| 32 GB |
146
|
— | — | Balanced training + inference workstation | ||
|
RTX 4080 Super Pro
Mid
|
32 GB |
139
|
— | — | Mid-range inference & light fine-tuning | |
| 24 GB |
133
|
165.2 | 1,301 img/s | Best all-round price-to-performance card | ||
| 24 GB |
100
|
35.6 | 905 img/s | Budget-friendly entry into serious AI work | ||
|
V100 32GB
Entry
|
32 GB |
84
|
125.0 | — | Legacy data-center training | |
| 24 GB |
83
|
— | — | Compact workstation inference | ||
|
V100 16GB
Entry
|
16 GB |
62
|
125.0 | 833 img/s | Light training / dev environments | |
|
RTX 4070 Ti Super
Mid
|
16 GB |
56
|
— | — | Hobbyist projects & prototyping | |
|
RTX A4000
Entry
|
16 GB |
51
|
19.2 | — | Entry-level dev work, small models | |
| 96 GB | — | — | — | Power-efficient Max-Q variant for dense workstation builds | ||
| 96 GB | — | — | — | Boxed workstation edition, same silicon as Server Edition | ||
|
B200 SXM
Flagship
|
180 GB | — | 2,250.0 | — | Largest-scale multi-GPU training clusters | |
| 192 GB | — | 1,750.0 | — | Massive-context LLM training & serving | ||
|
Instinct MI350X
Flagship
|
288 GB | — | 2,306.9 | — | Massive VRAM pool for huge models, AMD ROCm stacks | |
|
Instinct MI325X
Flagship
|
256 GB | — | 1,307.4 | — | Large-model inference with huge memory headroom | |
| 141 GB | — | 989.5 | — | High-bandwidth-memory LLM serving at scale | ||
| 141 GB | — | 989.5 | — | PCIe/NVLink-bridge alternative to SXM for air-cooled racks | ||
|
Gaudi 3
Flagship
|
128 GB | — | 1,835.0 | — | Intel-based large-scale training alternative | |
|
Instinct MI300X
Flagship
|
192 GB | — | 1,307.4 | — | Single-GPU serving of very large open-weight models | |
| 80 GB | — | 989.5 | — | Industry-standard large-model training & inference | ||
|
RTX 6000 Ada
Flagship
|
48 GB | — | — | — | Top-tier workstation for training & rendering | |
| 32 GB | — | 419.1 | — | Blower-style RTX 5090 for dense multi-GPU builds | ||
| 24 GB | — | — | — | China-compliant RTX 5090 variant, cost-efficient rigs | ||
| 94 GB | — | 835.5 | — | Dual-GPU NVLink inference for very large models | ||
|
H100 PCIe
High-end
|
80 GB | — | 756.5 | — | PCIe-server LLM training & inference | |
| 80 GB | — | 756.5 | — | China-compliant H100 equivalent, reduced NVLink bandwidth | ||
| 80 GB | — | 312.0 | — | Export-compliant A100 alternative for restricted regions | ||
| 80 GB | — | 312.0 | — | Proven large-batch training workhorse | ||
| 40 GB | — | 312.0 | — | China-compliant A100 equivalent for large-scale training | ||
| 48 GB | — | 733.0 | — | Mixed training + inference + rendering server card | ||
| 32 GB | — | — | — | High-end workstation training & inference | ||
|
Instinct MI250X
High-end
|
128 GB | — | 383.0 | — | Large-memory AMD training clusters | |
|
RTX 4070 Ti
Mid
|
12 GB | — | 40.1 | — | Strong price-to-performance for local inference | |
|
L4
Mid
|
24 GB | — | 242.0 | — | Low-power inference & video AI at scale | |
| 48 GB | — | 181.1 | — | Graphics + AI mixed workloads on one card | ||
| 64 GB | — | 181.0 | — | PCIe AMD training/inference card | ||
|
Instinct MI100
Mid
|
32 GB | — | 184.6 | — | Earlier-gen AMD CDNA training/inference card | |
| 48 GB | — | 119.5 | — | Efficient server inference with large VRAM | ||
|
Radeon RX 7900 XTX
Mid
|
24 GB | — | 122.8 | — | AMD consumer flagship for local inference | |
|
RTX 4080 Super
Mid
|
16 GB | — | 104.4 | — | Strong mid-range inference & gaming/AI hybrid use | |
|
Radeon RX 7900 XT
Mid
|
20 GB | — | 103.2 | — | AMD mid-high consumer inference card | |
|
RTX 4080
Mid
|
16 GB | — | 97.5 | — | Solid mid-range inference workstation card | |
| 48 GB | — | 32.6 | — | Large-VRAM legacy workstation for bigger models | ||
|
A40
Mid
|
48 GB | — | 149.7 | — | Large-VRAM data-center inference card | |
| 24 GB | — | 165.0 | — | Efficient shared-server inference | ||
| 24 GB | — | 125.0 | — | Cost-efficient cloud inference card | ||
| 24 GB | — | 39.6 | — | Workstation training with large VRAM headroom | ||
|
RTX A6000
Mid
|
48 GB | — | 38.7 | — | Large-VRAM workstation for bigger models | |
|
RTX 3090 Ti
Mid
|
24 GB | — | 40.0 | — | High-VRAM consumer card for local models | |
|
RTX 3080 Ti
Mid
|
12 GB | — | 34.1 | — | Strong mid-range gaming/AI hybrid card | |
|
Arc A770
Mid
|
16 GB | — | 39.4 | — | Budget Intel card for OpenVINO/local inference | |
|
T4
Entry
|
16 GB | — | 65.0 | — | Very low-power cloud inference card | |
|
RTX A5000
Entry
|
24 GB | — | 27.8 | — | Reliable mid-VRAM workstation card | |
| 20 GB | — | 23.6 | — | Small-batch workstation training | ||
| 20 GB | — | 26.7 | — | Compact single-slot workstation inference | ||
| 20 GB | — | 38.4 | — | Small-form-factor workstation inference | ||
|
RTX 3080
Entry
|
10 GB | — | 29.8 | — | Affordable gaming/AI hybrid card | |
| 16 GB | — | 24.0 | — | Low-power small-form-factor inference | ||
| 16 GB | — | 22.3 | — | Legacy Turing workstation card, small models | ||
| 16 GB | — | 138.0 | — | Media/video-AI inference card | ||
|
RTX 3070
Entry
|
8 GB | — | 20.3 | — | Cheapest realistic entry point for small models | |
|
RTX 4060 Ti 16GB
Entry
|
16 GB | — | 22.1 | — | Budget 16GB card for local LLM experiments | |
| 12 GB | — | 8.0 | — | Ultra-low-power dev / edge inference | ||
|
RTX 4070
Entry
|
12 GB | — | 29.1 | — | Affordable current-gen dev/inference card | |
|
Radeon RX 7800 XT
Entry
|
16 GB | — | 74.4 | — | AMD mid-tier card with generous VRAM | |
| 16 GB | — | 18.7 | — | Legacy Pascal data-center training card | ||
|
RTX 4060
Entry
|
8 GB | — | 15.1 | — | Cheapest current-gen entry inference card | |
|
Instinct MI50
Entry
|
32 GB | — | 26.8 | — | Cheap secondhand AMD VRAM for local inference | |
|
Radeon RX 7600
Entry
|
8 GB | — | 43.5 | — | Budget AMD card for light local inference | |
| 8 GB | — | — | — | Ultra-low-power display/dev card, not AI-focused | ||
| 5 GB | — | — | — | Legacy budget workstation card, minimal AI use | ||
| 4 GB | — | 2.2 | — | Display-output card, not suitable for real AI workloads | ||
| 4 GB | — | — | — | Ultra-budget entry GPU, not recommended for AI workloads |
Zobrazení 78 karet ze 78
Více-GPU server není posuzován jako samostatná karta — důležitá je jeho celková výpočetní kapacita napříč všemi GPU uvnitř něj. Celkový výkon níže bere odpovídající per-karta FP16 TFLOPS hodnotu z tabulky výše a násobí ji počtem GPU, aby servery zůstaly na stejné škále benchmarků. 48 systémů aktuálně v našem katalogu AI Hardware — klepněte na jakékoli jméno pro úplné specifikace a ceny.
| Server | Nastavení GPU | Celkové VRAM | Celkový výpočet (FP16 TFLOPS) | Cena |
|---|---|---|---|---|
|
NVIDIA DGX B200
DGX / Desktop
|
8x Blackwell GPUs, 1,440GB | 1,440 GB | 18,000.0 | $515,000 |
|
Gigabyte G893-SD1-AAX5
Rack Server
|
8x B200 SXM (HGX B200) | 1,440 GB | 18,000.0 | Požádat o nabídku |
|
Gigabyte G893-ZD1-AAX5
Rack Server
|
8x B200 SXM (HGX B200) | 1,440 GB | 18,000.0 | Požádat o nabídku |
|
HGX B200 8-GPU Baseboard
Baseboard
|
8x B200, 1,536GB HBM3e | 1,536 GB | 18,000.0 | Požádat o nabídku |
|
NVIDIA DGX H100
DGX / Desktop
|
8x H100 SXM5, 640GB | 640 GB | 7,916.0 | $6,700 |
|
NVIDIA DGX H200
DGX / Desktop
|
8x H200 SXM5, 1,128GB | 1,128 GB | 7,916.0 | Požádat o nabídku |
|
ASRock Rack 6U8X-EGS2
Rack Server
|
8x H200 SXM | 1,128 GB | 7,916.0 | $2,500 |
|
ASUS ESC N8-E11
Rack Server
|
8x H200 SXM (HGX) | 1,128 GB | 7,916.0 | $2,600 |
|
Dell PowerEdge XE9680
Rack Server
|
8x H100 SXM | 640 GB | 7,916.0 | $22,000 |
|
Gigabyte G593-SD2-AAX1
Rack Server
|
8x H100 SXM, 640GB | 640 GB | 7,916.0 | $5,600 |
|
Gigabyte G593-ZD2 (H100 Barebone)
Rack Server
|
8x H100 SXM5 (barebone) | 640 GB | 7,916.0 | $45,000 |
|
Gigabyte G593-ZD2 (H200 Barebone)
Rack Server
|
8x H200 SXM5 (barebone) | 1,128 GB | 7,916.0 | Požádat o nabídku |
|
Lenovo ThinkSystem SR675 V3
Rack Server
|
8x H100 SXM | 640 GB | 7,916.0 | $300,000 |
|
Lenovo HGX H200 8-GPU Server
Rack Server
|
8x H200 SXM, 141GB each | 1,128 GB | 7,916.0 | Požádat o nabídku |
|
Quanta S7PH H100
Rack Server
|
8x H100 SXM | 640 GB | 7,916.0 | $280,000 |
|
Quanta S7PH H200 (Barebone)
Rack Server
|
8x H200 SXM (barebone) | 1,128 GB | 7,916.0 | $20,000 |
|
HGX H100 Baseboard (Liquid)
Baseboard
|
8x H100 SXM5, 640GB, liquid-cooled | 640 GB | 7,916.0 | $3,400 |
|
HGX H100 8-GPU Baseboard
Baseboard
|
8x H100 SXM5, 640GB | 640 GB | 7,916.0 | $3,400 |
|
HGX H200 8-GPU Baseboard (Air)
Baseboard
|
8x H200 SXM, 1,128GB, air-cooled | 1,128 GB | 7,916.0 | Požádat o nabídku |
|
HGX H200 8-GPU Baseboard (Liquid)
Baseboard
|
8x H200 SXM, 1,128GB, liquid-cooled | 1,128 GB | 7,916.0 | Požádat o nabídku |
|
NVIDIA DGX H800
DGX / Desktop
|
8x H800 SXM5, 640GB | 640 GB | 6,052.0 | Požádat o nabídku |
|
Supermicro HGX H800 SYS-821GE
Rack Server
|
8x H800 SXM | 640 GB | 6,052.0 | $5,499 |
|
HGX H200 4-GPU Baseboard
Baseboard
|
4x H200 SXM, 564GB | 564 GB | 3,958.0 | $180,000 |
|
Lenovo HGX H200 4-GPU Board
Baseboard
|
4x H200 SXM, liquid-cooled | 564 GB | 3,958.0 | $7,800 |
|
Supermicro SYS-741GE-TNRT
Compact
|
4x H100 PCIe | 320 GB | 3,026.0 | $5,999 |
|
NVIDIA DGX A100
DGX / Desktop
|
8x A100 SXM4, 640GB | 640 GB | 2,496.0 | Požádat o nabídku |
|
Exeton Quasar 640X
Rack Server
|
8x A100 SXM, 640GB NVLink | 640 GB | 2,496.0 | Požádat o nabídku |
|
Gigabyte G492-ZD0 (Used)
Rack Server
|
8x A100 SXM | 640 GB | 2,496.0 | Požádat o nabídku |
|
Supermicro AS-4124GO-NART+
Rack Server
|
8x A100 HGX | 640 GB | 2,496.0 | $13,000 |
|
HGX A100 8-GPU Baseboard (640GB)
Baseboard
|
8x A100 SXM4, 640GB | 640 GB | 2,496.0 | $5,600 |
|
HGX A100 8-GPU Baseboard (320GB)
Baseboard
|
8x A100 SXM4 40GB, 320GB total | 320 GB | 2,496.0 | Požádat o nabídku |
|
NVIDIA DGX Station A100
DGX / Desktop
|
4x A100, 160GB | 160 GB | 1,248.0 | $85,000 |
|
RTX 5090 Full System
Compact
|
Pre-built RTX 5090 AI workstation | 32 GB | 419.1 | $6,000 |
|
ASUS Ascent GX10
DGX / Desktop
|
GB10 Grace Blackwell Superchip | 128 GB | — | Požádat o nabídku |
|
ASUS ESC8000A-E12P
Rack Server
|
Dual EPYC 9004, up to 8x GPU | — | — | Požádat o nabídku |
|
ASUS XA NB3I-E12
Rack Server
|
8x B300 NVL (HGX B300 NVL8) | — | — | $7,999 |
|
Gigabyte H263-S67 (2U 4-Node)
Compact
|
2U 4-node high-density chassis | — | — | $18,000 |
|
NVIDIA DGX Spark
DGX / Desktop
|
GB10 Grace Blackwell Superchip | 128 GB | — | Požádat o nabídku |
| Edge AI module, 64GB | 64 GB | — | Požádat o nabídku | |
|
QuantaGrid D74H-7U
Rack Server
|
8-GPU chassis (barebone) | — | — | Požádat o nabídku |
|
Supermicro AS-8125GS-TNHR (Refurb)
Rack Server
|
8-GPU server (refurbished) | — | — | Požádat o nabídku |
|
Supermicro AS-8126GS-NB3RT
Rack Server
|
8x B300 NVL (HGX B300 NVL8) | — | — | $450,000 |
|
Supermicro GH200 SuperServer
DGX / Desktop
|
NVIDIA GH200 Grace Hopper Superchip (used) | — | — | Požádat o nabídku |
|
Supermicro SYS-111C-NR-G1
Compact
|
1U GPU-ready server | — | — | $5,600 |
|
Supermicro SYS-212H-TN-G1
Compact
|
2U GPU-ready server | — | — | Požádat o nabídku |
|
Supermicro SYS-511E-WR-G1
Compact
|
1U GPU-ready server | — | — | $3,500 |
|
Supermicro SYS-521C-NR-G1
Compact
|
2U GPU-ready server | — | — | $4,500 |
|
Supermicro SYS-522GA-NRT
Compact
|
RTX PRO 6000 / L40S multi-GPU | — | — | Požádat o nabídku |
Už jste si všimli několika oblíbených výše? Vyberte si jakékoliv dva GPU a sledujte je při srovnávání VRAM, inference indexu, FP16 výpočtů a tréninkové propustnosti — s jednoduchým vysvětlením, který z nich vyhrává a proč.
Začínáme s veřejně dostupnými daty z GPU-Cloud benchmarků — ověřitelnými čísly, která může každý zkontrolovat, žádné odhady uvnitř firmy.

Každá karta je měřena v oblasti inferencí LLM, generování obrázků a vize — práce, kterou hardware AI skutečně vykonává po celý den.
Rychlost generování tokenů u oblíbených open-weight modelů, od lehkých asistentů s 8B po těžkotonážní modely s více než 70B.
Propustnost a latence modelu difuze, pokrývající vše od rychlých turbo pipeline až po renderování v kvalitě produkce.
Multimodální porozumění obrázkům a propustnost OCR dokumentů za realistických souběžných zátěží.

Všechny body jsou na jedné 100bodové škále s RTX 3090 jako referencí — takže dva karty lze porovnat na první pohled.
Nezávisle zveřejněná tabulka s jedním GPU (snímky za sekundu), zobrazena tam, kde existuje srovnatelný benchmark pro konkrétní kartu.

Referenční údaje pouze pro orientaci — skutečné výsledky se liší v závislosti na softwarové sadě, ovladačích, velikosti dávky a zátěži. Nejde o záruku výkonu.
Jste na těchto pojmech noví? Přehled průvodce volbou AI GPU
Ať už potřebujete konkrétní GPU, kompletní sestavu serveru nebo máte jen otázku ohledně čísel na této stránce — zašlete ji a skutečný inženýr odpoví, obvykle do dvou hodin.
Hrubý průvodce sladěním úrovně GPU s tím, co skutečně plánujete provozovat.
Nejvyšší špičková třída — určena pro společnosti, které poskytují AI tisícům uživatelů najednou.
Seriózní výrobní výkon pro náročné týmy a těžké denní pracovní zatížení.
Ideální kompromis — výkonnostná síla za cenu, kterou může malý tým ospravedlnit.
Dostupný způsob, jak začít — učit se, vytvářet prototypy a spouštět menší modely lokálně.
Jedná se o jediné relativní číslo ukazující výkon GPU při zpracování LLM inference, generování obrázků a vizuálních úloh v součtu, přičemž hodnota je škálována tak, že RTX 3090 má vždy hodnotu 100. Hodnocení 200 znamená přibližně dvojnásobný celkový průchod ve srovnání s RTX 3090.
RTX Pro 6000 Blackwell v současné době vede naše žebříčky s Indexem AI Inference 403 — zhruba čtyřikrát vyšší celkovou propustností inference ve srovnání s RTX 3090 základním modelem — v kombinaci s 96 GB VRAM pro největší LLM bez kvantizace.
RTX 5090 (AI Inference Index 207, 32 GB) a RTX 4090 (index 133, 24 GB) nabízí nejlepší poměr cena/výkon pro jednotlivé GPU při inferencích a generování obrázků. Varianta RTX 4090 Pro přidává 48 GB VRAM pro větší modely a přitom zachovává hodnotu v třídě spotřebitelských produktů.
Pro největší LLM, které jsou poskytovány bez kvantizace, vám špičkové karty datových centrech, jako jsou RTX Pro 6000 Blackwell (96 GB), H200 (141 GB) a Instinct MI300X (192 GB), poskytnou dostatek paměťového prostoru k zachování celých modelů v paměti. U modelů od 8B do 30B vám jeden RTX 5090 nebo RTX 4090 nabízí vynikající propustnost za zlomek ceny.
Ano — současné generace GPU NVIDIA a plné AI servery jsou k dispozici v našem katalogu AI Hardware, s celosvětovou dopravou DDP a cenami B2B na vyžádání.
Je to jeden z nejrozšířenějších GPU schopných AI, což z něj činí praktickou, dobře pochopenou referenční hodnotu pro porovnání novějšího a staršího hardwaru.
Ne. VRAM určuje, jaké modelové velikosti a velikosti dávky se vůbec vejdou — samo o sobě neurčuje rychlost. Karta s menším VRAM může stále vykazovat vyšší index inferenční rychlosti, pokud je její architektura a paměťová šířka vyšší.
AMD Instinct MI350X vede s 288 GB, následuje MI325X s 256 GB. Mezi kartami NVIDIA nabízí B100 SXM 192 GB a H200 poskytuje 141 GB vysoce propustné paměti. Více VRAM vám umožní načítat větší modely a větší dávky bez jejich rozdělení přes více GPU.
FP16 TFLOPS je teoretická špičková výpočetní hodnota zveřejněná výrobcem — surové hardwarové maximum. Index AI Inference je měřené, zatížení založené skóre postavené na zveřejněných ukázkách výkonu v oblasti LLM, obrázků a vizuálních úloh. Karta může vykazovat vysoké teoretické TFLOPS, přesto může mít nižší skutečné indexové hodnocení, když ji zpomaluje šířka paměťového pásma nebo softwarová podpora.
Oba jsou GPU s architekturou Hopper v datových centrech hodnocené na 989,5 FP16 TFLOPS. Rozdíl je v paměti: H200 má 141 GB rychlejší HBM3e versus 80 GB na H100, takže podporuje větší modely a delší kontextové okna při vyšším kontinuálním výkonu. Pro většinu nových nasazení LLM je H200 silnější volbou.
Ano. Použijte na této stránce srovnávací Arena a vyberte si jakékoliv dva z našich 78 uvedených GPU a porovnejte jejich Index AI Inference, VRAM, FP16 TFLOPS a průchodnost tréninku vedle sebe, přičemž vítěz každé metriky bude zvýrazněn.
Trénování je výrazně náročnější na paměť a výpočetní výkon než inference, proto upřednostňuje špičkové karty s velkou VRAM a vysokým FP16 TFLOPS, jako jsou třídy H100, H200, B200 nebo Instinct MI300X. Náš sloupec Výkon tréninku ukazuje obrázky na sekundu na jednu GPU, kde existuje zveřejněný benchmark — například 1 396 obrázků/s na A100 40GB versus 905 na RTX 3090.
Ano. Vedle 78 samostatných GPU uvádíme 48 kompletních multi-GPU AI serverů, včetně systémů třídy HGX a DGX, postavených na akcelerátorech H100, H200 a Blackwell, připravených pro velkoobjemové trénování a produkční inferenci. Kontaktujte nás ohledně konfigurace a B2B cen.
Všechny tři jsou pokryty. Spolu s kompletní řadou NVIDIA zahrnujeme akcelerátory AMD Instinct (MI350X, MI325X, MI300X, MI250X) a karty Radeon, dále Intel Gaudi 3 a Arc, takže můžete porovnávat napříč výrobci na jednom konzistentním indexu.
Všechny údaje jsou odvozeny z veřejně dostupných benchmarků a údajů výrobců, seskupených do konzistentního indexu pro orientaci. Reálné výsledky se liší podle softwarového balíku, ovladačů, velikosti dávky a zátěže, proto považujte tyto čísla spíše za srovnávací pomůcku než za záruku výkonu.
Pravidelně revidujeme a aktualizujeme čísla s příchodem nových generací GPU a s dostupností dalších srovnávacích dat.
Pošlete svou otázku prostřednictvím výše uvedeného kontaktního formuláře — nebo nás kontaktujte na WhatsApp a obdržíte odpověď během několika minut.