O tabelă clară pentru viteza de inferență AI, VRAM și debitul de antrenament pentru GPU-urile actuale — de la plăci de stație de lucru până la hardware-ul Blackwell pentru centre de date. Numere de referință pentru a vă ajuta să alegeți GPU-ul potrivit pentru volumul dumneavoastră de lucru.
Cel mai înalt indice de inferență AI din domeniu. Fiecare număr de mai jos este scalat față de RTX 3090 la 100.
Filtrați după VRAM, sortați orice coloană și atingeți + pe două rânduri pentru a le trimite direct în arena de confruntare de mai jos.
| Alege | GPU ↕ | VRAM ↕ | Indice AI ▼ | FP16 TFLOPS ↕ | Instruire ↕ | Cel mai bun pentru |
|---|---|---|---|---|---|---|
| 96 GB |
403
|
— | — | Largest LLMs without quantization, multi-tenant serving | ||
|
RTX Pro 5000 Blackwell
Flagship
|
48 GB |
285
|
— | — | High-throughput production inference | |
| 48 GB |
238
|
— | — | Best price-to-performance for serious inference | ||
| 32 GB |
207
|
419.1 | — | Fastest single-GPU inference & image generation | ||
| 40 GB |
152
|
312.0 | 1,396 img/s | Proven data-center training workhorse | ||
| 32 GB |
146
|
— | — | Balanced training + inference workstation | ||
|
RTX 4080 Super Pro
Mid
|
32 GB |
139
|
— | — | Mid-range inference & light fine-tuning | |
| 24 GB |
133
|
165.2 | 1,301 img/s | Best all-round price-to-performance card | ||
| 24 GB |
100
|
35.6 | 905 img/s | Budget-friendly entry into serious AI work | ||
|
V100 32GB
Entry
|
32 GB |
84
|
125.0 | — | Legacy data-center training | |
| 24 GB |
83
|
— | — | Compact workstation inference | ||
|
V100 16GB
Entry
|
16 GB |
62
|
125.0 | 833 img/s | Light training / dev environments | |
|
RTX 4070 Ti Super
Mid
|
16 GB |
56
|
— | — | Hobbyist projects & prototyping | |
|
RTX A4000
Entry
|
16 GB |
51
|
19.2 | — | Entry-level dev work, small models | |
| 96 GB | — | — | — | Power-efficient Max-Q variant for dense workstation builds | ||
| 96 GB | — | — | — | Boxed workstation edition, same silicon as Server Edition | ||
|
B200 SXM
Flagship
|
180 GB | — | 2,250.0 | — | Largest-scale multi-GPU training clusters | |
| 192 GB | — | 1,750.0 | — | Massive-context LLM training & serving | ||
|
Instinct MI350X
Flagship
|
288 GB | — | 2,306.9 | — | Massive VRAM pool for huge models, AMD ROCm stacks | |
|
Instinct MI325X
Flagship
|
256 GB | — | 1,307.4 | — | Large-model inference with huge memory headroom | |
| 141 GB | — | 989.5 | — | High-bandwidth-memory LLM serving at scale | ||
| 141 GB | — | 989.5 | — | PCIe/NVLink-bridge alternative to SXM for air-cooled racks | ||
|
Gaudi 3
Flagship
|
128 GB | — | 1,835.0 | — | Intel-based large-scale training alternative | |
|
Instinct MI300X
Flagship
|
192 GB | — | 1,307.4 | — | Single-GPU serving of very large open-weight models | |
| 80 GB | — | 989.5 | — | Industry-standard large-model training & inference | ||
|
RTX 6000 Ada
Flagship
|
48 GB | — | — | — | Top-tier workstation for training & rendering | |
| 32 GB | — | 419.1 | — | Blower-style RTX 5090 for dense multi-GPU builds | ||
| 24 GB | — | — | — | China-compliant RTX 5090 variant, cost-efficient rigs | ||
| 94 GB | — | 835.5 | — | Dual-GPU NVLink inference for very large models | ||
|
H100 PCIe
High-end
|
80 GB | — | 756.5 | — | PCIe-server LLM training & inference | |
| 80 GB | — | 756.5 | — | China-compliant H100 equivalent, reduced NVLink bandwidth | ||
| 80 GB | — | 312.0 | — | Export-compliant A100 alternative for restricted regions | ||
| 80 GB | — | 312.0 | — | Proven large-batch training workhorse | ||
| 40 GB | — | 312.0 | — | China-compliant A100 equivalent for large-scale training | ||
| 48 GB | — | 733.0 | — | Mixed training + inference + rendering server card | ||
| 32 GB | — | — | — | High-end workstation training & inference | ||
|
Instinct MI250X
High-end
|
128 GB | — | 383.0 | — | Large-memory AMD training clusters | |
|
RTX 4070 Ti
Mid
|
12 GB | — | 40.1 | — | Strong price-to-performance for local inference | |
|
L4
Mid
|
24 GB | — | 242.0 | — | Low-power inference & video AI at scale | |
| 48 GB | — | 181.1 | — | Graphics + AI mixed workloads on one card | ||
| 64 GB | — | 181.0 | — | PCIe AMD training/inference card | ||
|
Instinct MI100
Mid
|
32 GB | — | 184.6 | — | Earlier-gen AMD CDNA training/inference card | |
| 48 GB | — | 119.5 | — | Efficient server inference with large VRAM | ||
|
Radeon RX 7900 XTX
Mid
|
24 GB | — | 122.8 | — | AMD consumer flagship for local inference | |
|
RTX 4080 Super
Mid
|
16 GB | — | 104.4 | — | Strong mid-range inference & gaming/AI hybrid use | |
|
Radeon RX 7900 XT
Mid
|
20 GB | — | 103.2 | — | AMD mid-high consumer inference card | |
|
RTX 4080
Mid
|
16 GB | — | 97.5 | — | Solid mid-range inference workstation card | |
| 48 GB | — | 32.6 | — | Large-VRAM legacy workstation for bigger models | ||
|
A40
Mid
|
48 GB | — | 149.7 | — | Large-VRAM data-center inference card | |
| 24 GB | — | 165.0 | — | Efficient shared-server inference | ||
| 24 GB | — | 125.0 | — | Cost-efficient cloud inference card | ||
| 24 GB | — | 39.6 | — | Workstation training with large VRAM headroom | ||
|
RTX A6000
Mid
|
48 GB | — | 38.7 | — | Large-VRAM workstation for bigger models | |
|
RTX 3090 Ti
Mid
|
24 GB | — | 40.0 | — | High-VRAM consumer card for local models | |
|
RTX 3080 Ti
Mid
|
12 GB | — | 34.1 | — | Strong mid-range gaming/AI hybrid card | |
|
Arc A770
Mid
|
16 GB | — | 39.4 | — | Budget Intel card for OpenVINO/local inference | |
|
T4
Entry
|
16 GB | — | 65.0 | — | Very low-power cloud inference card | |
|
RTX A5000
Entry
|
24 GB | — | 27.8 | — | Reliable mid-VRAM workstation card | |
| 20 GB | — | 23.6 | — | Small-batch workstation training | ||
| 20 GB | — | 26.7 | — | Compact single-slot workstation inference | ||
| 20 GB | — | 38.4 | — | Small-form-factor workstation inference | ||
|
RTX 3080
Entry
|
10 GB | — | 29.8 | — | Affordable gaming/AI hybrid card | |
| 16 GB | — | 24.0 | — | Low-power small-form-factor inference | ||
| 16 GB | — | 22.3 | — | Legacy Turing workstation card, small models | ||
| 16 GB | — | 138.0 | — | Media/video-AI inference card | ||
|
RTX 3070
Entry
|
8 GB | — | 20.3 | — | Cheapest realistic entry point for small models | |
|
RTX 4060 Ti 16GB
Entry
|
16 GB | — | 22.1 | — | Budget 16GB card for local LLM experiments | |
| 12 GB | — | 8.0 | — | Ultra-low-power dev / edge inference | ||
|
RTX 4070
Entry
|
12 GB | — | 29.1 | — | Affordable current-gen dev/inference card | |
|
Radeon RX 7800 XT
Entry
|
16 GB | — | 74.4 | — | AMD mid-tier card with generous VRAM | |
| 16 GB | — | 18.7 | — | Legacy Pascal data-center training card | ||
|
RTX 4060
Entry
|
8 GB | — | 15.1 | — | Cheapest current-gen entry inference card | |
|
Instinct MI50
Entry
|
32 GB | — | 26.8 | — | Cheap secondhand AMD VRAM for local inference | |
|
Radeon RX 7600
Entry
|
8 GB | — | 43.5 | — | Budget AMD card for light local inference | |
| 8 GB | — | — | — | Ultra-low-power display/dev card, not AI-focused | ||
| 5 GB | — | — | — | Legacy budget workstation card, minimal AI use | ||
| 4 GB | — | 2.2 | — | Display-output card, not suitable for real AI workloads | ||
| 4 GB | — | — | — | Ultra-budget entry GPU, not recommended for AI workloads |
Afișare 78 din 78 cărți
Un server multi-GPU nu este evaluat ca un singur card — ceea ce contează este capacitatea de calcul combinată a fiecărui GPU din interior. Totalul de compute de mai jos ia valoarea FP16 TFLOPS corectă per card din tabelul de mai sus și o înmulțește cu numărul de GPU-uri, astfel încât serverele să rămână pe aceeași scară de referință. 48 sisteme în prezent în catalogul nostru de Hardware AI — atinge orice nume pentru specificații complete și prețuri.
| Server | Configurare GPU | Total VRAM | Total Compute (FP16 TFLOPS) | Preț |
|---|---|---|---|---|
|
NVIDIA DGX B200
DGX / Desktop
|
8x Blackwell GPUs, 1,440GB | 1,440 GB | 18,000.0 | $515,000 |
|
Gigabyte G893-SD1-AAX5
Rack Server
|
8x B200 SXM (HGX B200) | 1,440 GB | 18,000.0 | Solicitare Cotație |
|
Gigabyte G893-ZD1-AAX5
Rack Server
|
8x B200 SXM (HGX B200) | 1,440 GB | 18,000.0 | Solicitare Cotație |
|
HGX B200 8-GPU Baseboard
Baseboard
|
8x B200, 1,536GB HBM3e | 1,536 GB | 18,000.0 | Solicitare Cotație |
|
NVIDIA DGX H100
DGX / Desktop
|
8x H100 SXM5, 640GB | 640 GB | 7,916.0 | $6,700 |
|
NVIDIA DGX H200
DGX / Desktop
|
8x H200 SXM5, 1,128GB | 1,128 GB | 7,916.0 | Solicitare Cotație |
|
ASRock Rack 6U8X-EGS2
Rack Server
|
8x H200 SXM | 1,128 GB | 7,916.0 | $2,500 |
|
ASUS ESC N8-E11
Rack Server
|
8x H200 SXM (HGX) | 1,128 GB | 7,916.0 | $2,600 |
|
Dell PowerEdge XE9680
Rack Server
|
8x H100 SXM | 640 GB | 7,916.0 | $22,000 |
|
Gigabyte G593-SD2-AAX1
Rack Server
|
8x H100 SXM, 640GB | 640 GB | 7,916.0 | $5,600 |
|
Gigabyte G593-ZD2 (H100 Barebone)
Rack Server
|
8x H100 SXM5 (barebone) | 640 GB | 7,916.0 | $45,000 |
|
Gigabyte G593-ZD2 (H200 Barebone)
Rack Server
|
8x H200 SXM5 (barebone) | 1,128 GB | 7,916.0 | Solicitare Cotație |
|
Lenovo ThinkSystem SR675 V3
Rack Server
|
8x H100 SXM | 640 GB | 7,916.0 | $300,000 |
|
Lenovo HGX H200 8-GPU Server
Rack Server
|
8x H200 SXM, 141GB each | 1,128 GB | 7,916.0 | Solicitare Cotație |
|
Quanta S7PH H100
Rack Server
|
8x H100 SXM | 640 GB | 7,916.0 | $280,000 |
|
Quanta S7PH H200 (Barebone)
Rack Server
|
8x H200 SXM (barebone) | 1,128 GB | 7,916.0 | $20,000 |
|
HGX H100 Baseboard (Liquid)
Baseboard
|
8x H100 SXM5, 640GB, liquid-cooled | 640 GB | 7,916.0 | $3,400 |
|
HGX H100 8-GPU Baseboard
Baseboard
|
8x H100 SXM5, 640GB | 640 GB | 7,916.0 | $3,400 |
|
HGX H200 8-GPU Baseboard (Air)
Baseboard
|
8x H200 SXM, 1,128GB, air-cooled | 1,128 GB | 7,916.0 | Solicitare Cotație |
|
HGX H200 8-GPU Baseboard (Liquid)
Baseboard
|
8x H200 SXM, 1,128GB, liquid-cooled | 1,128 GB | 7,916.0 | Solicitare Cotație |
|
NVIDIA DGX H800
DGX / Desktop
|
8x H800 SXM5, 640GB | 640 GB | 6,052.0 | Solicitare Cotație |
|
Supermicro HGX H800 SYS-821GE
Rack Server
|
8x H800 SXM | 640 GB | 6,052.0 | $5,499 |
|
HGX H200 4-GPU Baseboard
Baseboard
|
4x H200 SXM, 564GB | 564 GB | 3,958.0 | $180,000 |
|
Lenovo HGX H200 4-GPU Board
Baseboard
|
4x H200 SXM, liquid-cooled | 564 GB | 3,958.0 | $7,800 |
|
Supermicro SYS-741GE-TNRT
Compact
|
4x H100 PCIe | 320 GB | 3,026.0 | $5,999 |
|
NVIDIA DGX A100
DGX / Desktop
|
8x A100 SXM4, 640GB | 640 GB | 2,496.0 | Solicitare Cotație |
|
Exeton Quasar 640X
Rack Server
|
8x A100 SXM, 640GB NVLink | 640 GB | 2,496.0 | Solicitare Cotație |
|
Gigabyte G492-ZD0 (Used)
Rack Server
|
8x A100 SXM | 640 GB | 2,496.0 | Solicitare Cotație |
|
Supermicro AS-4124GO-NART+
Rack Server
|
8x A100 HGX | 640 GB | 2,496.0 | $13,000 |
|
HGX A100 8-GPU Baseboard (640GB)
Baseboard
|
8x A100 SXM4, 640GB | 640 GB | 2,496.0 | $5,600 |
|
HGX A100 8-GPU Baseboard (320GB)
Baseboard
|
8x A100 SXM4 40GB, 320GB total | 320 GB | 2,496.0 | Solicitare Cotație |
|
NVIDIA DGX Station A100
DGX / Desktop
|
4x A100, 160GB | 160 GB | 1,248.0 | $85,000 |
|
RTX 5090 Full System
Compact
|
Pre-built RTX 5090 AI workstation | 32 GB | 419.1 | $6,000 |
|
ASUS Ascent GX10
DGX / Desktop
|
GB10 Grace Blackwell Superchip | 128 GB | — | Solicitare Cotație |
|
ASUS ESC8000A-E12P
Rack Server
|
Dual EPYC 9004, up to 8x GPU | — | — | Solicitare Cotație |
|
ASUS XA NB3I-E12
Rack Server
|
8x B300 NVL (HGX B300 NVL8) | — | — | $7,999 |
|
Gigabyte H263-S67 (2U 4-Node)
Compact
|
2U 4-node high-density chassis | — | — | $18,000 |
|
NVIDIA DGX Spark
DGX / Desktop
|
GB10 Grace Blackwell Superchip | 128 GB | — | Solicitare Cotație |
| Edge AI module, 64GB | 64 GB | — | Solicitare Cotație | |
|
QuantaGrid D74H-7U
Rack Server
|
8-GPU chassis (barebone) | — | — | Solicitare Cotație |
|
Supermicro AS-8125GS-TNHR (Refurb)
Rack Server
|
8-GPU server (refurbished) | — | — | Solicitare Cotație |
|
Supermicro AS-8126GS-NB3RT
Rack Server
|
8x B300 NVL (HGX B300 NVL8) | — | — | $450,000 |
|
Supermicro GH200 SuperServer
DGX / Desktop
|
NVIDIA GH200 Grace Hopper Superchip (used) | — | — | Solicitare Cotație |
|
Supermicro SYS-111C-NR-G1
Compact
|
1U GPU-ready server | — | — | $5,600 |
|
Supermicro SYS-212H-TN-G1
Compact
|
2U GPU-ready server | — | — | Solicitare Cotație |
|
Supermicro SYS-511E-WR-G1
Compact
|
1U GPU-ready server | — | — | $3,500 |
|
Supermicro SYS-521C-NR-G1
Compact
|
2U GPU-ready server | — | — | $4,500 |
|
Supermicro SYS-522GA-NRT
Compact
|
RTX PRO 6000 / L40S multi-GPU | — | — | Solicitare Cotație |
Ați identificat deja câțiva favoriți mai sus? Alegeți oricare două GPU-uri și urmăriți-le competiția privind VRAM, indicele de inferență, compute FP16 și performanța de antrenament — cu o verdictare exprimată în termeni simpli despre care câștigă și de ce.
Începem cu date de referință publicate despre benchmarking-ul GPU-cloud — cifre verificabile pe care oricine le poate verifica, fără presupuneri interne.

Fiecare carte este măsurată în funcție de inferența LLM, generarea de imagini și viziune — munca hardware-ului AI pe care îl realizează cu adevărat pe tot parcursul zilei.
Viteza de generare a tokenurilor pe modelele open-weight populare, de la asistenți ușori de 8B până la grei de peste 70B.
Tabelul de transfer și latența modelului de difuzie, acoperind totul, de la pipeline-uri turbo rapide până la randări de calitate de producție.
Înțelegerea multimodală a imaginilor și debitul OCR pentru documente sub o încărcare concurentă realistă.

Toate scorurile se situează pe aceeași scară de 100 de puncte, cu RTX 3090 ca referință — astfel încât orice două plăci pot fi comparate în câteva secunde.
O figură independent publicată pentru un singur GPU (imagini/sec), prezentată acolo unde există un obiectiv de referință pentru acel card exact.

Date de referință doar pentru orientare — rezultatele din lumea reală variază în funcție de stack-ul de software, drivere, dimensiunea lotului și volumul de muncă. Nu este o garanție a performanței.
Nov în acești termeni? Citiți ghidul simplu pentru alegerea unui GPU AI
Indiferent dacă aveți nevoie de o anumită GPU, o construcție completă de server sau pur și simplu aveți o întrebare despre cifrele de pe această pagină — trimiteți-ne mesajul și un inginer real vă va răspunde, de obicei în termen de două ore.
Un ghid aproximativ pentru corespondența nivelului de GPU cu ceea ce plănuiți să rulați efectiv.
Cel mai înalt nivel — conceput pentru companii care oferă AI pentru mii de utilizatori simultan.
Putere de producție serioasă pentru echipe exigente și sarcini zilnice intensive.
Punctul ideal — performanță puternică la un preț pe care o echipă mică îl poate justifica.
O modalitate accesibilă — învățați, prototipați și rulați modele mai mici local.
Este un număr relativ unic care arată performanța unui GPU în cadrul inferenței LLM, generării de imagini și sarcinilor de viziune combinate, scalat astfel încât RTX 3090 să fie întotdeauna egal cu 100. Un scor de 200 înseamnă aproximativ de două ori peste capacitatea totală a RTX 3090.
RTX Pro 6000 Blackwell conduce în prezent clasamentul nostru cu un indice de inferență AI de 403 — aproximativ de patru ori capacitatea aggregate de inferență a modelului de bază RTX 3090 — combinat cu 96 GB VRAM pentru cele mai mari LLM-uri fără cuantizare.
RTX 5090 (AI Inference Index 207, 32 GB) și RTX 4090 (index 133, 24 GB) oferă cel mai bun raport calitate-preț pentru inferența și generarea de imagini cu un singur GPU. Varianta RTX 4090 Pro adaugă 48 GB de VRAM pentru modele mai mari, menținând în același timp valoarea de clasă consumator.
Pentru cele mai mari modele LLM deservite fără cuantizare, plăcile de top pentru centre de date precum RTX Pro 6000 Blackwell (96 GB), H200 (141 GB) și Instinct MI300X (192 GB) vă oferă spațiul de memorie necesar pentru a menține întregul model resident. Pentru modele de 8B până la 30B, o singură RTX 5090 sau RTX 4090 asigură un throughput excelent la o fracțiune din cost.
Da, plăci NVIDIA de generație actuală și servere complete AI sunt disponibile prin catalogul nostru de hardware AI, cu livrare DDP în întreaga lume și prețuri B2B la cerere.
Este unul dintre cele mai utilizate GPU-uri capabile de AI, fiind un reper practic și bine înțeles pentru compararea hardware-ului mai nou și mai vechi.
Nu. VRAM-ul determină dimensiunile modelelor și dimensiunile loturilor care se pot potrivi — nu determină singur viteza. O placă cu mai puțin VRAM poate avea în continuare un indice de inferență mai mare dacă arhitectura și lățimea de bandă a memoriei sunt mai puternice.
AMD Instinct MI350X conducează cu 288 GB, urmat de MI325X cu 256 GB. Dintre plăcile NVIDIA, B100 SXM oferă 192 GB, iar H200 furnizează 141 GB de memorie cu lățime de bandă ridicată. Mai mult VRAM vă permite să încărcați modele mai mari și loturi mai mari fără a le împărți între mai multe GPU-uri.
FP16 TFLOPS reprezintă o valoare teoretică maximă de calcul publicată de fabricant — un plafon hardware brut. Indicele AI Inference este un scor măsurat, bazat pe sarcini de lucru, construit din benchmark-uri publicate pentru sarcini LLM, imagini și viziune. O placă poate afișa TFLOPS teoretice ridicate, dar un indice real în lumea reală mai mic atunci când lățimea de bandă a memoriei sau suportul software o limitează.
Ambele sunt GPU-uri pentru data centre cu arhitectură Hopper, evaluate la 989,5 FP16 TFLOPS. Diferența constă în memorie: H200 are 141 GB de HBM3e mai rapid față de 80 GB pe H100, astfel încât suportă modele mai mari și ferestre de context mai lungi la o rată de transfer susținută mai mare. Pentru majoritatea noilor implementări de servire LLM, H200 reprezintă opțiunea mai puternică.
Da, utilizați Arena de comparație de pe această pagină pentru a selecta orice doi dintre cei 78 de GPU-uri enumerate și vedeți în paralel AI Inference Index, VRAM, FP16 TFLOPS și plasarea pentru antrenare, cu câștigătorul fiecărei metrici evidențiat.
Instruirea este mult mai intensivă în memorie și calcul decât inferența, așa că favorizează cardurile flagship cu VRAM mare și TFLOPS FP16 ridicate, precum clasa H100, H200, B200 sau Instinct MI300X. Coloana noastră de Performanță a Instruirii afișează imagini pe secundă pe GPU unic, unde există un reper publicat — de exemplu 1.396 img/sec pe A100 40GB versus 905 pe RTX 3090.
Da. Alături de 78 de GPU-uri individuale, listăm 48 de servere AI multi-GPU complete, inclusiv sisteme de tip HGX și DGX construite în jurul acceleratorilor H100, H200 și Blackwell, pregătite pentru training de scară largă și inferență de producție. Contactați-ne pentru configurare și prețuri B2B.
Tuturor celor trei sunt acoperiți. Alături de gama completă NVIDIA, includem acceleratoare AMD Instinct (MI350X, MI325X, MI300X, MI250X) și plăci Radeon, plus Intel Gaudi 3 și Arc, astfel încât să puteți compara între furnizori pe un indice consecvent.
Fiecare cifră este extrasă din datele publicate de benchmark și de producător, agregate într-un indice consistent pentru orientare. Rezultatele din lumea reală variază în funcție de stack-ul software, drivere, dimensiunea lotului și workload, așadar tratați cifrele ca un ghid comparativ, mai degrabă decât o garanție a performanței.
Revizuim și actualizăm cifrele pe măsură ce apar noi generații de GPU și pe măsură ce devin disponibile mai multe date de referință.
Trimiteți întrebarea dumneavoastră prin formularul de contact de mai sus — sau trimiteți-ne un mesaj pe WhatsApp și primiți un răspuns în câteva minute.