Uma tabela clara para velocidade de inferência de IA, VRAM e rendimento de treinamento em GPUs atuais — desde placas workstation até hardware Blackwell de data-centre. Números de referência para ajudá-lo a escolher a GPU certa para sua carga de trabalho.
Índice de Inferência de IA mais alto no setor. Cada número abaixo é escalado em relação à RTX 3090, que vale 100.
Filtre por VRAM, classifique qualquer coluna e toque no + em duas linhas para enviá-las diretamente para a arena de confronto abaixo.
| Escolha | GPU ↕ | VRAM ↕ | Índice de IA ▼ | FP16 TFLOPS ↕ | Treinamento ↕ | Melhor para |
|---|---|---|---|---|---|---|
| 96 GB |
403
|
— | — | Largest LLMs without quantization, multi-tenant serving | ||
|
RTX Pro 5000 Blackwell
Flagship
|
48 GB |
285
|
— | — | High-throughput production inference | |
| 48 GB |
238
|
— | — | Best price-to-performance for serious inference | ||
| 32 GB |
207
|
419.1 | — | Fastest single-GPU inference & image generation | ||
| 40 GB |
152
|
312.0 | 1,396 img/s | Proven data-center training workhorse | ||
| 32 GB |
146
|
— | — | Balanced training + inference workstation | ||
|
RTX 4080 Super Pro
Mid
|
32 GB |
139
|
— | — | Mid-range inference & light fine-tuning | |
| 24 GB |
133
|
165.2 | 1,301 img/s | Best all-round price-to-performance card | ||
| 24 GB |
100
|
35.6 | 905 img/s | Budget-friendly entry into serious AI work | ||
|
V100 32GB
Entry
|
32 GB |
84
|
125.0 | — | Legacy data-center training | |
| 24 GB |
83
|
— | — | Compact workstation inference | ||
|
V100 16GB
Entry
|
16 GB |
62
|
125.0 | 833 img/s | Light training / dev environments | |
|
RTX 4070 Ti Super
Mid
|
16 GB |
56
|
— | — | Hobbyist projects & prototyping | |
|
RTX A4000
Entry
|
16 GB |
51
|
19.2 | — | Entry-level dev work, small models | |
| 96 GB | — | — | — | Power-efficient Max-Q variant for dense workstation builds | ||
| 96 GB | — | — | — | Boxed workstation edition, same silicon as Server Edition | ||
|
B200 SXM
Flagship
|
180 GB | — | 2,250.0 | — | Largest-scale multi-GPU training clusters | |
| 192 GB | — | 1,750.0 | — | Massive-context LLM training & serving | ||
|
Instinct MI350X
Flagship
|
288 GB | — | 2,306.9 | — | Massive VRAM pool for huge models, AMD ROCm stacks | |
|
Instinct MI325X
Flagship
|
256 GB | — | 1,307.4 | — | Large-model inference with huge memory headroom | |
| 141 GB | — | 989.5 | — | High-bandwidth-memory LLM serving at scale | ||
| 141 GB | — | 989.5 | — | PCIe/NVLink-bridge alternative to SXM for air-cooled racks | ||
|
Gaudi 3
Flagship
|
128 GB | — | 1,835.0 | — | Intel-based large-scale training alternative | |
|
Instinct MI300X
Flagship
|
192 GB | — | 1,307.4 | — | Single-GPU serving of very large open-weight models | |
| 80 GB | — | 989.5 | — | Industry-standard large-model training & inference | ||
|
RTX 6000 Ada
Flagship
|
48 GB | — | — | — | Top-tier workstation for training & rendering | |
| 32 GB | — | 419.1 | — | Blower-style RTX 5090 for dense multi-GPU builds | ||
| 24 GB | — | — | — | China-compliant RTX 5090 variant, cost-efficient rigs | ||
| 94 GB | — | 835.5 | — | Dual-GPU NVLink inference for very large models | ||
|
H100 PCIe
High-end
|
80 GB | — | 756.5 | — | PCIe-server LLM training & inference | |
| 80 GB | — | 756.5 | — | China-compliant H100 equivalent, reduced NVLink bandwidth | ||
| 80 GB | — | 312.0 | — | Export-compliant A100 alternative for restricted regions | ||
| 80 GB | — | 312.0 | — | Proven large-batch training workhorse | ||
| 40 GB | — | 312.0 | — | China-compliant A100 equivalent for large-scale training | ||
| 48 GB | — | 733.0 | — | Mixed training + inference + rendering server card | ||
| 32 GB | — | — | — | High-end workstation training & inference | ||
|
Instinct MI250X
High-end
|
128 GB | — | 383.0 | — | Large-memory AMD training clusters | |
|
RTX 4070 Ti
Mid
|
12 GB | — | 40.1 | — | Strong price-to-performance for local inference | |
|
L4
Mid
|
24 GB | — | 242.0 | — | Low-power inference & video AI at scale | |
| 48 GB | — | 181.1 | — | Graphics + AI mixed workloads on one card | ||
| 64 GB | — | 181.0 | — | PCIe AMD training/inference card | ||
|
Instinct MI100
Mid
|
32 GB | — | 184.6 | — | Earlier-gen AMD CDNA training/inference card | |
| 48 GB | — | 119.5 | — | Efficient server inference with large VRAM | ||
|
Radeon RX 7900 XTX
Mid
|
24 GB | — | 122.8 | — | AMD consumer flagship for local inference | |
|
RTX 4080 Super
Mid
|
16 GB | — | 104.4 | — | Strong mid-range inference & gaming/AI hybrid use | |
|
Radeon RX 7900 XT
Mid
|
20 GB | — | 103.2 | — | AMD mid-high consumer inference card | |
|
RTX 4080
Mid
|
16 GB | — | 97.5 | — | Solid mid-range inference workstation card | |
| 48 GB | — | 32.6 | — | Large-VRAM legacy workstation for bigger models | ||
|
A40
Mid
|
48 GB | — | 149.7 | — | Large-VRAM data-center inference card | |
| 24 GB | — | 165.0 | — | Efficient shared-server inference | ||
| 24 GB | — | 125.0 | — | Cost-efficient cloud inference card | ||
| 24 GB | — | 39.6 | — | Workstation training with large VRAM headroom | ||
|
RTX A6000
Mid
|
48 GB | — | 38.7 | — | Large-VRAM workstation for bigger models | |
|
RTX 3090 Ti
Mid
|
24 GB | — | 40.0 | — | High-VRAM consumer card for local models | |
|
RTX 3080 Ti
Mid
|
12 GB | — | 34.1 | — | Strong mid-range gaming/AI hybrid card | |
|
Arc A770
Mid
|
16 GB | — | 39.4 | — | Budget Intel card for OpenVINO/local inference | |
|
T4
Entry
|
16 GB | — | 65.0 | — | Very low-power cloud inference card | |
|
RTX A5000
Entry
|
24 GB | — | 27.8 | — | Reliable mid-VRAM workstation card | |
| 20 GB | — | 23.6 | — | Small-batch workstation training | ||
| 20 GB | — | 26.7 | — | Compact single-slot workstation inference | ||
| 20 GB | — | 38.4 | — | Small-form-factor workstation inference | ||
|
RTX 3080
Entry
|
10 GB | — | 29.8 | — | Affordable gaming/AI hybrid card | |
| 16 GB | — | 24.0 | — | Low-power small-form-factor inference | ||
| 16 GB | — | 22.3 | — | Legacy Turing workstation card, small models | ||
| 16 GB | — | 138.0 | — | Media/video-AI inference card | ||
|
RTX 3070
Entry
|
8 GB | — | 20.3 | — | Cheapest realistic entry point for small models | |
|
RTX 4060 Ti 16GB
Entry
|
16 GB | — | 22.1 | — | Budget 16GB card for local LLM experiments | |
| 12 GB | — | 8.0 | — | Ultra-low-power dev / edge inference | ||
|
RTX 4070
Entry
|
12 GB | — | 29.1 | — | Affordable current-gen dev/inference card | |
|
Radeon RX 7800 XT
Entry
|
16 GB | — | 74.4 | — | AMD mid-tier card with generous VRAM | |
| 16 GB | — | 18.7 | — | Legacy Pascal data-center training card | ||
|
RTX 4060
Entry
|
8 GB | — | 15.1 | — | Cheapest current-gen entry inference card | |
|
Instinct MI50
Entry
|
32 GB | — | 26.8 | — | Cheap secondhand AMD VRAM for local inference | |
|
Radeon RX 7600
Entry
|
8 GB | — | 43.5 | — | Budget AMD card for light local inference | |
| 8 GB | — | — | — | Ultra-low-power display/dev card, not AI-focused | ||
| 5 GB | — | — | — | Legacy budget workstation card, minimal AI use | ||
| 4 GB | — | 2.2 | — | Display-output card, not suitable for real AI workloads | ||
| 4 GB | — | — | — | Ultra-budget entry GPU, not recommended for AI workloads |
Mostrando 78 de 78 cartões
Um servidor multi-GPU não é avaliado como uma única placa — o que importa é a capacidade computacional combinada de todas as GPU nele. Compute Total abaixo pega a cifra de FP16 TFLOPS por placa correspondente na tabela acima e a multiplica pelo número de GPU, para que os servidores permaneçam na mesma escala de referência. 48 sistemas atualmente em nosso catálogo de Hardware AI — toque em qualquer nome para obter especificações completas e preços.
| Servidor | Configuração de GPU | VRAM total | Cálculo Total (FP16 TFLOPS) | Preço |
|---|---|---|---|---|
|
NVIDIA DGX B200
DGX / Desktop
|
8x Blackwell GPUs, 1,440GB | 1,440 GB | 18,000.0 | $515,000 |
|
Gigabyte G893-SD1-AAX5
Rack Server
|
8x B200 SXM (HGX B200) | 1,440 GB | 18,000.0 | Solicitar Orçamento |
|
Gigabyte G893-ZD1-AAX5
Rack Server
|
8x B200 SXM (HGX B200) | 1,440 GB | 18,000.0 | Solicitar Orçamento |
|
HGX B200 8-GPU Baseboard
Baseboard
|
8x B200, 1,536GB HBM3e | 1,536 GB | 18,000.0 | Solicitar Orçamento |
|
NVIDIA DGX H100
DGX / Desktop
|
8x H100 SXM5, 640GB | 640 GB | 7,916.0 | $6,700 |
|
NVIDIA DGX H200
DGX / Desktop
|
8x H200 SXM5, 1,128GB | 1,128 GB | 7,916.0 | Solicitar Orçamento |
|
ASRock Rack 6U8X-EGS2
Rack Server
|
8x H200 SXM | 1,128 GB | 7,916.0 | $2,500 |
|
ASUS ESC N8-E11
Rack Server
|
8x H200 SXM (HGX) | 1,128 GB | 7,916.0 | $2,600 |
|
Dell PowerEdge XE9680
Rack Server
|
8x H100 SXM | 640 GB | 7,916.0 | $22,000 |
|
Gigabyte G593-SD2-AAX1
Rack Server
|
8x H100 SXM, 640GB | 640 GB | 7,916.0 | $5,600 |
|
Gigabyte G593-ZD2 (H100 Barebone)
Rack Server
|
8x H100 SXM5 (barebone) | 640 GB | 7,916.0 | $45,000 |
|
Gigabyte G593-ZD2 (H200 Barebone)
Rack Server
|
8x H200 SXM5 (barebone) | 1,128 GB | 7,916.0 | Solicitar Orçamento |
|
Lenovo ThinkSystem SR675 V3
Rack Server
|
8x H100 SXM | 640 GB | 7,916.0 | $300,000 |
|
Lenovo HGX H200 8-GPU Server
Rack Server
|
8x H200 SXM, 141GB each | 1,128 GB | 7,916.0 | Solicitar Orçamento |
|
Quanta S7PH H100
Rack Server
|
8x H100 SXM | 640 GB | 7,916.0 | $280,000 |
|
Quanta S7PH H200 (Barebone)
Rack Server
|
8x H200 SXM (barebone) | 1,128 GB | 7,916.0 | $20,000 |
|
HGX H100 Baseboard (Liquid)
Baseboard
|
8x H100 SXM5, 640GB, liquid-cooled | 640 GB | 7,916.0 | $3,400 |
|
HGX H100 8-GPU Baseboard
Baseboard
|
8x H100 SXM5, 640GB | 640 GB | 7,916.0 | $3,400 |
|
HGX H200 8-GPU Baseboard (Air)
Baseboard
|
8x H200 SXM, 1,128GB, air-cooled | 1,128 GB | 7,916.0 | Solicitar Orçamento |
|
HGX H200 8-GPU Baseboard (Liquid)
Baseboard
|
8x H200 SXM, 1,128GB, liquid-cooled | 1,128 GB | 7,916.0 | Solicitar Orçamento |
|
NVIDIA DGX H800
DGX / Desktop
|
8x H800 SXM5, 640GB | 640 GB | 6,052.0 | Solicitar Orçamento |
|
Supermicro HGX H800 SYS-821GE
Rack Server
|
8x H800 SXM | 640 GB | 6,052.0 | $5,499 |
|
HGX H200 4-GPU Baseboard
Baseboard
|
4x H200 SXM, 564GB | 564 GB | 3,958.0 | $180,000 |
|
Lenovo HGX H200 4-GPU Board
Baseboard
|
4x H200 SXM, liquid-cooled | 564 GB | 3,958.0 | $7,800 |
|
Supermicro SYS-741GE-TNRT
Compact
|
4x H100 PCIe | 320 GB | 3,026.0 | $5,999 |
|
NVIDIA DGX A100
DGX / Desktop
|
8x A100 SXM4, 640GB | 640 GB | 2,496.0 | Solicitar Orçamento |
|
Exeton Quasar 640X
Rack Server
|
8x A100 SXM, 640GB NVLink | 640 GB | 2,496.0 | Solicitar Orçamento |
|
Gigabyte G492-ZD0 (Used)
Rack Server
|
8x A100 SXM | 640 GB | 2,496.0 | Solicitar Orçamento |
|
Supermicro AS-4124GO-NART+
Rack Server
|
8x A100 HGX | 640 GB | 2,496.0 | $13,000 |
|
HGX A100 8-GPU Baseboard (640GB)
Baseboard
|
8x A100 SXM4, 640GB | 640 GB | 2,496.0 | $5,600 |
|
HGX A100 8-GPU Baseboard (320GB)
Baseboard
|
8x A100 SXM4 40GB, 320GB total | 320 GB | 2,496.0 | Solicitar Orçamento |
|
NVIDIA DGX Station A100
DGX / Desktop
|
4x A100, 160GB | 160 GB | 1,248.0 | $85,000 |
|
RTX 5090 Full System
Compact
|
Pre-built RTX 5090 AI workstation | 32 GB | 419.1 | $6,000 |
|
ASUS Ascent GX10
DGX / Desktop
|
GB10 Grace Blackwell Superchip | 128 GB | — | Solicitar Orçamento |
|
ASUS ESC8000A-E12P
Rack Server
|
Dual EPYC 9004, up to 8x GPU | — | — | Solicitar Orçamento |
|
ASUS XA NB3I-E12
Rack Server
|
8x B300 NVL (HGX B300 NVL8) | — | — | $7,999 |
|
Gigabyte H263-S67 (2U 4-Node)
Compact
|
2U 4-node high-density chassis | — | — | $18,000 |
|
NVIDIA DGX Spark
DGX / Desktop
|
GB10 Grace Blackwell Superchip | 128 GB | — | Solicitar Orçamento |
| Edge AI module, 64GB | 64 GB | — | Solicitar Orçamento | |
|
QuantaGrid D74H-7U
Rack Server
|
8-GPU chassis (barebone) | — | — | Solicitar Orçamento |
|
Supermicro AS-8125GS-TNHR (Refurb)
Rack Server
|
8-GPU server (refurbished) | — | — | Solicitar Orçamento |
|
Supermicro AS-8126GS-NB3RT
Rack Server
|
8x B300 NVL (HGX B300 NVL8) | — | — | $450,000 |
|
Supermicro GH200 SuperServer
DGX / Desktop
|
NVIDIA GH200 Grace Hopper Superchip (used) | — | — | Solicitar Orçamento |
|
Supermicro SYS-111C-NR-G1
Compact
|
1U GPU-ready server | — | — | $5,600 |
|
Supermicro SYS-212H-TN-G1
Compact
|
2U GPU-ready server | — | — | Solicitar Orçamento |
|
Supermicro SYS-511E-WR-G1
Compact
|
1U GPU-ready server | — | — | $3,500 |
|
Supermicro SYS-521C-NR-G1
Compact
|
2U GPU-ready server | — | — | $4,500 |
|
Supermicro SYS-522GA-NRT
Compact
|
RTX PRO 6000 / L40S multi-GPU | — | — | Solicitar Orçamento |
Já identificou um par de favoritos acima? Escolha duas GPUs e observe-as enfrentando-se em VRAM, índice de inferência, cálculo FP16 e rendimento de treinamento — com uma análise em linguagem acessível sobre qual delas vence e por quê.
Começamos com dados de referência públicos de benchmark de GPU em nuvem — números verificáveis que qualquer pessoa pode conferir, sem suposições internas.

Cada cartão é medido em inferência de LLM, geração de imagens e visão — o trabalho que o hardware de IA realmente realiza o dia todo.
Velocidade de geração de tokens em modelos populares de peso aberto, desde assistentes leves de 8B até pesos pesados de mais de 70B.
Vazão e latência do modelo de difusão, abrangendo tudo, desde pipelines turbo rápidos até renders de qualidade de produção.
Compreensão de imagens multimodais e capacidade de OCR de documentos sob carga concorrente realista.

Todas as pontuações estão em uma escala de 100 pontos, com a RTX 3090 como referência — assim, qualquer duas placas podem ser comparadas de relance.
Uma figura de Miner de GPU única publicada de forma independente (imagens/segundo), exibida onde existe um benchmark correspondente para esse cartão exato.

Dados de referência apenas para orientação — os resultados do mundo real variam com a pilha de software, drivers, tamanho do lote e carga de trabalho. Não uma garantia de desempenho.
Novato nesses termos? Leia o guia de linguagem simples para escolher uma GPU de AI
Se precisar de uma GPU específica, de um servidor completo ou simplesmente tiver uma dúvida sobre os números nesta página — envie sua mensagem e um engenheiro de verdade responderá, geralmente dentro de duas horas.
Um guia básico para combinar o nível de GPU com o que você realmente planeja executar.
O mais alto padrão absoluto — criado para empresas que oferecem IA a milhares de usuários ao mesmo tempo.
Potência de produção séria para equipes exigentes e cargas de trabalho diárias pesadas.
O ponto ideal — desempenho forte a um preço que uma pequena equipe pode justificar.
Uma maneira acessível de entrar — aprender, criar protótipos e executar modelos menores localmente.
É um único número relativo que mostra o desempenho de uma GPU em tarefas combinadas de inferência de LLM, geração de imagens e visão, escalado de modo que a RTX 3090 sempre corresponda a 100. Uma pontuação de 200 significa aproximadamente o dobro da vazão total de uma RTX 3090.
O RTX Pro 6000 Blackwell lidera atualmente o nosso ranking com um Índice de Inferência de IA de 403 — aproximadamente quatro vezes a taxa de transferência de inferência agregada do RTX 3090 padrão — aliado a 96 GB de VRAM para os maiores LLMs sem quantização.
A RTX 5090 (AI Inference Index 207, 32 GB) e a RTX 4090 (índice 133, 24 GB) oferecem a melhor relação preço-desempenho para inferência com GPU única e geração de imagens. A variante RTX 4090 Pro adiciona 48 GB de VRAM para modelos maiores, mantendo o valor de classe consumer.
Para os maiores LLMs atendidos sem quantização, cartões de data centre flagship como o RTX Pro 6000 Blackwell (96 GB), H200 (141 GB) e Instinct MI300X (192 GB) oferecem a margem de memória necessária para manter modelos completos residentes. Para modelos de 8B a 30B, uma única RTX 5090 ou RTX 4090 fornece uma excelente taxa de transmissão a uma fração do custo.
Sim — GPUs NVIDIA de última geração e servidores completos de IA estão disponíveis através do nosso catálogo de Hardware de IA, com envio DDP mundial e preços B2B sob solicitação.
É uma das GPUs com capacidade de IA mais amplamente implantadas, tornando-se um ponto de referência prático e bem compreendido para comparar hardware mais recente e mais antigo.
Não. O VRAM determina quais tamanhos de modelo e tamanhos de lotes cabem - não determina a velocidade por si só. Uma placa com menos VRAM ainda pode registrar um índice de inferência mais alto se sua arquitetura e largura de banda de memória forem mais fortes.
O AMD Instinct MI350X lidera com 288 GB, seguido pelo MI325X com 256 GB. Entre as placas NVIDIA, o B100 SXM oferece 192 GB e o H200 fornece 141 GB de memória de alta largura de banda. Mais VRAM permite carregar modelos maiores e lotes maiores sem dividi-los entre várias GPUs.
FP16 TFLOPS é uma medida teórica de pico de computação publicada pelo fabricante — um limite bruto de hardware. O Índice de Inferência de IA é uma pontuação medida, baseada na carga de trabalho, construída a partir de benchmarks publicados em tarefas de LLM, imagem e visão. Uma placa pode exibir TFLOPS teóricos elevados, mas um índice real mais baixo quando a largura de banda de memória ou o suporte de software limitam seu desempenho.
Ambos são GPUs de data-center de arquitetura Hopper com classificação de 989,5 FP16 TFLOPS. A diferença está na memória: o H200 possui 141 GB de HBM3e mais rápida versus 80 GB no H100, portanto, suporta modelos maiores e janelas de contexto mais longas com maior taxa de transferência sustentada. Para a maioria das novas implantações de atendimento a LLM, o H200 é a opção mais forte.
Sim. Utilize a arena de comparação nesta página para escolher duas de nossas 78 GPUs listadas e veja seu Índice de Inferência de IA, VRAM, TFLOPS FP16 e capacidade de treinamento lado a lado, com o vencedor de cada métrica destacado.
O treinamento é muito mais exigente em memória e processamento do que a inferência, portanto, favorece os cartões principais com grande VRAM e alta capacidade de TFLOPS FP16, como a classe H100, H200, B200 ou Instinct MI300X. Nossa coluna de Desempenho de Treinamento mostra imagens por segundo por GPU única, onde existe um benchmark publicado — por exemplo, 1.396 img/s no A100 40GB versus 905 no RTX 3090.
Sim. Juntamente com 78 GPUs individuais, listamos 48 servidores de IA multigPU completos, incluindo sistemas de classe HGX e DGX baseados nos aceleradores H100, H200 e Blackwell, prontos para treinamento em larga escala e inferência de produção. Entre em contato conosco para configurações e preços B2B.
Os três estão cobertos. Junto com toda a linha NVIDIA, incluímos aceleradores AMD Instinct (MI350X, MI325X, MI300X, MI250X) e placas Radeon, além de Intel Gaudi 3 e Arc, para que você possa comparar entre os fornecedores em um índice consistente.
Cada dado é baseado em dados públicos de benchmarks e fabricantes, agregados em um índice consistente para orientação. Os resultados do mundo real variam com a pilha de software, drivers, tamanho do lote e carga de trabalho, portanto, considere os números como um guia comparativo e não uma garantia de desempenho.
Revisamos e atualizamos os números à medida que novas gerações de GPU são lançadas e à medida que mais dados de benchmark se tornam disponíveis.
Envie sua pergunta através do formulário de contato acima — ou envie uma mensagem pelo WhatsApp e receba uma resposta em minutos.