Benchmarks de GPU & Servidores de IA

Compare AI
Desempenho da GPU Visão Geral

Uma tabela clara para velocidade de inferência de IA, VRAM e rendimento de treinamento em GPUs atuais — desde placas workstation até hardware Blackwell de data-centre. Números de referência para ajudá-lo a escolher a GPU certa para sua carga de trabalho.

Hardware de servidor GPU de IA
403
Índice Principal
288 GB
Max VRAM
78
Cartões comparados
78
Comparação de GPUs
48
Servidores de IA
=100
Indexado ao RTX 3090
4–288 GB
faixa de VRAM
Escolha 2
Compare face a face
Disponível em estoque
Relacionado com o que vendemos
*Classificação (01)

O Top Três, Classificado

Índice de Inferência de IA mais alto no setor. Cada número abaixo é escalado em relação à RTX 3090, que vale 100.

2 Prata

RTX Pro 5000 Blackwell

48 GB VRAM · Flagship
285Índice
High-throughput production inference
1 Ouro

RTX Pro 6000 Blackwell

96 GB VRAM · Flagship
403Índice
Largest LLMs without quantization, multi-tenant serving
3 Bronze

RTX 4090 Pro

48 GB VRAM · High-end
238Índice
Best price-to-performance for serious inference
O Campo Completo

Contagem de todas as GPUs, Uma tabela

Filtre por VRAM, classifique qualquer coluna e toque no + em duas linhas para enviá-las diretamente para a arena de confronto abaixo.

A vs B Sua primeira escolha torna-se A, sua segunda B — eles enfrentam-se cara a cara mais adiante. Ir para a comparação ↓
Escolha GPU VRAM Índice de IA FP16 TFLOPS Treinamento Melhor para
RTX Pro 6000 Blackwell Na loja Flagship
96 GB
403
Largest LLMs without quantization, multi-tenant serving
RTX Pro 5000 Blackwell Flagship
48 GB
285
High-throughput production inference
RTX 4090 Pro Na loja High-end
48 GB
238
Best price-to-performance for serious inference
RTX 5090 Na loja High-end
32 GB
207
419.1 Fastest single-GPU inference & image generation
A100 40GB Na loja High-end
40 GB
152
312.0 1,396 img/s Proven data-center training workhorse
32 GB
146
Balanced training + inference workstation
RTX 4080 Super Pro Mid
32 GB
139
Mid-range inference & light fine-tuning
RTX 4090 Na loja Mid
24 GB
133
165.2 1,301 img/s Best all-round price-to-performance card
RTX 3090 Na loja Mid
24 GB
100
35.6 905 img/s Budget-friendly entry into serious AI work
V100 32GB Entry
32 GB
84
125.0 Legacy data-center training
RTX Pro 4000 Blackwell Na loja Entry
24 GB
83
Compact workstation inference
V100 16GB Entry
16 GB
62
125.0 833 img/s Light training / dev environments
RTX 4070 Ti Super Mid
16 GB
56
Hobbyist projects & prototyping
RTX A4000 Entry
16 GB
51
19.2 Entry-level dev work, small models
RTX Pro 6000 Blackwell Max-Q Na loja Flagship
96 GB Power-efficient Max-Q variant for dense workstation builds
96 GB Boxed workstation edition, same silicon as Server Edition
B200 SXM Flagship
180 GB 2,250.0 Largest-scale multi-GPU training clusters
B100 SXM Na loja Flagship
192 GB 1,750.0 Massive-context LLM training & serving
Instinct MI350X Flagship
288 GB 2,306.9 Massive VRAM pool for huge models, AMD ROCm stacks
Instinct MI325X Flagship
256 GB 1,307.4 Large-model inference with huge memory headroom
H200 SXM Na loja Flagship
141 GB 989.5 High-bandwidth-memory LLM serving at scale
H200 NVL Na loja Flagship
141 GB 989.5 PCIe/NVLink-bridge alternative to SXM for air-cooled racks
Gaudi 3 Flagship
128 GB 1,835.0 Intel-based large-scale training alternative
Instinct MI300X Flagship
192 GB 1,307.4 Single-GPU serving of very large open-weight models
H100 SXM5 Na loja Flagship
80 GB 989.5 Industry-standard large-model training & inference
RTX 6000 Ada Flagship
48 GB Top-tier workstation for training & rendering
RTX 5090 Blower Na loja High-end
32 GB 419.1 Blower-style RTX 5090 for dense multi-GPU builds
RTX 5090D V2 (China) Na loja High-end
24 GB China-compliant RTX 5090 variant, cost-efficient rigs
H100 NVL Na loja High-end
94 GB 835.5 Dual-GPU NVLink inference for very large models
H100 PCIe High-end
80 GB 756.5 PCIe-server LLM training & inference
H800 Na loja High-end
80 GB 756.5 China-compliant H100 equivalent, reduced NVLink bandwidth
A800 80GB Na loja High-end
80 GB 312.0 Export-compliant A100 alternative for restricted regions
A100 80GB Na loja High-end
80 GB 312.0 Proven large-batch training workhorse
A800 40GB Na loja High-end
40 GB 312.0 China-compliant A100 equivalent for large-scale training
L40S Na loja High-end
48 GB 733.0 Mixed training + inference + rendering server card
RTX 5000 Ada Na loja High-end
32 GB High-end workstation training & inference
Instinct MI250X High-end
128 GB 383.0 Large-memory AMD training clusters
RTX 4070 Ti Mid
12 GB 40.1 Strong price-to-performance for local inference
L4 Mid
24 GB 242.0 Low-power inference & video AI at scale
L40 Na loja Mid
48 GB 181.1 Graphics + AI mixed workloads on one card
Instinct MI210 Na loja Mid
64 GB 181.0 PCIe AMD training/inference card
Instinct MI100 Mid
32 GB 184.6 Earlier-gen AMD CDNA training/inference card
L20 Na loja Mid
48 GB 119.5 Efficient server inference with large VRAM
Radeon RX 7900 XTX Mid
24 GB 122.8 AMD consumer flagship for local inference
RTX 4080 Super Mid
16 GB 104.4 Strong mid-range inference & gaming/AI hybrid use
Radeon RX 7900 XT Mid
20 GB 103.2 AMD mid-high consumer inference card
RTX 4080 Mid
16 GB 97.5 Solid mid-range inference workstation card
Quadro RTX 8000 Na loja Mid
48 GB 32.6 Large-VRAM legacy workstation for bigger models
A40 Mid
48 GB 149.7 Large-VRAM data-center inference card
A30 Na loja Mid
24 GB 165.0 Efficient shared-server inference
A10 Na loja Mid
24 GB 125.0 Cost-efficient cloud inference card
RTX 4500 Ada Na loja Mid
24 GB 39.6 Workstation training with large VRAM headroom
RTX A6000 Mid
48 GB 38.7 Large-VRAM workstation for bigger models
RTX 3090 Ti Mid
24 GB 40.0 High-VRAM consumer card for local models
RTX 3080 Ti Mid
12 GB 34.1 Strong mid-range gaming/AI hybrid card
Arc A770 Mid
16 GB 39.4 Budget Intel card for OpenVINO/local inference
T4 Entry
16 GB 65.0 Very low-power cloud inference card
RTX A5000 Entry
24 GB 27.8 Reliable mid-VRAM workstation card
RTX A4500 Na loja Entry
20 GB 23.6 Small-batch workstation training
RTX 4000 Ada Na loja Entry
20 GB 26.7 Compact single-slot workstation inference
RTX 4000 SFF Ada Na loja Entry
20 GB 38.4 Small-form-factor workstation inference
RTX 3080 Entry
10 GB 29.8 Affordable gaming/AI hybrid card
RTX 2000 Ada Na loja Entry
16 GB 24.0 Low-power small-form-factor inference
Quadro RTX 5000 Na loja Entry
16 GB 22.3 Legacy Turing workstation card, small models
Intel Flex 170 Na loja Entry
16 GB 138.0 Media/video-AI inference card
RTX 3070 Entry
8 GB 20.3 Cheapest realistic entry point for small models
RTX 4060 Ti 16GB Entry
16 GB 22.1 Budget 16GB card for local LLM experiments
RTX A2000 Na loja Entry
12 GB 8.0 Ultra-low-power dev / edge inference
RTX 4070 Entry
12 GB 29.1 Affordable current-gen dev/inference card
Radeon RX 7800 XT Entry
16 GB 74.4 AMD mid-tier card with generous VRAM
Tesla P100 Na loja Entry
16 GB 18.7 Legacy Pascal data-center training card
RTX 4060 Entry
8 GB 15.1 Cheapest current-gen entry inference card
Instinct MI50 Entry
32 GB 26.8 Cheap secondhand AMD VRAM for local inference
Radeon RX 7600 Entry
8 GB 43.5 Budget AMD card for light local inference
T1000 Na loja Entry
8 GB Ultra-low-power display/dev card, not AI-focused
Quadro P2200 Na loja Entry
5 GB Legacy budget workstation card, minimal AI use
T400 Na loja Entry
4 GB 2.2 Display-output card, not suitable for real AI workloads
Quadro P1000 Na loja Entry
4 GB Ultra-budget entry GPU, not recommended for AI workloads

Mostrando 78 de 78 cartões

Sistemas Multi-GPU

Servidores de IA — Cálculo Total do Sistema

Um servidor multi-GPU não é avaliado como uma única placa — o que importa é a capacidade computacional combinada de todas as GPU nele. Compute Total abaixo pega a cifra de FP16 TFLOPS por placa correspondente na tabela acima e a multiplica pelo número de GPU, para que os servidores permaneçam na mesma escala de referência. 48 sistemas atualmente em nosso catálogo de Hardware AI — toque em qualquer nome para obter especificações completas e preços.

Estrutura de servidor AI Multi-GPU
Servidor Configuração de GPU VRAM total Cálculo Total (FP16 TFLOPS) Preço
NVIDIA DGX B200 DGX / Desktop
8x Blackwell GPUs, 1,440GB 1,440 GB 18,000.0 $515,000
8x B200 SXM (HGX B200) 1,440 GB 18,000.0 Solicitar Orçamento
8x B200 SXM (HGX B200) 1,440 GB 18,000.0 Solicitar Orçamento
8x B200, 1,536GB HBM3e 1,536 GB 18,000.0 Solicitar Orçamento
NVIDIA DGX H100 DGX / Desktop
8x H100 SXM5, 640GB 640 GB 7,916.0 $6,700
NVIDIA DGX H200 DGX / Desktop
8x H200 SXM5, 1,128GB 1,128 GB 7,916.0 Solicitar Orçamento
ASRock Rack 6U8X-EGS2 Rack Server
8x H200 SXM 1,128 GB 7,916.0 $2,500
ASUS ESC N8-E11 Rack Server
8x H200 SXM (HGX) 1,128 GB 7,916.0 $2,600
Dell PowerEdge XE9680 Rack Server
8x H100 SXM 640 GB 7,916.0 $22,000
8x H100 SXM, 640GB 640 GB 7,916.0 $5,600
8x H100 SXM5 (barebone) 640 GB 7,916.0 $45,000
8x H200 SXM5 (barebone) 1,128 GB 7,916.0 Solicitar Orçamento
8x H100 SXM 640 GB 7,916.0 $300,000
8x H200 SXM, 141GB each 1,128 GB 7,916.0 Solicitar Orçamento
Quanta S7PH H100 Rack Server
8x H100 SXM 640 GB 7,916.0 $280,000
8x H200 SXM (barebone) 1,128 GB 7,916.0 $20,000
8x H100 SXM5, 640GB, liquid-cooled 640 GB 7,916.0 $3,400
8x H100 SXM5, 640GB 640 GB 7,916.0 $3,400
8x H200 SXM, 1,128GB, air-cooled 1,128 GB 7,916.0 Solicitar Orçamento
8x H200 SXM, 1,128GB, liquid-cooled 1,128 GB 7,916.0 Solicitar Orçamento
NVIDIA DGX H800 DGX / Desktop
8x H800 SXM5, 640GB 640 GB 6,052.0 Solicitar Orçamento
8x H800 SXM 640 GB 6,052.0 $5,499
4x H200 SXM, 564GB 564 GB 3,958.0 $180,000
4x H200 SXM, liquid-cooled 564 GB 3,958.0 $7,800
4x H100 PCIe 320 GB 3,026.0 $5,999
NVIDIA DGX A100 DGX / Desktop
8x A100 SXM4, 640GB 640 GB 2,496.0 Solicitar Orçamento
Exeton Quasar 640X Rack Server
8x A100 SXM, 640GB NVLink 640 GB 2,496.0 Solicitar Orçamento
8x A100 SXM 640 GB 2,496.0 Solicitar Orçamento
8x A100 HGX 640 GB 2,496.0 $13,000
8x A100 SXM4, 640GB 640 GB 2,496.0 $5,600
8x A100 SXM4 40GB, 320GB total 320 GB 2,496.0 Solicitar Orçamento
NVIDIA DGX Station A100 DGX / Desktop
4x A100, 160GB 160 GB 1,248.0 $85,000
Pre-built RTX 5090 AI workstation 32 GB 419.1 $6,000
ASUS Ascent GX10 DGX / Desktop
GB10 Grace Blackwell Superchip 128 GB Solicitar Orçamento
ASUS ESC8000A-E12P Rack Server
Dual EPYC 9004, up to 8x GPU Solicitar Orçamento
ASUS XA NB3I-E12 Rack Server
8x B300 NVL (HGX B300 NVL8) $7,999
2U 4-node high-density chassis $18,000
NVIDIA DGX Spark DGX / Desktop
GB10 Grace Blackwell Superchip 128 GB Solicitar Orçamento
Edge AI module, 64GB 64 GB Solicitar Orçamento
QuantaGrid D74H-7U Rack Server
8-GPU chassis (barebone) Solicitar Orçamento
8-GPU server (refurbished) Solicitar Orçamento
8x B300 NVL (HGX B300 NVL8) $450,000
NVIDIA GH200 Grace Hopper Superchip (used) Solicitar Orçamento
1U GPU-ready server $5,600
2U GPU-ready server Solicitar Orçamento
1U GPU-ready server $3,500
2U GPU-ready server $4,500
RTX PRO 6000 / L40S multi-GPU Solicitar Orçamento
Confronto direto

Coloque duas cartas quaisquer no anel

Já identificou um par de favoritos acima? Escolha duas GPUs e observe-as enfrentando-se em VRAM, índice de inferência, cálculo FP16 e rendimento de treinamento — com uma análise em linguagem acessível sobre qual delas vence e por quê.

Lutador A
RTX Pro 6000 Blackwell
Flagship
403Índice de Inferência
VS
Fighter B
RTX 3090
Mid
100Índice de Inferência
96 GB VRAM 24 GB
403 Índice de Inferência de IA 100
Calcule (TFLOPS FP16) 35.6
Rendimento de Treinamento 905 img/s
Acórdão :vencedor lidera :perdedor por :margem em : métrica. Ele também possui mais VRAM (96 GB contra 24 GB), portanto, é compatível com modelos maiores.
Dados indexados ao RTX 3090 = 100 · "—" significa que não há referência de desempenho publicada para essa placa específica
Metodologia

O que esses números significam

1

Coletar benchmarks publicados

Começamos com dados de referência públicos de benchmark de GPU em nuvem — números verificáveis que qualquer pessoa pode conferir, sem suposições internas.

Hardware GPU sendo avaliado na bancada de testes
2

Pontue três cargas de trabalho reais

Cada cartão é medido em inferência de LLM, geração de imagens e visão — o trabalho que o hardware de IA realmente realiza o dia todo.

Inferência de LLM

Velocidade de geração de tokens em modelos populares de peso aberto, desde assistentes leves de 8B até pesos pesados de mais de 70B.

Geração de Imagens

Vazão e latência do modelo de difusão, abrangendo tudo, desde pipelines turbo rápidos até renders de qualidade de produção.

Visão & OCR

Compreensão de imagens multimodais e capacidade de OCR de documentos sob carga concorrente realista.

Dentro de um servidor de IA com múltiplas GPU executando cargas de trabalho reais
3

Indexe tudo em relação à RTX 3090 = 100

Todas as pontuações estão em uma escala de 100 pontos, com a RTX 3090 como referência — assim, qualquer duas placas podem ser comparadas de relance.

Taxa de treinamento

Uma figura de Miner de GPU única publicada de forma independente (imagens/segundo), exibida onde existe um benchmark correspondente para esse cartão exato.

Fileiras de racks de GPU no centro de dados

Dados de referência apenas para orientação — os resultados do mundo real variam com a pilha de software, drivers, tamanho do lote e carga de trabalho. Não uma garantia de desempenho.

Linha direta para a equipe

Não encontrou seu hardware? Basta perguntar.

Se precisar de uma GPU específica, de um servidor completo ou simplesmente tiver uma dúvida sobre os números nesta página — envie sua mensagem e um engenheiro de verdade responderá, geralmente dentro de duas horas.

  • 78 GPUs e 48 servidores listados — além de centenas mais que podemos fornecer
  • Envio DDP gratuito em todo o mundo, aceitamos criptomoedas
  • Preços B2B e por volume mediante solicitação
  • Sem obrigação — uma pergunta, não um compromisso
Por favor, adicione seu nome e um número de WhatsApp ou e-mail para podermos responder.
Obrigado — sua solicitação foi recebida. Nossa equipe responde dentro de 2 horas.
Nunca compartilhamos seus dados. Respostas geralmente dentro de 2 horas, 24/7.
Escolha a carta certa

Qual GPU atende à sua carga de trabalho

Um guia básico para combinar o nível de GPU com o que você realmente planeja executar.

Líder de mercado

O mais alto padrão absoluto — criado para empresas que oferecem IA a milhares de usuários ao mesmo tempo.

Desempenho relativo
  • Modelos 70B+ , sem quantização
  • Serviço de produção multi-tenant
  • Ajuste fino em grande escala
Cartões típicosRTX Pro 6000 · H200 · B200
Alta performance

Potência de produção séria para equipes exigentes e cargas de trabalho diárias pesadas.

Desempenho relativo
  • Inferência de 30B–70B
  • Geração de imagens em tempo real
  • Treinamento em pequena escala
Cartões típicosRTX 5090 · H100 · A100
Gama média

O ponto ideal — desempenho forte a um preço que uma pequena equipe pode justificar.

Desempenho relativo
  • Inferência do modelo 8B–30B
  • Melhor relação custo-benefício
  • Carga de trabalho de desenvolvedor solo
Cartões típicosRTX 4090 · RTX 3090 · L40S
Entrada

Uma maneira acessível de entrar — aprender, criar protótipos e executar modelos menores localmente.

Desempenho relativo
  • Prototipagem e aprendizado
  • Ajuste fino de modelos pequenos
  • Ambientes de desenvolvimento leves
Cartões típicosRTX A4000 · RTX 4060 Ti · T4
Perguntas Frequentes

Perguntas Frequentes

O que significa o Índice de Inferência de IA?

É um único número relativo que mostra o desempenho de uma GPU em tarefas combinadas de inferência de LLM, geração de imagens e visão, escalado de modo que a RTX 3090 sempre corresponda a 100. Uma pontuação de 200 significa aproximadamente o dobro da vazão total de uma RTX 3090.

Qual GPU possui o maior Índice de Inferência de IA?

O RTX Pro 6000 Blackwell lidera atualmente o nosso ranking com um Índice de Inferência de IA de 403 — aproximadamente quatro vezes a taxa de transferência de inferência agregada do RTX 3090 padrão — aliado a 96 GB de VRAM para os maiores LLMs sem quantização.

Qual é a GPU de melhor custo-benefício para inferência de IA?

A RTX 5090 (AI Inference Index 207, 32 GB) e a RTX 4090 (índice 133, 24 GB) oferecem a melhor relação preço-desempenho para inferência com GPU única e geração de imagens. A variante RTX 4090 Pro adiciona 48 GB de VRAM para modelos maiores, mantendo o valor de classe consumer.

Qual é a melhor GPU para executar grandes modelos de linguagem?

Para os maiores LLMs atendidos sem quantização, cartões de data centre flagship como o RTX Pro 6000 Blackwell (96 GB), H200 (141 GB) e Instinct MI300X (192 GB) oferecem a margem de memória necessária para manter modelos completos residentes. Para modelos de 8B a 30B, uma única RTX 5090 ou RTX 4090 fornece uma excelente taxa de transmissão a uma fração do custo.

Posso comprar esse hardware na MillionMiner?

Sim — GPUs NVIDIA de última geração e servidores completos de IA estão disponíveis através do nosso catálogo de Hardware de IA, com envio DDP mundial e preços B2B sob solicitação.

Por que a RTX 3090 é a linha de base?

É uma das GPUs com capacidade de IA mais amplamente implantadas, tornando-se um ponto de referência prático e bem compreendido para comparar hardware mais recente e mais antigo.

O aumento de VRAM significa necessariamente melhor desempenho?

Não. O VRAM determina quais tamanhos de modelo e tamanhos de lotes cabem - não determina a velocidade por si só. Uma placa com menos VRAM ainda pode registrar um índice de inferência mais alto se sua arquitetura e largura de banda de memória forem mais fortes.

Qual GPU possui mais VRAM para modelos de IA de grande porte?

O AMD Instinct MI350X lidera com 288 GB, seguido pelo MI325X com 256 GB. Entre as placas NVIDIA, o B100 SXM oferece 192 GB e o H200 fornece 141 GB de memória de alta largura de banda. Mais VRAM permite carregar modelos maiores e lotes maiores sem dividi-los entre várias GPUs.

Qual é a diferença entre o Índice de Inferência de IA e FP16 TFLOPS?

FP16 TFLOPS é uma medida teórica de pico de computação publicada pelo fabricante — um limite bruto de hardware. O Índice de Inferência de IA é uma pontuação medida, baseada na carga de trabalho, construída a partir de benchmarks publicados em tarefas de LLM, imagem e visão. Uma placa pode exibir TFLOPS teóricos elevados, mas um índice real mais baixo quando a largura de banda de memória ou o suporte de software limitam seu desempenho.

Como os NVIDIA H100 e H200 se comparam?

Ambos são GPUs de data-center de arquitetura Hopper com classificação de 989,5 FP16 TFLOPS. A diferença está na memória: o H200 possui 141 GB de HBM3e mais rápida versus 80 GB no H100, portanto, suporta modelos maiores e janelas de contexto mais longas com maior taxa de transferência sustentada. Para a maioria das novas implantações de atendimento a LLM, o H200 é a opção mais forte.

Posso comparar duas GPUs específicas lado a lado?

Sim. Utilize a arena de comparação nesta página para escolher duas de nossas 78 GPUs listadas e veja seu Índice de Inferência de IA, VRAM, TFLOPS FP16 e capacidade de treinamento lado a lado, com o vencedor de cada métrica destacado.

Qual GPU eu preciso para treinar modelos de IA em vez de apenas executá-los?

O treinamento é muito mais exigente em memória e processamento do que a inferência, portanto, favorece os cartões principais com grande VRAM e alta capacidade de TFLOPS FP16, como a classe H100, H200, B200 ou Instinct MI300X. Nossa coluna de Desempenho de Treinamento mostra imagens por segundo por GPU única, onde existe um benchmark publicado — por exemplo, 1.396 img/s no A100 40GB versus 905 no RTX 3090.

Vocês também vendem servidores de IA multimodal com múltiplas GPU?

Sim. Juntamente com 78 GPUs individuais, listamos 48 servidores de IA multigPU completos, incluindo sistemas de classe HGX e DGX baseados nos aceleradores H100, H200 e Blackwell, prontos para treinamento em larga escala e inferência de produção. Entre em contato conosco para configurações e preços B2B.

Os benchmarks incluem GPUs AMD e Intel, ou apenas NVIDIA?

Os três estão cobertos. Junto com toda a linha NVIDIA, incluímos aceleradores AMD Instinct (MI350X, MI325X, MI300X, MI250X) e placas Radeon, além de Intel Gaudi 3 e Arc, para que você possa comparar entre os fornecedores em um índice consistente.

Quão precisivos são esses números de referência?

Cada dado é baseado em dados públicos de benchmarks e fabricantes, agregados em um índice consistente para orientação. Os resultados do mundo real variam com a pilha de software, drivers, tamanho do lote e carga de trabalho, portanto, considere os números como um guia comparativo e não uma garantia de desempenho.

Com que frequência esses dados são atualizados?

Revisamos e atualizamos os números à medida que novas gerações de GPU são lançadas e à medida que mais dados de benchmark se tornam disponíveis.

Ainda Comparando?

Pergunte-nos diretamente

Envie sua pergunta através do formulário de contato acima — ou envie uma mensagem pelo WhatsApp e receba uma resposta em minutos.