Una tabla clara para la velocidad de inferencia de IA, VRAM y rendimiento en entrenamiento en las GPU actuales, desde tarjetas de estación de trabajo hasta hardware Blackwell de centros de datos. Números de referencia para ayudarle a elegir la GPU adecuada para su carga de trabajo.
Índice más alto de inferencia de IA en el campo. Cada número a continuación está escalado en relación con la RTX 3090 en 100.
Filtre por VRAM, ordene cualquier columna y toque el + en dos filas para enviarlas directamente a la arena de enfrentamiento a continuación.
| Seleccione | GPU ↕ | VRAM ↕ | Índice de IA ▼ | FP16 TFLOPS ↕ | Entrenamiento ↕ | Mejor para |
|---|---|---|---|---|---|---|
| 96 GB |
403
|
— | — | Largest LLMs without quantization, multi-tenant serving | ||
|
RTX Pro 5000 Blackwell
Flagship
|
48 GB |
285
|
— | — | High-throughput production inference | |
| 48 GB |
238
|
— | — | Best price-to-performance for serious inference | ||
| 32 GB |
207
|
419.1 | — | Fastest single-GPU inference & image generation | ||
| 40 GB |
152
|
312.0 | 1,396 img/s | Proven data-center training workhorse | ||
| 32 GB |
146
|
— | — | Balanced training + inference workstation | ||
|
RTX 4080 Super Pro
Mid
|
32 GB |
139
|
— | — | Mid-range inference & light fine-tuning | |
| 24 GB |
133
|
165.2 | 1,301 img/s | Best all-round price-to-performance card | ||
| 24 GB |
100
|
35.6 | 905 img/s | Budget-friendly entry into serious AI work | ||
|
V100 32GB
Entry
|
32 GB |
84
|
125.0 | — | Legacy data-center training | |
| 24 GB |
83
|
— | — | Compact workstation inference | ||
|
V100 16GB
Entry
|
16 GB |
62
|
125.0 | 833 img/s | Light training / dev environments | |
|
RTX 4070 Ti Super
Mid
|
16 GB |
56
|
— | — | Hobbyist projects & prototyping | |
|
RTX A4000
Entry
|
16 GB |
51
|
19.2 | — | Entry-level dev work, small models | |
| 96 GB | — | — | — | Power-efficient Max-Q variant for dense workstation builds | ||
| 96 GB | — | — | — | Boxed workstation edition, same silicon as Server Edition | ||
|
B200 SXM
Flagship
|
180 GB | — | 2,250.0 | — | Largest-scale multi-GPU training clusters | |
| 192 GB | — | 1,750.0 | — | Massive-context LLM training & serving | ||
|
Instinct MI350X
Flagship
|
288 GB | — | 2,306.9 | — | Massive VRAM pool for huge models, AMD ROCm stacks | |
|
Instinct MI325X
Flagship
|
256 GB | — | 1,307.4 | — | Large-model inference with huge memory headroom | |
| 141 GB | — | 989.5 | — | High-bandwidth-memory LLM serving at scale | ||
| 141 GB | — | 989.5 | — | PCIe/NVLink-bridge alternative to SXM for air-cooled racks | ||
|
Gaudi 3
Flagship
|
128 GB | — | 1,835.0 | — | Intel-based large-scale training alternative | |
|
Instinct MI300X
Flagship
|
192 GB | — | 1,307.4 | — | Single-GPU serving of very large open-weight models | |
| 80 GB | — | 989.5 | — | Industry-standard large-model training & inference | ||
|
RTX 6000 Ada
Flagship
|
48 GB | — | — | — | Top-tier workstation for training & rendering | |
| 32 GB | — | 419.1 | — | Blower-style RTX 5090 for dense multi-GPU builds | ||
| 24 GB | — | — | — | China-compliant RTX 5090 variant, cost-efficient rigs | ||
| 94 GB | — | 835.5 | — | Dual-GPU NVLink inference for very large models | ||
|
H100 PCIe
High-end
|
80 GB | — | 756.5 | — | PCIe-server LLM training & inference | |
| 80 GB | — | 756.5 | — | China-compliant H100 equivalent, reduced NVLink bandwidth | ||
| 80 GB | — | 312.0 | — | Export-compliant A100 alternative for restricted regions | ||
| 80 GB | — | 312.0 | — | Proven large-batch training workhorse | ||
| 40 GB | — | 312.0 | — | China-compliant A100 equivalent for large-scale training | ||
| 48 GB | — | 733.0 | — | Mixed training + inference + rendering server card | ||
| 32 GB | — | — | — | High-end workstation training & inference | ||
|
Instinct MI250X
High-end
|
128 GB | — | 383.0 | — | Large-memory AMD training clusters | |
|
RTX 4070 Ti
Mid
|
12 GB | — | 40.1 | — | Strong price-to-performance for local inference | |
|
L4
Mid
|
24 GB | — | 242.0 | — | Low-power inference & video AI at scale | |
| 48 GB | — | 181.1 | — | Graphics + AI mixed workloads on one card | ||
| 64 GB | — | 181.0 | — | PCIe AMD training/inference card | ||
|
Instinct MI100
Mid
|
32 GB | — | 184.6 | — | Earlier-gen AMD CDNA training/inference card | |
| 48 GB | — | 119.5 | — | Efficient server inference with large VRAM | ||
|
Radeon RX 7900 XTX
Mid
|
24 GB | — | 122.8 | — | AMD consumer flagship for local inference | |
|
RTX 4080 Super
Mid
|
16 GB | — | 104.4 | — | Strong mid-range inference & gaming/AI hybrid use | |
|
Radeon RX 7900 XT
Mid
|
20 GB | — | 103.2 | — | AMD mid-high consumer inference card | |
|
RTX 4080
Mid
|
16 GB | — | 97.5 | — | Solid mid-range inference workstation card | |
| 48 GB | — | 32.6 | — | Large-VRAM legacy workstation for bigger models | ||
|
A40
Mid
|
48 GB | — | 149.7 | — | Large-VRAM data-center inference card | |
| 24 GB | — | 165.0 | — | Efficient shared-server inference | ||
| 24 GB | — | 125.0 | — | Cost-efficient cloud inference card | ||
| 24 GB | — | 39.6 | — | Workstation training with large VRAM headroom | ||
|
RTX A6000
Mid
|
48 GB | — | 38.7 | — | Large-VRAM workstation for bigger models | |
|
RTX 3090 Ti
Mid
|
24 GB | — | 40.0 | — | High-VRAM consumer card for local models | |
|
RTX 3080 Ti
Mid
|
12 GB | — | 34.1 | — | Strong mid-range gaming/AI hybrid card | |
|
Arc A770
Mid
|
16 GB | — | 39.4 | — | Budget Intel card for OpenVINO/local inference | |
|
T4
Entry
|
16 GB | — | 65.0 | — | Very low-power cloud inference card | |
|
RTX A5000
Entry
|
24 GB | — | 27.8 | — | Reliable mid-VRAM workstation card | |
| 20 GB | — | 23.6 | — | Small-batch workstation training | ||
| 20 GB | — | 26.7 | — | Compact single-slot workstation inference | ||
| 20 GB | — | 38.4 | — | Small-form-factor workstation inference | ||
|
RTX 3080
Entry
|
10 GB | — | 29.8 | — | Affordable gaming/AI hybrid card | |
| 16 GB | — | 24.0 | — | Low-power small-form-factor inference | ||
| 16 GB | — | 22.3 | — | Legacy Turing workstation card, small models | ||
| 16 GB | — | 138.0 | — | Media/video-AI inference card | ||
|
RTX 3070
Entry
|
8 GB | — | 20.3 | — | Cheapest realistic entry point for small models | |
|
RTX 4060 Ti 16GB
Entry
|
16 GB | — | 22.1 | — | Budget 16GB card for local LLM experiments | |
| 12 GB | — | 8.0 | — | Ultra-low-power dev / edge inference | ||
|
RTX 4070
Entry
|
12 GB | — | 29.1 | — | Affordable current-gen dev/inference card | |
|
Radeon RX 7800 XT
Entry
|
16 GB | — | 74.4 | — | AMD mid-tier card with generous VRAM | |
| 16 GB | — | 18.7 | — | Legacy Pascal data-center training card | ||
|
RTX 4060
Entry
|
8 GB | — | 15.1 | — | Cheapest current-gen entry inference card | |
|
Instinct MI50
Entry
|
32 GB | — | 26.8 | — | Cheap secondhand AMD VRAM for local inference | |
|
Radeon RX 7600
Entry
|
8 GB | — | 43.5 | — | Budget AMD card for light local inference | |
| 8 GB | — | — | — | Ultra-low-power display/dev card, not AI-focused | ||
| 5 GB | — | — | — | Legacy budget workstation card, minimal AI use | ||
| 4 GB | — | 2.2 | — | Display-output card, not suitable for real AI workloads | ||
| 4 GB | — | — | — | Ultra-budget entry GPU, not recommended for AI workloads |
Mostrando 78 de 78 cartas
Un servidor multi-GPU no se juzga como una única tarjeta; lo que importa es su capacidad de cómputo combinada en todas las GPU que contiene. El Total de Cómputo a continuación toma la cifra de FP16 TFLOPS por tarjeta que coincide en la tabla anterior y la multiplica por la cantidad de GPU, para que los servidores se mantengan en la misma escala de referencia. 48 sistemas actualmente en nuestro catálogo de Hardware de IA — toque cualquier nombre para ver las especificaciones completas y los precios.
| Servidor | Configuración de GPU | VRAM total | Cálculo total (FP16 TFLOPS) | Precio |
|---|---|---|---|---|
|
NVIDIA DGX B200
DGX / Desktop
|
8x Blackwell GPUs, 1,440GB | 1,440 GB | 18,000.0 | $515,000 |
|
Gigabyte G893-SD1-AAX5
Rack Server
|
8x B200 SXM (HGX B200) | 1,440 GB | 18,000.0 | Solicitar Cotización |
|
Gigabyte G893-ZD1-AAX5
Rack Server
|
8x B200 SXM (HGX B200) | 1,440 GB | 18,000.0 | Solicitar Cotización |
|
HGX B200 8-GPU Baseboard
Baseboard
|
8x B200, 1,536GB HBM3e | 1,536 GB | 18,000.0 | Solicitar Cotización |
|
NVIDIA DGX H100
DGX / Desktop
|
8x H100 SXM5, 640GB | 640 GB | 7,916.0 | $6,700 |
|
NVIDIA DGX H200
DGX / Desktop
|
8x H200 SXM5, 1,128GB | 1,128 GB | 7,916.0 | Solicitar Cotización |
|
ASRock Rack 6U8X-EGS2
Rack Server
|
8x H200 SXM | 1,128 GB | 7,916.0 | $2,500 |
|
ASUS ESC N8-E11
Rack Server
|
8x H200 SXM (HGX) | 1,128 GB | 7,916.0 | $2,600 |
|
Dell PowerEdge XE9680
Rack Server
|
8x H100 SXM | 640 GB | 7,916.0 | $22,000 |
|
Gigabyte G593-SD2-AAX1
Rack Server
|
8x H100 SXM, 640GB | 640 GB | 7,916.0 | $5,600 |
|
Gigabyte G593-ZD2 (H100 Barebone)
Rack Server
|
8x H100 SXM5 (barebone) | 640 GB | 7,916.0 | $45,000 |
|
Gigabyte G593-ZD2 (H200 Barebone)
Rack Server
|
8x H200 SXM5 (barebone) | 1,128 GB | 7,916.0 | Solicitar Cotización |
|
Lenovo ThinkSystem SR675 V3
Rack Server
|
8x H100 SXM | 640 GB | 7,916.0 | $300,000 |
|
Lenovo HGX H200 8-GPU Server
Rack Server
|
8x H200 SXM, 141GB each | 1,128 GB | 7,916.0 | Solicitar Cotización |
|
Quanta S7PH H100
Rack Server
|
8x H100 SXM | 640 GB | 7,916.0 | $280,000 |
|
Quanta S7PH H200 (Barebone)
Rack Server
|
8x H200 SXM (barebone) | 1,128 GB | 7,916.0 | $20,000 |
|
HGX H100 Baseboard (Liquid)
Baseboard
|
8x H100 SXM5, 640GB, liquid-cooled | 640 GB | 7,916.0 | $3,400 |
|
HGX H100 8-GPU Baseboard
Baseboard
|
8x H100 SXM5, 640GB | 640 GB | 7,916.0 | $3,400 |
|
HGX H200 8-GPU Baseboard (Air)
Baseboard
|
8x H200 SXM, 1,128GB, air-cooled | 1,128 GB | 7,916.0 | Solicitar Cotización |
|
HGX H200 8-GPU Baseboard (Liquid)
Baseboard
|
8x H200 SXM, 1,128GB, liquid-cooled | 1,128 GB | 7,916.0 | Solicitar Cotización |
|
NVIDIA DGX H800
DGX / Desktop
|
8x H800 SXM5, 640GB | 640 GB | 6,052.0 | Solicitar Cotización |
|
Supermicro HGX H800 SYS-821GE
Rack Server
|
8x H800 SXM | 640 GB | 6,052.0 | $5,499 |
|
HGX H200 4-GPU Baseboard
Baseboard
|
4x H200 SXM, 564GB | 564 GB | 3,958.0 | $180,000 |
|
Lenovo HGX H200 4-GPU Board
Baseboard
|
4x H200 SXM, liquid-cooled | 564 GB | 3,958.0 | $7,800 |
|
Supermicro SYS-741GE-TNRT
Compact
|
4x H100 PCIe | 320 GB | 3,026.0 | $5,999 |
|
NVIDIA DGX A100
DGX / Desktop
|
8x A100 SXM4, 640GB | 640 GB | 2,496.0 | Solicitar Cotización |
|
Exeton Quasar 640X
Rack Server
|
8x A100 SXM, 640GB NVLink | 640 GB | 2,496.0 | Solicitar Cotización |
|
Gigabyte G492-ZD0 (Used)
Rack Server
|
8x A100 SXM | 640 GB | 2,496.0 | Solicitar Cotización |
|
Supermicro AS-4124GO-NART+
Rack Server
|
8x A100 HGX | 640 GB | 2,496.0 | $13,000 |
|
HGX A100 8-GPU Baseboard (640GB)
Baseboard
|
8x A100 SXM4, 640GB | 640 GB | 2,496.0 | $5,600 |
|
HGX A100 8-GPU Baseboard (320GB)
Baseboard
|
8x A100 SXM4 40GB, 320GB total | 320 GB | 2,496.0 | Solicitar Cotización |
|
NVIDIA DGX Station A100
DGX / Desktop
|
4x A100, 160GB | 160 GB | 1,248.0 | $85,000 |
|
RTX 5090 Full System
Compact
|
Pre-built RTX 5090 AI workstation | 32 GB | 419.1 | $6,000 |
|
ASUS Ascent GX10
DGX / Desktop
|
GB10 Grace Blackwell Superchip | 128 GB | — | Solicitar Cotización |
|
ASUS ESC8000A-E12P
Rack Server
|
Dual EPYC 9004, up to 8x GPU | — | — | Solicitar Cotización |
|
ASUS XA NB3I-E12
Rack Server
|
8x B300 NVL (HGX B300 NVL8) | — | — | $7,999 |
|
Gigabyte H263-S67 (2U 4-Node)
Compact
|
2U 4-node high-density chassis | — | — | $18,000 |
|
NVIDIA DGX Spark
DGX / Desktop
|
GB10 Grace Blackwell Superchip | 128 GB | — | Solicitar Cotización |
| Edge AI module, 64GB | 64 GB | — | Solicitar Cotización | |
|
QuantaGrid D74H-7U
Rack Server
|
8-GPU chassis (barebone) | — | — | Solicitar Cotización |
|
Supermicro AS-8125GS-TNHR (Refurb)
Rack Server
|
8-GPU server (refurbished) | — | — | Solicitar Cotización |
|
Supermicro AS-8126GS-NB3RT
Rack Server
|
8x B300 NVL (HGX B300 NVL8) | — | — | $450,000 |
|
Supermicro GH200 SuperServer
DGX / Desktop
|
NVIDIA GH200 Grace Hopper Superchip (used) | — | — | Solicitar Cotización |
|
Supermicro SYS-111C-NR-G1
Compact
|
1U GPU-ready server | — | — | $5,600 |
|
Supermicro SYS-212H-TN-G1
Compact
|
2U GPU-ready server | — | — | Solicitar Cotización |
|
Supermicro SYS-511E-WR-G1
Compact
|
1U GPU-ready server | — | — | $3,500 |
|
Supermicro SYS-521C-NR-G1
Compact
|
2U GPU-ready server | — | — | $4,500 |
|
Supermicro SYS-522GA-NRT
Compact
|
RTX PRO 6000 / L40S multi-GPU | — | — | Solicitar Cotización |
¿Ya ha identificado un par de favoritos arriba? Elija cualquier dos GPU y compárelas en VRAM, índice de inferencia, cálculo FP16 y rendimiento en entrenamiento — con un veredicto en lenguaje sencillo sobre cuál gana y por qué.
Partimos de datos de referencia públicos publicados de GPU en la nube: cifras verificables que cualquiera puede comprobar, sin suposiciones internas.

Cada tarjeta se mide en la inferencia de LLM, generación de imágenes y visión, que es el trabajo que realmente realiza el hardware de IA durante todo el día.
Velocidad de generación de tokens en modelos populares de peso abierto, desde asistentes ligeros de 8B hasta pesos pesados de más de 70B.
Rendimiento y latencia del modelo de difusión, cubriendo todo, desde tuberías turbo rápidas hasta renderizados de calidad de producción.
Comprensión de imágenes multimodales y rendimiento de OCR de documentos bajo carga concurrente realista.

Todas las puntuaciones se presentan en una escala de 100 puntos, teniendo la RTX 3090 como referencia, por lo que cualquier dos tarjetas se comparan de un vistazo.
Una figura independiente publicada de un solo GPU (imágenes/seg), mostrada cuando existe una referencia de referencia para esa tarjeta exacta.

Datos de referencia solo para orientación; los resultados en el mundo real varían según la pila de software, los controladores, el tamaño del lote y la carga de trabajo. No es una garantía de rendimiento.
¿Es nuevo en estos términos? Lea la guía en lenguaje sencillo para elegir una GPU de IA
Ya sea que necesite una GPU específica, una construcción de servidor completa, o simplemente tenga una pregunta sobre los números en esta página, envíela y un ingeniero de verdad le responderá, normalmente en un plazo de dos horas.
Una guía básica para emparejar el nivel de GPU con lo que realmente planea ejecutar.
La máxima categoría — creada para empresas que brindan AI a miles de usuarios simultáneamente.
Potencia de producción seria para equipos exigentes y cargas de trabajo diarias intensas.
El punto ideal — un rendimiento sólido a un precio que un equipo reducido puede justificar.
Una forma económica de entrar: aprender, crear prototipos y ejecutar modelos más pequeños localmente.
Es un número relativo único que muestra el rendimiento de una GPU en tareas combinadas de inferencia de LLM, generación de imágenes y cargas de trabajo de visión, escalado de modo que la RTX 3090 siempre equivaque a 100. Una puntuación de 200 significa aproximadamente el doble del rendimiento agregado de una RTX 3090.
La RTX Pro 6000 Blackwell ocupa actualmente el primer puesto en nuestro ranking con un Índice de Inferencia de IA de 403, aproximadamente cuatro veces la capacidad de procesamiento de inferencias total de la RTX 3090 baseline, combinada con 96 GB de VRAM para los modelos de lenguaje grande sin cuantización.
La RTX 5090 (Índice de inferencia de IA 207, 32 GB) y la RTX 4090 (índice 133, 24 GB) ofrecen la mejor relación calidad-precio para inferencia con una sola GPU y generación de imágenes. La variante RTX 4090 Pro añade 48 GB de VRAM para modelos más grandes, manteniendo el valor de gama de consumo.
Para los modelos de lenguaje grande (LLMs) más grandes servidos sin cuantificación, las tarjetas insignia de centros de datos como la RTX Pro 6000 Blackwell (96 GB), H200 (141 GB) e Instinct MI300X (192 GB) le ofrecen el margen de memoria para mantener modelos completos residiendo en la tarjeta. Para modelos de 8B a 30B, una sola RTX 5090 o RTX 4090 ofrece un excelente rendimiento a una fracción del costo.
Sí — las GPU de NVIDIA de generación actual y los servidores de IA completos están disponibles a través de nuestro catálogo de Hardware de IA, con envío DDP a nivel mundial y precios B2B bajo solicitud.
Es una de las GPU con capacidad de IA más ampliamente implementadas, lo que la convierte en un punto de referencia práctico y bien entendido para comparar hardware más nuevo y más antiguo.
No. La VRAM determina qué tamaños de modelos y tamaños de lote caben en absoluto; no determina la velocidad por sí sola. Una tarjeta con menos VRAM aún puede registrar un índice de inferencia más alto si su arquitectura y ancho de banda de memoria son más potentes.
La AMD Instinct MI350X encabeza con 288 GB, seguida por la MI325X con 256 GB. Entre las tarjetas de NVIDIA, la B100 SXM ofrece 192 GB y la H200 proporciona 141 GB de memoria de alta velocidad. Más VRAM le permite cargar modelos más grandes y lotes mayores sin dividir entre varias GPU.
FP16 TFLOPS es una cifra de rendimiento teórico máximo publicada por el fabricante — un límite bruto del hardware. El Índice de Inferencia de IA es una puntuación basada en cargas de trabajo medida, construida a partir de benchmarks publicados en tareas de LLM, imágenes y visión. Una tarjeta puede mostrar altos TFLOPS teóricos, pero tener un índice real más bajo cuando la velocidad de memoria o el soporte de software lo limitan.
Ambos son GPUs de arquitectura Hopper de centro de datos con una potencia FP16 TFLOPS de 989,5. La diferencia está en la memoria: el H200 cuenta con 141 GB de HBM3e más rápida frente a los 80 GB del H100, por lo que admite modelos más grandes y ventanas de contexto más largas con un mayor rendimiento sostenido. Para la mayoría de las implementaciones de LLM de nueva generación, el H200 es la opción más sólida.
Sí. Utilice el comparador Arena en esta página para seleccionar dos de nuestras 78 GPU listadas y vea su Índice de Inferencia de IA, VRAM, TFLOPS FP16 y rendimiento en entrenamiento lado a lado, con el ganador de cada métrica resaltado.
El entrenamiento requiere mucho más memoria y capacidad de cálculo que la inferencia, por lo que favorece las tarjetas insignia con gran VRAM y altas TFLOPS en FP16, como la H100, H200, B200 o la clase Instinct MI300X. Nuestra columna de Rendimiento de Entrenamiento muestra imágenes por segundo en una sola GPU cuando existe un benchmark publicado — por ejemplo, 1.396 img/s en el A100 de 40GB frente a 905 en la RTX 3090.
Sí. Junto con 78 GPUs individuales, listamos 48 servidores de IA multi-GPU completos, incluidos sistemas de clase HGX y DGX construidos en torno a aceleradores H100, H200 y Blackwell, listos para entrenamiento a gran escala y inferencia en producción. Contáctenos para configuración y precios B2B.
Los tres están cubiertos. Junto con la línea completa de NVIDIA, incluimos aceleradores AMD Instinct (MI350X, MI325X, MI300X, MI250X) y tarjetas Radeon, además de Intel Gaudi 3 y Arc, para que pueda comparar entre proveedores en un índice único y coherente.
Cada cifra se basa en datos de referencia publicados públicamente y datos del fabricante, agrupados en un índice coherente para orientación. Los resultados en el mundo real varían según la pila de software, controladores, tamaño del lote y carga de trabajo, por lo que considere los números como una guía comparativa y no como una garantía de rendimiento.
Revisamos y actualizamos las cifras a medida que se lanzan nuevas generaciones de GPU y a medida que se dispone de más datos de referencia.
Envíe su pregunta a través del formulario de contacto anterior, o envíenos un mensaje por WhatsApp y obtenga una respuesta en minutos.