NVIDIA
Modelo: H200 NVL
Seleccione disponibilidad
Cantidad
$46,899.00
¿Comprando 10 o más? Obtén precios personalizados por volumen
Genuino
Hardware probado
En todo el mundo
Envío mundial
Soporte
Expertos en minería
GPU NVIDIA H200 NVL 141GB Tensor Core. arquitectura Hopper con la primera memoria HBM3e del mundo: 141GB a 4.800 GB/s de ancho de banda, un aumento del 76 por ciento en VRAM y un incremento del 43 por ciento en el ancho de banda en comparación con el H100 SXM. La misma capacidad de cálculo Hopper que el H100: 16.896 núcleos CUDA, 528 Tensor Cores de cuarta generación con FP8 Transformer Engine, 67 TFLOPS FP32, 3.958 TFLOPS FP8. Factor de forma PCIe compatible con hasta 4 Miners mediante puentes NVLink. TDP configurable hasta 600W. Enfriamiento pasivo por aire para chasis estándar de servidores. MIG para 7 instancias de 16,5GB cada una. Actualización plug-and-play desde infraestructuras PCIe de A100 y H100.
Precios, tiempo de entrega y opciones de hosting. Asesoramiento personal de nuestro equipo de ventas.
Precios, tiempo de entrega y opciones de hosting. Asesoramiento personal de nuestro equipo de ventas.
El H200 no es una arquitectura nueva. Es el mismo die Hopper GH100 ejecutando los mismos núcleos CUDA, los mismos Tensor Cores y el mismo Transformer Engine que el H100. Lo que NVIDIA modificó es el subsistema de memoria: HBM3 fue reemplazado por HBM3e, la capacidad aumentó de 80GB a 141GB, y el ancho de banda subió de 3.350 GB/s a 4.800 GB/s. Todas las demás especificaciones permanecen iguales. Esta es una actualización de memoria dirigida a cargas de trabajo donde los 80GB del H100 se convierten en un límite. El impacto práctico se divide en tres categorías que corresponden a decisiones reales de despliegue. Inferencia en LLM con precisión total. Un modelo de 70B de parámetros en FP16 con sobrecarga de caché KV requiere aproximadamente entre 140GB y 160GB de memoria GPU, dependiente del tamaño del lote y la longitud de la secuencia. El H100 de 80GB no puede alojar esto sin cuantización a FP8 o INT8, lo que reduce la precisión del modelo. El NVL del H200 con 141GB permite alojar 70B en FP16 en una sola GPU, preservando la precisión completa. Para aplicaciones donde la pérdida de precisión por cuantización es inaceptable (IA médica, análisis de documentos legales, modelado financiero), esto marca la diferencia entre "posible" y "listo para producción". Escalado de inferencia con contexto largo. Los modelos Transformer asignan memoria de caché KV proporcional a la longitud de la ventana de contexto. Un modelo que sirva ventanas de 128K tokens en el H100 puede agotar los 80GB antes de que finalice la secuencia. Los 141GB del H200 extienden la ventana de contexto máxima que puede manejar una sola GPU en un 76 por ciento antes de que sea necesario descargar memoria. Para pipelines RAG, procesamiento de documentos y agentes conversacionales con largos historiales, esto se traduce directamente en contextos más largos sin complejidad en la infraestructura. Densidad multiinquilino mediante particiones MIG más grandes. Cada instancia MIG en el H200 obtiene 16,5GB frente a los 10GB del H100. Este incremento del 65 por ciento por instancia permite que cada partición sirva modelos de inferencia mayores. Mientras que las particiones MIG de 10GB del H100 manejan modelos de 3B a 7B, las de 16,5GB del H200 manejan modelos de 7B a 13B por partición. Siete instancias simultáneas de modelos de 7B en un solo GPU H200 constituyen una configuración práctica de inferencia multiinquilino. Detalles del factor de forma PCIe NVL. Hasta 4 GPUs conectadas mediante puentes NVLink en un solo servidor. Compatible con refrigeración por aire hasta con un TDP configurable de 600W (versus 700W en H200 SXM, que requiere refrigeración líquida). Interfaz PCIe Gen 5 x16. Disipador pasivo que requiere flujo de aire en el chasis del servidor. Compatible con las mismas plataformas de servidores que las tarjetas A100 PCIe o H100 PCIe, facilitando una mejora rápida e intercambiable. Lenovo, Supermicro, Dell y HPE documentan la compatibilidad del H200 NVL en líneas de servidores existentes. El ancho de banda importa para la velocidad de generación de tokens. La generación de tokens en inferencia LLM en decodificación autoregresiva está limitada por ancho de banda de memoria: cada token nuevo requiere leer todos los pesos del modelo desde HBM. A 4.800 GB/s frente a los 3.350 GB/s del H100, el H200 genera tokens aproximadamente un 43 por ciento más rápido en cargas de trabajo limitadas por ancho de banda. Los benchmarks de RunPod confirman que esto se traduce en ganancias en el rendimiento de inferencia en el mundo real de 1,5x a 1,9x en modelos de lenguaje grande. La decisión entre NVL y SXM para el H200 refleja la línea del H100. SXM: TDP de 700W, refrigeración líquida, placa base HGX, tejido NVSwitch que conecta 8 GPUs a 900 GB/s cada una, optimizado para entrenamiento distribuido. NVL: hasta 600W, refrigeración por aire, servidores PCIe estándar, hasta 4 GPUs NVLink, optimizado para inferencia y despliegues flexibles. SXM para clústeres de entrenamiento. NVL para servidores de inferencia y actualizaciones de infraestructura existentes. Mismos controles de exportación que el H100. Sujeto a restricciones de EE. UU. sobre hardware avanzado de IA.
La H200 NVL responde a una pregunta específica que la H100 dejó abierta: qué sucede cuando 80 GB no son suficiente VRAM pero no desea pasar a la tarifa Blackwell. 141 GB de HBM3e con un ancho de banda de 4.800 GB/s en la misma die de Hopper GH100 que impulsa la H100. Los mismos 16.896 núcleos CUDA. Los mismos 528 núcleos Tensor de cuarta generación. El mismo Engine Transformer FP8 a 3.958 TFLOPS. Mismo MIG, mismo cómputo confidencial, misma pila de software CUDA. El único cambio es la memoria: un 76 por ciento más de capacidad (141 GB frente a 80 GB) en un bus HBM3e más rápido que entrega un 43 por ciento más de ancho de banda (4.800 frente a 3.350 GB/s). Esa mejora de memoria tiene tres efectos prácticos. Primero, modelos de 70 mil millones de parámetros en FP16 caben en una sola GPU sin cuantización. La H100 con 80 GB requiere cuantización FP8 o INT8 para modelos de 70 mil millones, lo que sacrifica algo de precisión. La H200 NVL con 141 GB los ejecuta a plena precisión FP16. Segundo, la inferencia de contexto largo con grandes cachés KV escala aún más antes de alcanzar los límites de memoria. Las ventanas de contexto que agotan 80 GB en la H100 tienen un 76 por ciento más de espacio libre en la H200. Tercero, las instancias MIG aumentan de 10 GB a 16,5 GB cada una, haciendo que cada partición aislada sea útil para modelos de inferencia más grandes en implementaciones multinombre. La designación NVL significa formato PCIe con soporte de puente NVLink para hasta 4 GPU por servidor. Compatible con enfriamiento por aire con TDP de hasta 600W. Se adapta a plataformas de servidor estándar que actualmente usan tarjetas PCIe A100 o H100. No se requiere placa base HGX. Este es el camino de actualización para los operadores que desean mayor capacidad de memoria en la H200 sin reemplazar su infraestructura de servidor.
Nuestros especialistas en minería pueden ayudarte a encontrar el miner perfecto para tu configuración y presupuesto.
La primera GPU con memoria HBM3e. 141 GB con un ancho de banda de 4.800 GB/s: 76 por ciento más VRAM y 43 por ciento más rápida en memoria que la H100 SXM. Mismo cálculo Hopper (16.896 núcleos CUDA, 3.958 TFLOPS FP8 Transformer Engine). Factor de forma PCIe con escalabilidad de hasta 4 GPUs NVLink. Reemplazo directo para ranuras PCIe de H100 y A100. MIG para 7 instancias de 16,5 GB cada una. Enfriamiento pasivo por aire con TDP configurable de hasta 600 W. Diseñada para inferencia LLM donde el tamaño del modelo y la caché KV superan los 80 GB por GPU.
La primera GPU con memoria HBM3e. Ancho de banda de 4.800 GB/s. Ejecute modelos de 70B en precisión FP16 completa en una sola GPU sin cuantización.
Cores CUDA idénticos de 16.896 y 3.958 TFLOPS FP8 Transformer Engine como el H100. La misma pila de software. Solo cambió la memoria.
Se adapta a la infraestructura de servidores existente. Hasta 4 GPUs mediante puentes NVLink. Compatible con refrigeración por aire. No se requiere placa base HGX.
NVIDIA
$6,500.00
NVIDIA
$4,099.00
NVIDIA
$16,500.00
NVIDIA
$14,499.00
Mismo Hopper GH100 diagrama y misma capacidad de cómputo (16,896 núcleos CUDA, 3.958 TFLOPS FP8). La H200 actualiza la memoria de 80 GB HBM3 a 3.350 GB/s a 141 GB HBM3e a 4.800 GB/s. Esto es un 76 por ciento más de VRAM y un 43 por ciento más de ancho de banda. Todo lo demás (Núcleos Tensor, Transformer Engine, MIG, pila CUDA) es idéntico.
Tres efectos prácticos. Los modelos de 70B se ajustan completamente en FP16 sin cuantización (H100 requiere FP8/INT8 para 70B). La inferencia de contexto largo escala un 76 por ciento más antes de alcanzar los límites de memoria. Las instancias MIG aumentan de 10 GB a 16,5 GB cada una, soportando modelos más grandes por partición en implementaciones multiinquilino.
La próxima generación de memoria de alto ancho de banda después de HBM3. Mayor ancho de banda y capacidad por pila. El H200 es la primera GPU en utilizar HBM3e, ofreciendo 4.800 GB/s frente a 3.350 GB/s en HBM3 (H100). La mejora en el ancho de banda acelera directamente la generación de tokens LLM, que escala linealmente con el ancho de banda de la memoria en la decodificación autoregresiva.
Sí. Factor de forma PCIe Gen 5 x16 con refrigeración pasiva. Compatible con las mismas plataformas de servidores que ejecutan tarjetas H100 PCIe o A100 PCIe. Lenovo, Supermicro, Dell y HPE documentan la compatibilidad en las líneas de servidores existentes. Esta es la vía de actualización directa de memoria H100 a H200 sin necesidad de reemplazar el servidor.
Hasta 4 GPUs conectados mediante puentes NVLink en un solo servidor. En comparación con el H200 SXM, que escala hasta 8 GPUs por nodo mediante NVSwitch en placas base HGX. La ruta NVL ofrece una infraestructura más sencilla a costa de tener menos GPUs por nodo.
NVL: factor de forma PCIe, hasta 600W TDP, compatible con refrigeración por aire, hasta 4 GPUs mediante puentes NVLink, compatible con servidores estándar. SXM: factor de forma mezzanine, hasta 700W TDP, requiere refrigeración líquida y placa base HGX, hasta 8 GPUs mediante NVSwitch a 900 GB/s cada uno, aproximadamente un 18 por ciento más de rendimiento. NVL para inferencia y flexibilidad en infraestructura. SXM para el máximo rendimiento en entrenamiento.
H200 NVL: 141GB HBM3e a 4.800 GB/s, Transformer Engine FP8, MIG 7 instancias a 16.5GB, arquitectura Hopper. RTX PRO 6000: 96GB GDDR7 a 1.792 GB/s, sin Transformer Engine, arquitectura Blackwell, 125 TFLOPS FP32. El H200 NVL gana en capacidad de memoria (47 por ciento más), ancho de banda HBM (2,7x) y optimización de inferencia Transformer Engine. El RTX PRO 6000 gana en potencia de cálculo FP32 y costo de adquisición.
Hasta 7 instancias aisladas por hardware de 16,5 GB cada una (frente a 10 GB en el H100). La memoria por instancia más grande admite modelos de 7B a 13B por partición MIG. Siete instancias de inference simultáneas de 7B en una sola GPU es una configuración práctica de múltiples inquilinos.
Las pruebas de RunPod muestran una mejora de 1,5 a 1,9 veces en el rendimiento de inferencia en modelos de lenguaje grande, impulsada principalmente por el aumento del 43 por ciento en el ancho de banda (4.800 versus 3.350 GB/s). La generación de tokens en la decodificación autoregresiva escala casi de manera lineal con el ancho de banda de memoria.
Mismos controles de exportación de EE. UU. que el H100. No disponible en China, Hong Kong y Macao. NVIDIA creó variantes con ancho de banda limitado para mercados restringidos. Confirme la elegibilidad de exportación con MillionMiner para su destino de entrega.