Servidor GPU y servidor IA: preconfigurados, probados, listos para producción

Un servidor gpu o una workstation ia montados a especificación, probados bajo carga y entregados listos para arrancar. La escalera sube de la workstation RTX 5090 de una GPU, pasando por sistemas Threadripper PRO de doble GPU con 128 líneas PCIe 5.0, hasta nodos de cuatro y ocho GPU; un montaje 8x RTX 5090 entrega unos 838 TFLOPS FP32 y la clase HGX lleva baseboards H100, H200 y B200.

Cada servidor IA y servidor GPU sale nuevo con garantía salvo que el listado indique usado o reacondicionado, con DDP mundial gratuito y estabilidad validada antes del envío. Opérelo usted o despliéguelo en nuestro hosting de EE. UU. con gestión remota. Toda la gama, de la estación de trabajo al nodo H100, está abajo.

5.0
estrella estrella estrella estrella estrella
4.97
estrella estrella estrella estrella estrella
4.5
estrella estrella estrella estrella estrella
malla de panal malla de panal
Filtrar y ordenar

Sistemas de grado fábrica

Configurado, probado y verificado en prueba de funcionamiento

Logística de Carga

Paleta asegurada y transporte aéreo a nivel mundial

Cripto Aceptada

Pague con BTC, ETH, USDT y más

Soporte experto

Arquitectos de infraestructura de IA disponibles

Sistemas de Servidores AI

Servidores AI Multi-GPU: Desde estaciones de trabajo con 2 GPU hasta nodos HGX con 8 GPU

Un servidor de IA no es simplemente un PC con una GPU añadida. Una infraestructura de IA seria requiere plataformas diseñadas específicamente: tejidos NVSwitch de alta capacidad para la comunicación GPU a GPU, memoria DDR5 de gran capacidad, CPUs de nivel empresarial con suficientes carriles PCIe para alimentar cada GPU, almacenamiento NVMe para una rápida entrada y salida de puntos de control, y sistemas de distribución de energía con clasificación para más de 10 kW por módulo de rack. Nosotros proporcionamos plataformas completas de servidores IA y centro de datos IA desde sistemas torre de 2 GPUs para laboratorios de investigación hasta nodos NVIDIA HGX H100/H200 con 8 GPUs y la nueva arquitectura de rack GB200 NVL72 listas para su despliegue inmediato.

Cantidad de GPU DGX H100

8 × H100 SXM5

640 GB total HBM2e mediante NVSwitch

Cantidad de GPU NVL72

72 GPUs

GB200 en un solo rack — 1 unidad lógica

DGX H100 Rendimiento AI

32 PFLOPS

FP8 disperso — combinado 8 × H100

Memoria HGX H200

1.1 TB HBM3e

8 × H200 SXM5 — 38,4 TB/s de ancho de banda agregado


Comparación de plataformas de servidores AI

Plataformas clave que suministramos

NVIDIA DGX H100

8 × H100 SXM5, 640 GB

Superordenador de IA completo en una caja. NVSwitch de malla completa a 900 GB/s por GPU. Dual Xeon o AMD Epyc, 2 TB DDR5. Plataforma de referencia para IA empresarial.

NVIDIA DGX H200

8 × H200 SXM5, 1.1 TB

Sucesor del DGX H100. 4,8 TB/s HBM3e por GPU. Preferido para inferencia de modelos grandes a escala donde la capacidad de memoria es crítica.

NVIDIA HGX H100/H200

OEM platform (8-GPU)

El complejo de tarjeta GPU + NVSwitch enviado a socios OEM (Supermicro, Dell, HPE, Lenovo). Permite una infraestructura de GPU idéntica en chasis de servidor personalizados.

NVIDIA GB200 NVL72

72 × GB200 GPUs

Sistema de escala de rack único. 36 CPU Grace + 72 módulos GPU Blackwell. 1,44 ExaFLOPS FP4. Tela NVLink 5 — todo el rack funciona como una sola GPU.

4-GPU Tower / Rack (RTX PRO 6000)

Up to 4 × 96 GB

Servidor de clase estación de trabajo para laboratorios de investigación y startups de IA. Xeon W9 o Threadripper Pro de doble zócalo, 4 × RTX PRO 6000 BW mediante pares de puente NVLink.

2-GPU Inference Server (A100 / H100 PCIe)

2 × 80 GB HBM2e

Nodos de inferencia rentables. Chasis estándar de 2U, con dos ranuras PCIe 5.0. Compatible con colocation en rack estándar sin necesidad de refrigeración líquida.

1U Edge Inference (L4 / A2)

4–8 × 24 GB PCIe

Inferencia de alta densidad y bajo consumo. GPUs L4 de ranura única a 72 W cada una. Hasta 8 GPUs en 1U con menos de 600 W en total, ideal para PoPs de borde co-location.

La arquitectura detrás de los servidores de IA

Por qué los servidores de IA son fundamentalmente diferentes de los servidores estándar

La distinción fundamental entre un servidor de propósito general y un servidor de IA es la estructura de GPU. En un servidor estándar, las GPU se comunican a través de PCIe, una arquitectura de bus valorada en aproximadamente 32–64 GB/s bidireccional por ranura. En un servidor de IA basado en NVSwitch, cada GPU del sistema se conecta a todas las demás GPU simultáneamente mediante el ASIC NVSwitch a 900 GB/s por GPU (H100) o 1,8 TB/s por GPU (H200 / Blackwell). Esto no es una mejora en cuello de botella; es un cambio cualitativo que permite el paralelismo de modelos a través de GPUs como si fueran un solo dispositivo más grande.

El subsistema de CPU y memoria debe coincidir con las demandas de ancho de banda de la GPU. El DGX H100 combina su red NVSwitch de 8 GPUs con CPUs duales Intel Xeon Platinum y 2 TB de memoria DDR5 ECC, una cantidad de memoria suficiente para preparar conjuntos de datos de entrenamiento, ejecutar pipelines de preprocesamiento y gestionar entradas/salidas de puntos de control sin convertirse en el cuello de botella. Los carriles PCIe 5.0 se distribuyen cuidadosamente para que cada GPU tenga una conexión directa x16 con la red de la CPU.

La entrega de energía es un reto de ingeniería por sí mismo. Un DGX H100 completamente equipado consume aproximadamente 10,2 kW — requiriendo circuitos de 2 × 30A, 240V en Norteamérica o 3 fases de 32A en Europa. La refrigeración es igualmente exigente: el diseño de referencia de NVIDIA utiliza un intercambiador de calor en la puerta trasera o refrigeración líquida directa para el módulo GPU en configuraciones DGX. Planificar la energía y la refrigeración de su instalación antes de realizar el pedido no es opcional — es el primer paso.


IA a escala de rack

NVIDIA GB200 NVL72: 72 GPUs como un Acelerador Lógico

El GB200 NVL72 es la arquitectura de sistema más ambiciosa de NVIDIA hasta la fecha. Un solo rack alberga 36 módulos de CPU Grace y 72 chips GPU Blackwell GB200, todos conectados a través de una red NVLink de quinta generación a 1,8 TB/s por GPU, lo que permite que todo el rack se comporte como un único acelerador lógico. La capacidad de cálculo disperso FP4 combinada de las 72 GPU supera los 1,44 ExaFLOPS y la memoria total HBM3e alcanza los 13,5 TB.

Cada módulo GB200 combina una CPU Grace Arm con dos núcleos GPU Blackwell a través de NVLink-C2C a 900 GB/s — eliminando completamente la interfaz PCIe entre la CPU y la GPU. La CPU actúa como un controlador de memoria de ancho de banda alto y un motor de orquestación, no como un cuello de botella. Este diseño hace que el NVL72 sea especialmente apto para la inferencia de modelos de trillones de parámetros con baja latencia: todo el modelo cabe en la memoria del rack, las operaciones de all-reduce ocurren dentro del tejido NVLink, y no se requiere una red entre nodos para el servicio de un solo modelo.

Desde el punto de vista de la instalación, el NVL72 consume hasta 120 kW y requiere refrigeración líquida directa; una alimentación eléctrica trifásica dedicada y una infraestructura de refrigeración líquida en el centro de datos son obligatorias. La economía es convincente a escala hyperscale: un rack NVL72 reemplaza lo que anteriormente requería filas completas de nodos DGX H100 para un rendimiento de inferencia equivalente.

Especificaciones del GB200 NVL72

Hoja de especificaciones del Rack completo

GPU se estropea 72 × Blackwell GB200
Módulos de CPU 36 × Grace Arm (72 cores each)
Memoria GPU 13.5 TB HBM3e total
Ancho de banda de memoria GPU 345.6 TB/s aggregate
Rendimiento de IA 1.44 ExaFLOPS FP4 sparse
Interconexión GPU NVLink 5.0 — 1.8 TB/s per GPU
Enlace CPU-GPU NVLink-C2C — 900 GB/s bidirectional
Memoria del sistema Up to 13.5 TB LPDDR5X
Consumo de energía Up to 120 kW per rack
Enfriamiento Direct Liquid Cooling (mandatory)
Redes 8 × 400 GbE / InfiniBand per rack

Guía del comprador

¿Qué servidor de IA es el adecuado para su caso de uso?

Desde experimentación a escala de laboratorio hasta una implementación completa a escala hyperscale — adapte su carga de trabajo al nivel de plataforma adecuado.

Investigación / Laboratorio

2–4 GPU Tower or 2U Rack

GPUs A100 80GB / RTX PRO 6000
Memoria GPU 160–384 GB GPU VRAM
Potencia 2–4 kW total draw

Ajuste fino de modelos, desarrollo de RAG, inferencia local, reproducibilidad en investigación. Se adapta debajo de un escritorio o en un bastidor estándar. Generalmente no se requieren mejoras en la instalación.

Startup / PYME

HGX H100 OEM 8-GPU

GPUs 8 × H100 SXM5 80GB
Memoria GPU 640 GB HBM2e
Potencia ~10 kW draw

Ajuste completo de modelos de 13–70B. Inferencia de producción para productos nativos de IA. Necesita energía trifásica o alimentación dual de 30A. La refrigeración por aire es viable con HX en la puerta trasera.

Empresa

DGX H200 / HGX H200

GPUs 8 × H200 SXM5 141GB
Memoria GPU 1.1 TB HBM3e
Potencia ~11 kW draw

Entrenamiento de parámetros completos de modelos de 70 a 400B. Inferencia de baja latencia para modelos muy grandes. Se recomienda refrigeración líquida. El estándar de la industria actual para cargas de trabajo de IA serias.

Hiperscale

GB200 NVL72

GPUs 72 × Blackwell GB200
Memoria GPU 13.5 TB HBM3e
Potencia Up to 120 kW

Preentrenamiento de modelos de trillones de parámetros e inferencia con lotes grandes. Enfriamiento líquido completo y alimentación eléctrica de 3 fases dedicada obligatorios. Arquitectura de estante como una sola GPU vía NVLink 5.


Preguntas frecuentes

Preguntas frecuentes

DGX (Data Centre GPU) es el sistema completo de marca propia de NVIDIA — la placa GPU, NVSwitch, CPU, memoria, almacenamiento, redes, BMC y chasis están ensamblados y validados por NVIDIA. HGX es la plataforma OEM: NVIDIA suministra la placa base GPU con NVSwitch y módulos GPU a socios como Supermicro, Dell EMC, HPE y Lenovo, quienes construyen su propio chasis de servidor completo alrededor de ella. Los sistemas HGX ofrecen mayor flexibilidad en la elección del chasis, opciones de red y configuraciones de almacenamiento; los sistemas DGX son validados como referencia y vienen con el software NVIDIA Base Command.

El DGX H100 consume hasta 10,2 kW. Requiere dos conexiones C19/C20 de circuitos separados de 30A, 240V en Norteamérica, o una alimentación trifásica de 32A en Europa. Un circuito residencial estándar de 20A, 120V no es adecuado en absoluto. Planifique con PDU dedicados o alimentaciones directas desde el panel, y verifique la capacidad de su UPS antes de realizar el pedido.

Servidores de IA de entrada y gama media (configuraciones de 2 a 8 GPU PCIe) pueden utilizar enfriamiento por aire de alto flujo, aunque el ruido de los ventiladores de alta velocidad y el calor de escape a 10 kW+ hacen que los intercambiadores de calor en la puerta trasera sean altamente recomendable. Los DGX H100 y HGX H100/H200 en formato SXM están diseñados para enfriamiento por aire a nivel de sistema, pero generan calor significativo a nivel de bastidor — el enfriamiento líquido se vuelve prácticamente necesario por encima de 20 a 30 kW por bastidor. El GB200 NVL72 a 120 kW por bastidor requiere enfriamiento líquido directo sin opción solo de aire.

A FP16, un modelo de 175B requiere aproximadamente 350 GB de VRAM, más que los 640 GB que puede contener un DGX H100 después de tener en cuenta el overhead del caché KV de inferencia. En la práctica, la cuantización INT8 casi la mitad de este requerimiento, aproximadamente 175 GB, ajustándose cómodamente. El DGX H200 (1,1 TB HBM3e) puede ejecutar modelos de 175B en FP16 con espacio adicional. Un GB200 NVL72 (13,5 TB) puede ejecutar múltiples instancias de modelos de 175B simultáneamente.

Para el entrenamiento en múltiples nodos, es esencial una red de fabricazione RDMA de alta velocidad. NVIDIA InfiniBand HDR (200 Gb/s) o NDR (400 Gb/s) son el estándar para la interoperabilidad en clústeres DGX/HGX. Alternativamente, RoCEv2 (RDMA sobre Ethernet convergente) con NICs ConnectX-7 de 400 GbE es una opción de menor coste para clústeres de inferencia. Las operaciones colectivas de todos a todos (AllReduce) durante el entrenamiento son extremadamente sensibles al ancho de banda y la latencia internodos — el conmutador de 25/100 GbE de consumo introduce interrupciones inaceptables en entrenamientos a gran escala.

Sí. Para pedidos grandes de servidores de IA, podemos organizar la configuración de fábrica, pruebas de quemado y logística hasta su centro de datos o instalación de colocación. Póngase en contacto con nuestro equipo de ventas para analizar su cronograma de implementación y los requisitos de su instalación. Trabajamos con proveedores de colocación en Europa, los EAU y América del Norte.

Nuestro equipo está disponible las 24 horas del día, los 7 días de la semana, a través de WhatsApp (+49 176 777 888 33), correo electrónico y teléfono. Las compras de servidores AI suelen implicar configuraciones personalizadas y precios por volumen — adaptaremos sus requisitos de carga de trabajo a la plataforma adecuada y le proporcionaremos una cotización detallada que incluye la logística.

¿Listo para implementar su infraestructura de IA?

Explore nuestra gama completa de plataformas de servidores AI arriba, desde nodos de 2-GPU de calidad de investigación hasta sistemas de nivel rack DGX H200 y GB200 NVL72. Nuestro equipo le ayudará a planificar la energía, refrigeración, redes y logística de principio a fin.