购买GPU服务器和AI工作站:现成、经过测试、即插即用

在MillionMiner购买预装GPU服务器和AI工作站,按照规格组装,经过压力测试并发货,准备运行。可供选择的配置从单GPU RTX 5090工作站到双GPU Threadripper PRO系统,配备128 PCIe 5.0通道,再到四GPU和八GPU节点,八GPU RTX 5090节点提供约838 TFLOPS的FP32性能。

每台服务器均附带保修,免费全球DDP,确保结算价格为最终到岸价,出厂前经过稳定性验证。您可以自行使用,也可以将其部署到我们的美国主机数据中心,享受远程管理。请在下方选购GPU服务器和AI工作站。

5.0
星 星 星 星 星
4.97
星 星 星 星 星
4.5
星 星 星 星 星
蜂窝格子 蜂窝格子
筛选与排序

工厂级系统

已配置、测试和烧录验证

货运物流

全球范围内保险托盘和空运

支持加密货币支付

使用BTC、ETH、USDT及更多方式付款

专家支持

AI 基础设施架构师随时待命

AI 服务器系统

多GPU AI 服务器:从2-GPU 工作站到8-GPU HGX 节点

人工智能服务器不仅仅是添加了GPU的台式电脑。严肃的AI基础设施需要定制的平台:用于GPU之间通信的高带宽NVSwitch结构、高容量的DDR5内存、具有足够PCIe通道的企业级CPU以供每个GPU使用、用于快速检查点I/O的NVMe存储以及额定功率为每个机架单元10千瓦以上的电力供应系统。我们提供完整的AI服务器平台——从用于研究实验室的2-GPU塔式系统到NVIDIA HGX H100/H200 8-GPU节点以及新的GB200 NVL72机架级架构——即刻部署。

DGX H100 GPU 数量

8 × H100 SXM5

640 GB 总 HBM2e 通过 NVSwitch

NVL72 GPU 数量

72 GPUs

GB200 在单个机架中——1个逻辑单元

DGX H100 AI 性能

32 PFLOPS

FP8稀疏 — 结合8×H100

HGX H200 内存

1.1 TB HBM3e

8 × H200 SXM5 — 38,4 TB/s 总带宽


AI服务器平台比较

我们提供的关键平台

NVIDIA DGX H100

8 × H100 SXM5, 640 GB

完整的AI超级计算机一体机。NVSwitch全网格,每个GPU传输速率达900 GB/s。双Xeon或AMD Epyc,配备2 TB DDR5。面向企业AI的参考平台。

NVIDIA DGX H200

8 × H200 SXM5, 1.1 TB

DGX H100的继任者。每个GPU配备4.8 TB/s HBM3e。适用于大规模模型推理,对内存容量要求极高的场景。

NVIDIA HGX H100/H200

OEM platform (8-GPU)

GPU板 + NVSwitch 复合体已发货给 OEM 合作伙伴(Supermicro、Dell、HPE、联想)。实现定制服务器机箱中相同的 GPU 架构。

NVIDIA GB200 NVL72

72 × GB200 GPUs

单架级系统。36个Grace CPU + 72个Blackwell GPU模块。1,44 ExaFLOPS FP4。NVLink 5接口——整个机架作为一个GPU运行。

4-GPU Tower / Rack (RTX PRO 6000)

Up to 4 × 96 GB

适用于研究实验室和 AI 初创企业的工作站级服务器。双插槽 Xeon W9 或 Threadripper Pro,配备4个 RTX PRO 6000 BW 通过 NVLink Bridge 配对。

2-GPU Inference Server (A100 / H100 PCIe)

2 × 80 GB HBM2e

高效推理节点。标准2U机箱,双PCIe 5.0插槽。适配标准机架共置,无需液冷。

1U Edge Inference (L4 / A2)

4–8 × 24 GB PCIe

高密度、低功耗推理。单槽L4 GPU每个72 W。在1U内最多可集成8个GPU,总功耗低于600 W——非常适合共存边缘PoPs。

人工智能服务器背后的架构

为什么人工智能服务器与标准服务器本质上不同

一般用途服务器与AI服务器的根本区别在于GPU架构。在标准服务器中,GPU通过PCIe进行通信——每个插槽的双向带宽大约为32–64 GB/s。而在基于NVSwitch的AI服务器中,系统中的每个GPU都通过NVSwitch ASIC同时连接到其他所有GPU,H100的传输速率为900 GB/s,H200 / Blackwell的传输速率为1.8 TB/s。这不仅仅是性能的提升,而是一种质的变化,使模型并行能够像在一个更大的设备上一样在多GPU之间实现。

CPU 和内存子系统必须满足 GPU 带宽需求。DGX H100 将其 8-GPU NVSwitch 结构与双 Intel Xeon Platinum CPU 和 2 TB DDR5 ECC 内存结合使用——充足的系统内存可以用于存放训练数据集、运行预处理流程以及管理检查点 I/O,而不会成为瓶颈。PCIe 5.0 通道被谨慎分配,确保每个 GPU 都有直接的 x16 连接到 CPU 结构。

供电是一个工程上的挑战。完全加载的 DGX H100 大约需要 10.2 kW——在北美需要 2 × 30A、240V 电路,欧洲则为三相 32A。散热同样具有挑战性:NVIDIA 的参考设计在 DGX 配置中采用后门换热器或直流液冷为 GPU 模块散热。在订购之前规划您的设施的电力和冷却系统不是可选的,而是第一步。


机架规模人工智能

NVIDIA GB200 NVL72:72 GPU 作为一个逻辑加速器

GB200 NVL72 是 NVIDIA迄今为止最雄心勃勃的系统架构。一个机架内装有36个 Grace CPU模块和72个 Blackwell GB200 GPU芯片,全部通过第五代 NVLink 互连,传输速率为每个GPU 1.8 TB/秒——使整个机架能够作为一个单一的逻辑加速器运行。所有72个GPU的FP4稀疏计算总和超过1.44 ExaFLOPS,总 HBM3e 内存达到13.5 TB。

每个 GB200 模块配备一个 Grace Arm CPU 和两个 Blackwell GPU 芯片,通过 NVLink-C2C 以 900 GB/s 的速度连接 —— 完全消除了 CPU 和 GPU 之间的 PCIe 接口。CPU 充当高速宽带存储控制器和调度引擎,而不是瓶颈。这一设计使 NVL72 在低延迟下执行万亿参数模型推理方面具有独特优势:整个模型都能容纳在机架的内存中,所有的 all-reduce 操作在 NVLink 架构内部完成,不需要节点间网络即可进行单模型服务。

从设施角度来看,NVL72 的最大功率为120 kW,并且需要直接的液冷系统——必须配备专用的三相供电和设施液冷基础设施。在超大规模环境下,经济性具有吸引力:一个 NVL72 机架可以取代之前需要整排 DGX H100 节点以实现等效推理吞吐量。

GB200 NVL72 规格参数

完整机架规格表

GPU 故障 72 × Blackwell GB200
CPU 模块 36 × Grace Arm (72 cores each)
GPU内存 13.5 TB HBM3e total
GPU 内存带宽 345.6 TB/s aggregate
AI 性能 1.44 ExaFLOPS FP4 sparse
GPU 互联 NVLink 5.0 — 1.8 TB/s per GPU
CPU-GPU 链接 NVLink-C2C — 900 GB/s bidirectional
系统内存 Up to 13.5 TB LPDDR5X
功率消耗 Up to 120 kW per rack
冷却 Direct Liquid Cooling (mandatory)
网络 8 × 400 GbE / InfiniBand per rack

买家指南

您的用例适合哪款AI服务器?

从实验室规模的试验到全面的大规模部署——将您的工作负载匹配到合适的平台层级。

研究 / 实验室

2–4 GPU Tower or 2U Rack

GPUs A100 80GB / RTX PRO 6000
GPU 内存 160–384 GB GPU VRAM
电力 2–4 kW total draw

模型微调、RAG 开发、本地推理、研究可重复性。适合放在书桌下或标准机架中。通常无需设施升级。

初创公司 / 中小企业

HGX H100 OEM 8-GPU

GPUs 8 × H100 SXM5 80GB
GPU 内存 640 GB HBM2e
电力 ~10 kW draw

全面微调13–70B模型。用于AI原生产品的生产推理。需要三相电源或双30A供电。后门冷热交换器可实现空气冷却。

企业

DGX H200 / HGX H200

GPUs 8 × H200 SXM5 141GB
GPU 内存 1.1 TB HBM3e
电力 ~11 kW draw

70–400B模型的全参数训练。适用于超大模型的低延迟推理。推荐液冷系统。目前行业标准,适用于严肃的人工智能工作负载。

超大规模

GB200 NVL72

GPUs 72 × Blackwell GB200
GPU 内存 13.5 TB HBM3e
电力 Up to 120 kW

万亿参数模型预训练和大批次推理。全液冷和专用三相电源为强制要求。通过NVLink 5实现机架作为单一GPU架构。


常见问题解答

常见问题解答

DGX(数据中心GPU)是NVIDIA自行品牌的完整系统——GPU主板、NVSwitch、CPU、内存、存储、网络、BMC和机箱均由NVIDIA组装并验证。HGX是OEM平台:NVIDIA向合作伙伴如Supermicro、Dell EMC、HPE和联想提供带有NVSwitch和GPU模块的GPU底板,合作伙伴在此基础上构建自己的完整服务器机箱。HGX系统在机箱选择、网络选项和存储配置方面提供更大的灵活性;而DGX系统经过参考验证,并配备NVIDIA Base Command软件。

DGX H100 的功耗最高可达 10.2 千瓦。在北美地区,它需要来自两个不同的 30A、240V 电路的 C19/C20 连接,或在欧洲需要一个 3 相 32A 的供电。在家用的标准 20A、120V 电路上完全不可行。请规划专用的 PDU 或直接接入配电盘,并在下单前确认您的不间断电源(UPS)容量。

入门级和中端AI服务器(2–8 GPU PCIe配置)可以使用高气流空气冷却,但高速风扇噪音和10 kW以上的排热使得后门换热器变得强烈建议使用。SXH H100和HGX H100/H200在SXM形式因子中设计用于系统级空气冷却,但在机架级别会产生显著的热量——每个机架超过20–30 kW时,液冷变得几乎必要。GB200 NVL72每个机架功率为120 kW,需采用直接液冷,不接受仅空气冷却方案。

在 FP16 格式下,一个175B模型大约需要350 GB的显存——这超过了考虑到推理KV缓存开销后,DGX H100的640 GB容量。实际上,INT8量化将这一需求减半至约175 GB,十分合适。DGX H200(1.1 TB HBM3e)可以以FP16运行175B模型,并留有余量。GB200 NVL72(13.5 TB)可以同时运行多个175B模型实例。

在多个节点进行训练时,高速RDMA架构至关重要。NVIDIA InfiniBand HDR(200 Gb/s)或NDR(400 Gb/s)是DGX/HGX集群网络的标准。另一种选择是使用具有400 GbE ConnectX-7 NIC的RoCEv2(Converged Ethernet上的RDMA),这是一种成本较低的推理集群解决方案。在训练过程中,全所有集体操作(AllReduce)对节点间带宽和延迟极为敏感——普通的25/100 GbE交换会在大规模训练中引入无法接受的阻塞。

是的。对于大量AI服务器订单,我们可以安排工厂配置、烧录测试以及物流,将其送达您的数据中心或合作托管设施。请联系我们的销售团队,讨论您的部署时间表和设施需求。我们与欧洲、阿联酋和北美的合作托管提供商合作。

我们的团队通过WhatsApp(+49 176 777 888 33)、电子邮件和电话24小时为您提供服务。人工智能服务器的采购通常涉及定制配置和批量定价——我们将根据您的工作负载需求匹配合适的平台,并提供 Including 物流的详细报价。

准备部署您的人工智能基础设施吗?

浏览我们上方的全部AI服务器平台,从研究级2-GPU节点到DGX H200和GB200 NVL72机架级系统。我们的团队将为您提供全面的电力、冷却、网络和物流规划。