在MillionMiner购买预装GPU服务器和AI工作站,按照规格组装,经过压力测试并发货,准备运行。可供选择的配置从单GPU RTX 5090工作站到双GPU Threadripper PRO系统,配备128 PCIe 5.0通道,再到四GPU和八GPU节点,八GPU RTX 5090节点提供约838 TFLOPS的FP32性能。
每台服务器均附带保修,免费全球DDP,确保结算价格为最终到岸价,出厂前经过稳定性验证。您可以自行使用,也可以将其部署到我们的美国主机数据中心,享受远程管理。请在下方选购GPU服务器和AI工作站。
工厂级系统
已配置、测试和烧录验证
货运物流
全球范围内保险托盘和空运
支持加密货币支付
使用BTC、ETH、USDT及更多方式付款
专家支持
AI 基础设施架构师随时待命
人工智能服务器不仅仅是添加了GPU的台式电脑。严肃的AI基础设施需要定制的平台:用于GPU之间通信的高带宽NVSwitch结构、高容量的DDR5内存、具有足够PCIe通道的企业级CPU以供每个GPU使用、用于快速检查点I/O的NVMe存储以及额定功率为每个机架单元10千瓦以上的电力供应系统。我们提供完整的AI服务器平台——从用于研究实验室的2-GPU塔式系统到NVIDIA HGX H100/H200 8-GPU节点以及新的GB200 NVL72机架级架构——即刻部署。
DGX H100 GPU 数量
8 × H100 SXM5
640 GB 总 HBM2e 通过 NVSwitch
NVL72 GPU 数量
72 GPUs
GB200 在单个机架中——1个逻辑单元
DGX H100 AI 性能
32 PFLOPS
FP8稀疏 — 结合8×H100
HGX H200 内存
1.1 TB HBM3e
8 × H200 SXM5 — 38,4 TB/s 总带宽
8 × H100 SXM5, 640 GB
完整的AI超级计算机一体机。NVSwitch全网格,每个GPU传输速率达900 GB/s。双Xeon或AMD Epyc,配备2 TB DDR5。面向企业AI的参考平台。
8 × H200 SXM5, 1.1 TB
DGX H100的继任者。每个GPU配备4.8 TB/s HBM3e。适用于大规模模型推理,对内存容量要求极高的场景。
OEM platform (8-GPU)
GPU板 + NVSwitch 复合体已发货给 OEM 合作伙伴(Supermicro、Dell、HPE、联想)。实现定制服务器机箱中相同的 GPU 架构。
72 × GB200 GPUs
单架级系统。36个Grace CPU + 72个Blackwell GPU模块。1,44 ExaFLOPS FP4。NVLink 5接口——整个机架作为一个GPU运行。
Up to 4 × 96 GB
适用于研究实验室和 AI 初创企业的工作站级服务器。双插槽 Xeon W9 或 Threadripper Pro,配备4个 RTX PRO 6000 BW 通过 NVLink Bridge 配对。
2 × 80 GB HBM2e
高效推理节点。标准2U机箱,双PCIe 5.0插槽。适配标准机架共置,无需液冷。
4–8 × 24 GB PCIe
高密度、低功耗推理。单槽L4 GPU每个72 W。在1U内最多可集成8个GPU,总功耗低于600 W——非常适合共存边缘PoPs。
一般用途服务器与AI服务器的根本区别在于GPU架构。在标准服务器中,GPU通过PCIe进行通信——每个插槽的双向带宽大约为32–64 GB/s。而在基于NVSwitch的AI服务器中,系统中的每个GPU都通过NVSwitch ASIC同时连接到其他所有GPU,H100的传输速率为900 GB/s,H200 / Blackwell的传输速率为1.8 TB/s。这不仅仅是性能的提升,而是一种质的变化,使模型并行能够像在一个更大的设备上一样在多GPU之间实现。
CPU 和内存子系统必须满足 GPU 带宽需求。DGX H100 将其 8-GPU NVSwitch 结构与双 Intel Xeon Platinum CPU 和 2 TB DDR5 ECC 内存结合使用——充足的系统内存可以用于存放训练数据集、运行预处理流程以及管理检查点 I/O,而不会成为瓶颈。PCIe 5.0 通道被谨慎分配,确保每个 GPU 都有直接的 x16 连接到 CPU 结构。
供电是一个工程上的挑战。完全加载的 DGX H100 大约需要 10.2 kW——在北美需要 2 × 30A、240V 电路,欧洲则为三相 32A。散热同样具有挑战性:NVIDIA 的参考设计在 DGX 配置中采用后门换热器或直流液冷为 GPU 模块散热。在订购之前规划您的设施的电力和冷却系统不是可选的,而是第一步。
GB200 NVL72 是 NVIDIA迄今为止最雄心勃勃的系统架构。一个机架内装有36个 Grace CPU模块和72个 Blackwell GB200 GPU芯片,全部通过第五代 NVLink 互连,传输速率为每个GPU 1.8 TB/秒——使整个机架能够作为一个单一的逻辑加速器运行。所有72个GPU的FP4稀疏计算总和超过1.44 ExaFLOPS,总 HBM3e 内存达到13.5 TB。
每个 GB200 模块配备一个 Grace Arm CPU 和两个 Blackwell GPU 芯片,通过 NVLink-C2C 以 900 GB/s 的速度连接 —— 完全消除了 CPU 和 GPU 之间的 PCIe 接口。CPU 充当高速宽带存储控制器和调度引擎,而不是瓶颈。这一设计使 NVL72 在低延迟下执行万亿参数模型推理方面具有独特优势:整个模型都能容纳在机架的内存中,所有的 all-reduce 操作在 NVLink 架构内部完成,不需要节点间网络即可进行单模型服务。
从设施角度来看,NVL72 的最大功率为120 kW,并且需要直接的液冷系统——必须配备专用的三相供电和设施液冷基础设施。在超大规模环境下,经济性具有吸引力:一个 NVL72 机架可以取代之前需要整排 DGX H100 节点以实现等效推理吞吐量。
从实验室规模的试验到全面的大规模部署——将您的工作负载匹配到合适的平台层级。
模型微调、RAG 开发、本地推理、研究可重复性。适合放在书桌下或标准机架中。通常无需设施升级。
全面微调13–70B模型。用于AI原生产品的生产推理。需要三相电源或双30A供电。后门冷热交换器可实现空气冷却。
70–400B模型的全参数训练。适用于超大模型的低延迟推理。推荐液冷系统。目前行业标准,适用于严肃的人工智能工作负载。
万亿参数模型预训练和大批次推理。全液冷和专用三相电源为强制要求。通过NVLink 5实现机架作为单一GPU架构。