Million Miner Logo

购买AI硬件:NVIDIA GPU、GPU服务器和企业存储用于AI

在MillionMiner购买AI硬件:NVIDIA GPU用于AI、预装GPU服务器和企业存储,一站式供应。涵盖从消费者、专业到数据中心级别的产品,从RTX 5090和RTX 4090到A100、H100及RTX PRO 6000 Blackwell,提供单GPU工作站到8-GPU节点以及匹配的大容量存储。

所有设备均为全新,享有制造商保修,全球免费DDP送货,因此结账价格即为最终到岸成本。我们提供B2B采购和GPU托管服务,适用于单个设备或完整集群。请在下方选择GPU、服务器和存储设备。

92 产品
显示 92 项中的 12 项

按类型浏览

选择您的类别

3 可用类别
搜索中…

未找到產品:「」

GPU

GPU

在MillionMiner购买NVIDIA显卡,涵盖从消费者级Blackwell到数据中心级别,适用于AI和专业工作负载。可用的显卡包括RTX 5090 32GB和RTX 4090 24GB的 blower 版本,RTX PRO 6000 Blackwell 96GB,以及A100和H100 Tensor Core显卡。除非特别注明,否则均为全新产品,享受制造商保修。 每块GPU都提供全球免费DDP运输,因此结账价格即为最终到岸成本。对于多卡建设,可以查看我们的预装GPU服务器,或让显卡部署到我们的美国主机托管,提供电力和散热服务。请浏览以下完整的GPU产品系列。

43 模型 有现货
探索 →
Server

Server

在MillionMiner购买预装GPU服务器和AI工作站,按照规格组装,经过压力测试并发货,准备运行。可供选择的配置从单GPU RTX 5090工作站到双GPU Threadripper PRO系统,配备128 PCIe 5.0通道,再到四GPU和八GPU节点,八GPU RTX 5090节点提供约838 TFLOPS的FP32性能。 每台服务器均附带保修,免费全球DDP,确保结算价格为最终到岸价,出厂前经过稳定性验证。您可以自行使用,也可以将其部署到我们的美国主机数据中心,享受远程管理。请在下方选购GPU服务器和AI工作站。

47 模型 有现货
探索 →
Storage

Storage

在MillionMiner购买企业存储,用于AI训练数据、模型权重和区块链节点。现有硬盘包括Seagate 16TB Exos和Western Digital 18TB Ultrastar helium HDD,两者均为CMR记录,以及NVMe SSD,每个在转售前均经过测试和安全擦除,平均故障间隔时间约为250万小时,年工作负载为550TB。 每个硬盘全球免费DDP发货,因此结账价格即为最终到岸成本。单独购买,或与我们的AI硬件系列中的GPU和服务器配套,打造完整的系统。请在下方选购企业存储。

2 模型 有现货
探索 →
AI硬件

针对人工智能时代的GPU、服务器及存储解决方案

每个大型语言模型、扩散模型、科学模拟和高吞吐量推理管道都在一小部分专业硬件上运行。NVIDIA数据中心GPU、专为人工智能设计的服务器平台以及企业级存储构成了AI革命的物理基础。

我们提供完整的产品线:从 H100 和 H200 到 RTX PRO 6000 Blackwell 和 RTX 5090 的专业 AI GPU;从 2-GPU 工作站节点到 NVIDIA DGX H200 和 GB200 NVL72 机架级系统的完整 AI 服务器平台;以及从高容量 20–24 TB 近线 HDD 到高耐用性 PCIe 5.0 NVMe SSD 的企业存储设备。

完整的 NVIDIA 专业产品线 研究实验室迈向超大规模 接受加密货币

人工智能 GPU

H100、H200、RTX PRO 6000 Blackwell、A100、RTX 5090 及更多

AI 服务器

DGX H100/H200、HGX、GB200 NVL72 及定制节点

企业存储

16–32 TB 近线硬盘驱动器和高耐用性 NVMe SSDs

B2B及批量订单

批量定价、货运物流与企业开票

全栈

GPU、服务器与存储如何协同工作

每个AI工作负载都需要这三个层次。了解它们之间的相互作用,有助于您从一开始就购买合适的硬件。

计算层
AI GPU

3.9 PFLOPS

H100 — FP8稀疏张量性能

运行实际模型的前向/反向传递
在 HBM 中持有活动权重和 KV 缓存
通过NVSwitch实现多GPU扩展
瓶颈:内存容量与带宽
平台层
AI 服务器

900 GB/s

NVSwitch 每 GPU 的带宽 — DGX H100

通过 NVSwitch 托管并连接多个 GPU
CPU+ DDR5 向 GPU 内存提供数据
PCIe 5.0 通道将 GPU 连接到 NVMe 存储器
瓶颈:GPU之间及CPU到GPU的带宽
数据层
企业存储

14 GB/s

PCIe 5.0 NVMe 顺序读取

NVMe:热点数据集批次与模型检查点
HDD:以拍字节规模训练数据湖
分层:NVMe 热 → HDD 暖 → HDD 冷
瓶颈:持续的顺序吞吐量

存储将数据传输到 CPU/RAM 层,预取训练批次到 GPU 内存中,借助 PCIe 进行传输。GPU 使用其 Tensor 核执行前向和反向传播。梯度和检查点被写回到 NVMe 存储。多 GPU 通过 NVSwitch 进行通信,实现数据和模型的并行。整个循环不断进行——存储吞吐量、服务器带宽和 GPU 内存都是潜在的瓶颈。

架构概述

Ampere、Hopper与Blackwell:三代人工智能芯片

自从深度学习热潮加速以来,英伟达已经推出了三代AI GPU微架构。每一代都引入了硬件级别的功能,彻底改变了在规模化下AI工作负载的经济可行性。

Ampere(A100,2020)制定了现代数据中心GPU的操作手册:大量的HBM2e内存容量,NVLink用于多GPU扩展,以及具备TF32、FP16和INT8精度的第三代Tensor核心。A100 80 GB仍然是全球应用最广泛的AI加速器之一。

Hopper(H100,H200,2022–2023)引入了 Transformer 引擎 — 专用硬件,能够为每层动态选择 FP8 或 FP16 精度,实现 transformer 架构下达贝尔的 4 倍吞吐量。Blackwell(GB200,RTX PRO 6000,RTX 5090,2024–2025)通过双芯片 GPU 设计,FP4 Tensor 核心,NVLink 5.0 速度达 1.8 TB/s,以及在 RTX PRO 6000 上配备 96 GB ECC GDDR7 PCIe 工作站卡,进一步推进了性能。

代际比较

各架构的关键规格

Ampere A100 80GB 2020

312 TFLOPS FP16 · 80 GB HBM2e · 2 TB/s BW

Hopper H100 SXM5 2022

3.9 PFLOPS FP8 · 80 GB HBM2e · 3.35 TB/s BW

Hopper H200 SXM5 2023

3.9 PFLOPS FP8 · 141 GB HBM3e · 4.8 TB/s BW

Blackwell RTX PRO 6000 2024

5th-gen TC FP4 · 96 GB GDDR7 ECC · ~1.8 TB/s BW

Blackwell RTX 5090 2025

21,760 CUDA · 32 GB GDDR7 · 3,352 GB/s BW

Blackwell GB200 NVL72 2025

1.44 ExaFLOPS FP4 · 13.5 TB HBM3e · 345 TB/s total

常见问题

AI 硬件常见问题解答

我们提供三类专业AI硬件:AI GPU(NVIDIA H100、H200、A100、RTX PRO 6000 Blackwell、RTX 5090、T1000、L4 及其他)AI 服务器(DGX H100/H200、HGX OEM 节点、GB200 NVL72 以及定制的多GPU工作站和机架式平台),以及企业存储(Seagate EXOS 20–24 TB 近线 HDD,WD Gold/Ultrastar,Samsung PM9A3 NVMe SSD,Seagate Nytro 以及 Micron 7450 系列)。所有商品均提供免费全球 DDP 交付。

H100与H200共享相同的Hopper GPU芯片,计算性能相同(约3.9 PFLOPS FP8稀疏)。H200用HBM3e取代HBM2e,容量增加到141 GB(对比80 GB),带宽提升至4.8 TB/s(对比3.35 TB/s)——这对于大型模型的推理服务至关重要。H100和H200均提供SXM(NVSwitch,高带宽多GPU)和PCIe(标准服务器)两种形式。RTX PRO 6000 Blackwell是一款采用Blackwell架构的工作站/机架GPU:配备96 GB ECC GDDR7存储在双槽PCIe卡中,具有第5代Tensor Cores和FP4支持,但总FLOPS低于H100/H200。在优先考虑PCIe插槽内存容量时,它是最佳选择。

NVSwitch 是一种专用的 ASIC,形成所有 AI 服务器系统中的 GPU 之间的全网格互连。在 DGX H100 中,4 个 NVSwitch ASIC 连接 8 个 H100 GPU,使每个 GPU 能以 900 GB/s 的速度与所有其他 GPU 同时通信——远远超出 PCIe 的传输能力。没有 NVSwitch,多 GPU 训练需要通过 PCIe 进行 AllReduce 操作(约 64 GB/s),这会成为大型模型中张量和模型并行工作负载的严重瓶颈。NVSwitch 仅在 SXM 格式的服务器(DGX、HGX)中提供。

作为基准:针对定制数据集对7–13B模型进行微调,1–4 TB的NVMe SSD足以存放数据集、检查点和模型权重。对于预训练或微调70B+模型,建议准备10–100 TB的高速存储,具体取决于您的数据集规模。在PB级规模(完整预训练运行)中,使用Seagate EXOS或WD Ultrastar近线HDD组成的Ceph/Lustre分布式存储集群是标准配置。我们建议采用分层架构:企业级NVMe用于热I/O(检查点、活跃批次),高容量HDD用于数据湖。

这取决于精度。在FP16下,一个70B模型大约需要140 GB的VRAM——只有H200(141 GB)能在一块GPU上以全精度存放它。在INT8量化(大约70 GB)下,H200或H100 80 GB都能应付,并留有KV缓存空间。在INT4(GGUF Q4,大约35-40 GB)下,RTX PRO 6000 Blackwell(96 GB)能轻松运行,并有充足的KV缓存余地。在INT4极端量化(大约20-25 GB)下,即使是RTX 5090(32 GB)也能支持70B模型。

是的。我们提供全球免关税到付免费运输在所有订单上。DDP(Delivered Duty Paid,交货完税)意味着我们负责出口、国际货运、清关和进口关税支付 —— 您看到的价格即为您支付的价格。GPU和存储订单将在1–3个工作日内发货。大型服务器系统可能需要额外的准备时间用于配置和运输;联系我们针对特定时间表。

是的。MillionMiner 负责企业、研究机构和云基础设施的采购。针对多单元GPU订购、托盘数量的存储驱动器以及完整的服务器系统,提供批量价格。联系我们销售团队根据您的要求——型号、数量、交货地点和时间表——我们将提供一份包含货运物流的专属报价。

入门级2-GPU PCIe服务器的功耗为2–4千瓦,可以使用标准空气冷却。8-GPU DGX H100的功耗最高可达10.2千瓦,需要双路30A、240V回路(北美)或三相32A(欧洲)。GB200 NVL72每个机架的功耗最高可达120千瓦,需采用直接液冷和专用的三相电源供电——在下单前必须进行设施规划。对于单个GPU卡,RTX PRO 6000 Blackwell的功耗为300瓦,适用于任何配备足够电源的标准工作站。

我们的团队全天候通过WhatsApp(+49 176 777 888 33)、电子邮件和电话提供支持。我们协助进行GPU选择以满足特定工作负载、多GPU集群设计、服务器平台比较、存储架构规划以及B2B采购。联系我们或访问我们的常见问题解答快速答复。

准备好构建您的人工智能基础设施了吗?

浏览上述GPU、服务器和存储设备——或与我们的团队联系,获取基于您的工作负载、规模和预算的全面基础设施建议。