Million Miner Logo

购买NVIDIA AI显卡:H100、H200和RTX PRO 6000

购买NVIDIA H100、H200、RTX PRO 6000和L40S,用于AI训练、推理和本地部署大模型。所有显卡均为全新,含关税送到您手中。我们帮您选出适合您服务器的型号和规格。

预算有限或需要小型主机:可选RTX PRO 4000 Blackwell、RTX PRO 4500 Blackwell或RTX 4000 SFF Ada。不依赖CUDA的软件,也能在AMD Instinct MI210或Intel Data Center GPU Flex上运行。

43 产品
显示 43 项中的 12 项

已验证现货

每个GPU在出货前都经过测试和检验

快速发货

在1到3个工作日内发货

接受加密货币

使用BTC、ETH、USDT等支付

专家支持

AI 和 GPU 基础设施专家随时待命

人工智能与GPU计算

专业人工智能GPU用于训练、推理和高性能计算任务

人工智能革命由一小部分硅芯片驱动。NVIDIA的数据中心GPU系列,从H100和H200张量核心GPU,到RTX PRO 6000 Blackwell和RTX 5090,代表了运行大型语言模型、扩散模型、科学模拟和高频推理管道的计算基础。我们为企业客户、研究实验室、AI初创公司和云基础架构运营商库存全套专业 NVIDIA 产品——数据中心加速器、工作站GPU和专业视觉化卡。

H200 内存带宽

4.8 TB/s

HBM3e @ 141 GB 容量

H100 AI 性能

3.9 PFLOPS

FP8 稀疏张量操作

RTX PRO 6000 VRAM

96 GB

GDDR7 ECC — Blackwell 架构

RTX 5090显存

32 GB GDDR7

Blackwell GB202 — 3352 GB/s BW


NVIDIA专业GPU系列

从工作站到超大规模数据中心

H100 SXM / PCIe

80 GB HBM2e

企业AI训练的主力军。3.35 TFLOPS FP64,NVLink 900 GB/s。优选 SXM 变体,用于 DGX H100 系统中的多GPU NVSwitch 架构。

H200 SXM / PCIe

141 GB HBM3e

H100的继任者。相同的Hopper GPU芯片,但内存增加到1.76倍,带宽达4.8 TB/s——对于具有长上下文窗口的LLM推理至关重要。

A100 PCIe / SXM

40 GB / 80 GB HBM2e

上一代的工作马仍在大量使用中。312 TFLOPS FP16 Tensor Core。在原装和定制的 PCIe 配置中都广泛提供。

RTX PRO 6000 Blackwell

96 GB GDDR7 ECC

有史以来最强大的工作站GPU。支持完整的PCIe规格、NVLink桥接以及第4代Tensor Cores。理想用于本地LLM推理和渲染。

RTX 5090 (GB202)

32 GB GDDR7

NVIDIA在Blackwell架构上的旗舰消费级产品。21760个CUDA核心,3352 GB/s的内存带宽。混合工作负载和推理的最佳单GPU。

RTX 4090 (Ada)

24 GB GDDR6X

前一代Ada。16,384个CUDA核心,1008 GB/s带宽。仍然是性能强劲,并且在推理集群中具有更具吸引力的价格点。

T1000 (Professional)

8 GB GDDR6

适用于边缘推理和显示输出工作负载的低调专业GPU。功耗低,静音运行,机架密集部署。

A2 / L4 (PCIe)

16 / 24 GB GDDR6

针对推理优化的Ada和Ampere PCIe GPU。为功率受限的服务器插槽设计——TDP为72 W——具有强大的INT8吞吐能力,适合大规模部署。

NVIDIA 架构故事

Hopper、Ada Lovelace 和 Blackwell —— 三代推动 AI 时代

自人工智能热潮开始以来,NVIDIA 已经推出了三种主要的 GPU 微架构。Hopper 架构(H100、H200)引入了 Transformer Engine——一种硬件模块,能够在单层传递中动态切换FP8和FP16的精度,以最大化吞吐量而不会带来显著的精度损失。这一设计突破使得训练70B+参数模型变得具有商业可行性。

Ada Lovelace (RTX 4090, L4, L40S) 将第四代 Tensor 核心引入专业和准专业市场,并配备了显著提升的光线追踪硬件。Ada 顾卡在消费者可用性与专业能力之间占据了理想位置,成为精品推理部署和创意 AI 工作站的主导选择。

Blackwell(RTX 5090、RTX PRO 6000、GB200 NVL72)是当前一代产品。Blackwell为旗舰级数据中心部件引入了双芯片GPU设计,支持NVLink 5.0,芯片间带宽为1.8 TB/s,以及第五代Tensor核心,支持FP4。RTX PRO 6000 Blackwell为工作站级设备带来了96 GB ECC 内存——容量超过H100 PCIe,使以前只能在云端运行的工作负载能够本地处理。


并排

H100 对比 H200 对比 RTX PRO 6000 Blackwell

定义现代人工智能基础设施的三款GPU,适用于工作站和单节点服务器层级。

Hopper

H100 SXM5

最佳培训方案
内存 80 GB HBM2e
内存带宽 3.35 TB/s
FP8 稀疏 3.9 PFLOPS
TDP 700 W (SXM)
NVLink NVLink 4 — 900 GB/s
外形规格 SXM5 / PCIe

分布式训练的黄金标准。连接 NVSwitch 的 SXM 变体对于 8-GPU DGX 级节点是必需的。PCIe 变体适用于标准服务器。

Hopper

H200 SXM5

适合推理
内存 141 GB HBM3e
内存带宽 4.8 TB/s
FP8 稀疏 3.9 PFLOPS
TDP 700 W (SXM)
NVLink NVLink 4 — 900 GB/s
外形规格 SXM5 / PCIe

与H100相同的Hopper GPU,但内存容量几乎翻倍,带宽远远更大。非常适合大规模处理70B+参数模型,支持长上下文长度。

Blackwell

RTX PRO 6000 BW

最佳工作站
内存 96 GB GDDR7 ECC
内存带宽 ~1.8 TB/s
张量核心 5th-gen, FP4/FP8/FP16
TDP 300 W (PCIe)
NVLink NVLink Bridge (optional)
外形规格 Dual-slot PCIe x16

比H100在标准PCIe插槽中拥有更多的VRAM。适用于任何工作站或塔式服务器。本地运行70B模型。RTX PRO 6000服务器版取消了显示输出,适用于机架优化部署。


选择合适的GPU

训练与推理与工作站:您需要哪种 GPU?

用于训练模型的GPU未必是提供服务的最佳GPU。训练需要最大化的FLOPS和大量的内存,以同时存储参数、梯度和优化器状态——一个使用AdamW微调的70B模型在整个集群中需要超过500 GB的显存。对于如此规模的训练,连接在一起的H100或H200 SXM节点通过NVSwitch连接,是行业标准,提供所需的原始计算能力和NVLink带宽,以确保所有GPU都能充分供能。

推理工作负载对 FLOPS 的关注较少,更关注内存容量和带宽。一个量化的 70B 模型在 INT4 下大约需要 40 GB——意味着 H200 可以轻松承载,同时配备两块通过 NVLink Bridge 连接的 RTX PRO 6000 Blackwell 显卡也能实现相同的性能。对于高吞吐量的推理服务,H200 的 4.8 TB/s 带宽即使在并发请求批次下也能保持低延迟。

本地工作站应用场景——研究、创意AI、本地LLM聊天、图像生成、视频合成——由RTX PRO 6000 Blackwell(96 GB)、RTX 5090(32 GB)或A100(40/80 GB)根据模型大小需求提供良好的支持。RTX 4090仍然是运行量化模型(低于24 GB)用户的最具价格竞争力的选择。

快速选择指南

将您的工作负载匹配到合适的硬件

LLM 训练(70B+)
H100 / H200 SXM

多节点 NVSwitch 集群。对大规模预训练和完整微调来说是强制性的。

LLM 推理(70B)
H200 or 2× RTX PRO 6000

高带宽内存对长上下文服务至关重要。工作站对之间的NVLink桥接。

LLM推理(7–13B)
RTX 5090 / A100 80GB

32–80 GB 适用于量化服务。强大的 INT8 吞吐量。

本地人工智能工作站
RTX PRO 6000 BW (96 GB)

带有最多VRAM的PCIe卡。运行34B模型,无量化。提供ECC以确保可靠性。

图片 / 视频生成
RTX 5090 / RTX 4090

高CUDA核心数+高速GDDR7带宽,理想用于扩散推断。

边缘 / 低功耗推理
T1000 / L4 / A2

子75 W TDP。单槽或低矮型号。密集机架部署。

专业可视化
RTX PRO 6000 / A100

ECC内存、经过认证的驱动程序、用于3D/CAD/模拟的大型帧缓冲区。


Blackwell 体系结构亮点

黑沃尔为何实现跨世代的飞跃

双晶片GPU设计

GB200在单个包装中配备两个Blackwell GPU芯片,通过NVLink-C2C连接,带宽为1.8 TB/s — 完全消除了处理单元之间的PCIe瓶颈。

第五代Tensor Cores

新的 FP4 精度模式在推理工作负载中提供高达 2 倍的 FP8 处理能力。通过 NVIDIA 的微缩格式(MXFP4)保持准确性。

NVLink 5.0

与Hopper相比,扩展带宽翻倍——每个GPU双向1.8 TB/s。对将72个Blackwell GPU连接成一个逻辑单元的NVL72机架配置至关重要。

RAS 引擎

专用的可靠性、可用性和服务能力引擎,用于预测硬件故障——减少生产推理集群中的计划外停机时间。

机密计算

用于GPU工作负载的硬件隔离TEE(可信执行环境)。实现安全运行专有模型和敏感推断在共享云基础设施中。

RTX PRO 6000 — PCIe 旗舰

96 GB GDDR7 ECC,标准PCIe双槽形式。工作站级别的可靠性与数据中心级别的内存容量。服务器版不带显示输出。

NVIDIA Blackwell

RTX 5090 和 RTX PRO 6000:专业人士的 Blackwell

GeForce RTX 5090 推出 Blackwell 进入消费者和专业用户市场。基于 GB202 芯片,配备 21,760 个 CUDA 核心和 32 GB 的 GDDR7 显存,带宽达 1,792 GB/s,是最强大的单个 GPU,适用于标准台式机。对于需要本地推断和实验、无需云端费用的 AI 研究人员和开发人员,RTX 5090 是务实的选择。

RTX PRO 6000 Blackwell 采用了一种根本不同的方法:NVIDIA 并非最大化消费者游戏性能,而是设计了一个配备 96 GB ECC GDDR7 内存的工作站 GPU——这超过了任何前一代 PCIe GPU 的容量。服务器版和 Max-Q 工作站版分别适用于机架式部署和移动部署。两张 RTX PRO 6000 通过 NVLink Bridge 连接,可以提供 192 GB 共享内存——足以运行未量化的 70B 参数模型。

对于无法或不愿在云端运行所有工作负载的工作室、研究实验室和AI初创公司,Blackwell工作站系列彻底改变了局势。专有模型留在本地。推理延迟降低。数据主权得到保障。前期硬件成本通过云端推理账单的摊销得以抵消,否则这些账单会无限期累积。


常见问题解答

常见问题解答

两者都使用相同的 GH100 Hopper GPU 芯片,并提供相同的计算 FLOPS(约 3.9 PFLOPS FP8 稀疏)。H200 用 HBM3e 内存取代了 HBM2e:容量从 80 GB 增加到 141 GB,带宽从 3.35 TB/s 增长到 4.8 TB/s。因此,H200 更适合推理密集型工作负载,尤其是在需要将大型模型适配于单个 GPU 并且要求高吞吐量的场景中。

对于推理工作负载来说——它的96 GB ECC GDDR7容量超过了H100 PCIe的80 GB,且适用于任何标准的PCIe工作站插槽。对于训练,H100/H200 SXM形状与NVSwitch配合使用,在相同的TDP下提供显著更高的GPU间带宽和更强的原始FLOPS。当您需要在本地拥有较高的VRAM容量且无需NVSwitch基础设施时,RTX PRO 6000是更佳的选择。

SXM GPU(H100 SXM5,H200 SXM5)安装在专业的底板上,而不是PCIe插槽,并通过NVSwitch结构相互连接,每个GPU实现900 GB/s的互GPU带宽。PCIe变体适配标准服务器和工作站,但在多GPU通信方面仅限于NVLink Bridge(2个GPU)或PCIe带宽(x16,约64 GB/s)。对于需要全互联通信的8个及以上GPU的集群,必须采用SXM NVSwitch系统。

在FP16(16位)精度下,一个70B模型大约需要140 GB的VRAM——一台H200(141 GB)在边缘能够处理这个需求。在INT8量化下,大约需要70 GB。在INT4(GGUF Q4)下,大约需要35–40 GB,适合使用H100 80 GB或一对RTX 4090。RTX PRO 6000 Blackwell(96 GB)能够在单个GPU上处理INT8 70B模型,并有空间存放KV缓存。

RTX 5090 非常适合本地 AI 推理、图像生成(Stable Diffusion、Flux、DALL-E 3 复制品)、视频合成以及中小模型的微调。其 32 GB GDDR7 足以运行 13B 模型(FP16)和 70B 模型(INT4)。对于多GPU 训练集群,数据中心 GPU 依然更为优选,因为它们具有更高的 NVLink 带宽和更大的内存容量。

NVIDIA A100(Ampere架构,2020年)仍然是一款功能强大且广泛使用的AI GPU。它提供40 GB和80 GB HBM2e配置,提供312 TFLOPS FP16 Tensor Core性能。随着供应相较于H100变得宽松,A100的价格更为实惠。对于推理和中等规模的训练工作负载,它仍然表现优异。对于前沿研究或最大规模的模型,现在更倾向于使用H100/H200。

是的。MillionMiner 为企业、研究机构和云基础设施客户提供大量GPU订单。请与我们的销售团队联系,获取多单位H100、H200、A100和RTX PRO 6000采购的价格。我们可以安排货运物流、调试和多种货币(包括加密货币)的发票。

我们的团队通过 WhatsApp(+49 176 777 888 33)、电子邮件和电话提供24/7的咨询服务。我们协助GPU选择以满足训练与推理工作负载、多GPU集群设计以及B2B采购需求。联系我们或访问我们的常见问题解答,以获取即时答复。

准备好构建您的人工智能基础设施了吗?

浏览我们上方的专业NVIDIA GPU全系列产品,从单一工作站卡到多GPU服务器配置。无论您是在训练您的第一个模型还是扩展推理集群,我们的团队都将帮助您根据您的工作负载和预算选择合适的硬件。