贵公司中的某个人已决定是时候在自己的硬件上运行AI了。也许您需要一个了解内部文档的私有聊天机器人,为产品团队提供的图像处理管道,或是一个大规模读取发票的模型。现在,您正是那位在对比GPU的人 —— 凝视着满是TFLOPS、VRAM和互连缩写的规格表,而每个供应商都声称自己是最快的。
本指南正是为此时而写。它用通俗的语言解释了GPU基准测试实际测量的内容,哪些数值对AI工作尤为重要,哪些可以安全忽略,以及如何计算您的用例真正所需的硬件规格。到最后,您将能够阅读任何GPU规格表,自己比较两张显卡,并准确知道在投入五位数或六位数的预算之前应提出哪些问题。
GPU基准测试实际上告诉您什么
基准测试是一种可重复的测试:在相同条件下,在不同硬件上执行相同任务。由于任务不变,测试结果可以公平比较——卡A完成工作量的速度如此快,卡B完成工作量的速度如此快。基准测试仅此而已,也是买家最有用的工具之一。
这很重要,因为单靠规格表无法回答您的问题。制造商公布的是理论最大值——芯片在理想实验室条件下能够提供的计算能力。实际的AI工作更为复杂:数据必须在内存中移动,软件会增加开销,不同的任务会对显卡的不同部分造成压力。两块具有类似规格的GPU在运行实际的语言模型时,表现可能会截然不同。
这就是为什么工作负载基准测试才是值得阅读的数字。它们不是抽象的评分,而是衡量AI硬件全天实际完成的任务:使用语言模型生成文本、使用扩散模型生成图像,以及读取或分析图像。如果您的预期使用场景与工作负载相符,基准测试将为您提供真实的信息。
一个诚实的限制,一开始就要指出:基准测试只是参考点,而不保证结果。结果会随着驱动程序版本、软件框架、批处理大小和模型设置的变化而变化。一次认真的比较——包括我们的——都是建立在公开发布的基准测试数据基础上的,并且总会如此表明。请将本指南中的每个数字,以及任何比较页面上的数字,视为参考而非承诺的结果。

Reading a benchmark chart: one baseline, proportional bars, and a healthy dose of context.
比较人工智能硬件时最重要的13个术语
购买合适的GPU不需要工程学位。您只需要掌握这里按实际采购决策顺序排列的十三个术语。
模型及其需求

Inference runs the model. Training teaches it — and typically needs two to four times the memory.
速度,您可以感受到
隐藏的瓶颈
扩展与成本
我们
GPU 比较表因此,您可以看到它们附加在实际卡片上,而不是抽象的定义。
您实际上需要多少GPU?
模型大小设定了最低要求。一个常见的发布近似值:在全FP16精度下,一个模型大约需要每十亿参数2 GB的显存。量化会缩小这个占用空间——INT8大约需要一半,INT4大约四分之一。在权重之外,预算约额外15到20%的容量用于缓存和激活,如果需要较长的上下文窗口,则需要更多。
关于此表的两个实际说明。首先,这些是权重加上正常开销的近似值——较长的上下文窗口或较大的批次会增加更多。第二,训练会改变一切:训练或微调模型通常需要比运行模型多两到四倍的内存,因为梯度和优化器状态与权重一起存储在VRAM中。
速度遵循类似的逻辑。在推理过程中,内存带宽通常会决定令牌的出现速度,这也是为什么配备HBM内存的数据中心显卡在大型模型上的表现明显快于其TFLOPS优势所暗示的原因。

The memory ladder: what common model sizes need at full precision versus quantized to INT4.
如果您宁愿跳过算术部分,我们将每张卡片分为四个实用类别——从用于原型设计的入门硬件到用于服务70B以上生产的旗舰卡——在其中。
比较页面上的工作负载等级.
如何判断哪个GPU更好:四个问题清单
当您的候选名单上有两张卡片时,四个问题几乎可以解决每一次比较。
还有一个技巧可以大大简化比较:索引。不要在四份规格表之间切换,将每张卡片放在一个秤上。我们的比较页面会根据LLM推理、图像生成和视觉工作负载对每个GPU进行评分,然后将所有内容以RTX 3090为100分的基准进行索引——得分为200意味着该卡的总体吞吐量大约是那张知名卡的两倍。突然之间,哪个更好这个问题只需一扫而过即可得出答案。

One scale for every card: when the RTX 3090 is 100, a 403 speaks for itself.
您可以在其中查看完整的索引字段
78-GPU 表格或直接跳到 a
任何两张卡牌的对决例如,H100与H200的比较,在几秒钟内即可得出结论:纸面上的计算能力相同,但H200拥有141 GB的更快内存,而H100为80 GB。
一种免费的对比方法:GPU基准测试工具内部分析
完全透明:这里描述的工具是我们的。它是免费的,无需注册即可使用,并且存在是因为我们一直在为客户手动回答同样的比较问题。以下是每个部分的功能——包括它不能做到的事情。
78-GPU表
每张当前卡片均可在一个可排序的表格中查看:VRAM、AI推理指数及其比例条、理论FP16 TFLOPS、已发布的训练吞吐量(如有),以及关于每张卡片最适合用途的简明说明。可以按VRAM类别筛选、按名称搜索,并对任何列进行排序。
当前前三名的领奖台为不耐烦的人提供更快的解决方案。
它的诚实限制:GPU表格故意不显示价格。AI硬件的市场价格每周变动一次,过时的价格比没有价格更糟——定价是在报价中完成的,而不是在静态表格中。
对战场
请选择任意两张卡片,然后
竞技场将它们并排放置:VRAM、推理索引、FP16 计算和训练吞吐量,作为镜像条,并附上一句用普通英语写成的评语。这是在两个入围显卡之间解决内部争论的最快方式。
其限制:判决反映的是已发布的指数,而不一定是您的确切软件架构。赢得指数的显卡仍可能在您的特定框架或模型版本上失败 —— 这就是为什么判决会提及差异,而不是冒充实验室报告。

The arena in three steps: pick two cards, compare the bars, read the verdict.
48台完整的AI服务器
一张显卡不够时,比较单位就会发生变化:多GPU服务器根据其整合的内存和整合的计算能力进行评判。
服务器部分列出了48个完整系统——从紧凑型工作站到8-GPU机架机——总VRAM和总FP16计算能力以与单个显卡相同的尺度进行计算,因此整个页面上的数字保持可比性。
层级、方法论及详细条款
The
工作负载层级将硬件类别转换为实际使用场景——旗舰级适用于70B以上多租户服务,高端级适用于30B至70B的生产工作,中端级适用于8B至30B档位,入门级用于原型开发和学习。该方法已公开发布:仅使用公开的基准测试数据,涵盖三类真实工作负载,并以RTX 3090的性能作为100的标准。页面还重复了其免责声明,我们在这里重申:这些数据仅用于参考,不保证性能。
常见问题解答(FAQ)共16个问题涵盖了详细信息。
首次购买者常犯的五大错误
从候选名单到报价:需要准备的事项及后续步骤
在某个阶段,电子表格阶段结束,您开始与供应商交流。如果您能提供五个事实,这次对话将会简短而富有成效:
有了这些回答,以下是我们合作的方式,直截了当:您通过 <问题输入渠道> 发送问题。
在比较页面上的表单或通过 WhatsApp 或 Telegram 联系,我们的工程师——而非机器人——会回复,通常在大约两个小时内。页面上的78块GPU和48台服务器是我们公开列出的;我们能够采购远超过此规模的设备,提供B2B和批量价格报价,全球范围内发货并处理海关,或在我们的托管设施中为您运行硬件。为了坦率地说明 ourselves,MillionMiner 是一个转售商和托管服务提供商,并非制造商——这正是为什么我们的推荐不局限于任何单一品牌。
Get a free hardware recommendation
Tell us your model, your users and your timeline — an engineer replies with a concrete suggestion, usually within two hours.
Ask your questionFree, no obligation, no signup.
常见问题解答
购买AI服务器是否需要内部硬件专业知识?
否。如果您能回答上述五个准备问题——模型、用户、延迟、推理或训练、位置——,一位称职的供应商可以将它们转化为硬件。本指南中的词汇存在的目的是方便您核查其推理,而不是让您承担他们的工作。
我们应该购买GPU还是在云端租用?
一个广泛发布的模式:在持续高利用率下运行的工作负荷可以令人惊讶地快速收回硬件投资,而波动或实验性工作负荷则更适合租赁。许多企业处于中间状态——拥有硬件并将其托管,这结合了可预测的成本与无需基础设施工作的优势。在做出决定之前,请计算您实际的利用率数据。
量化模型会在某些情况下导致性能略有下降,但通常不会引起明显的质量损失。
已发布的评估结果一致显示,FP8 在大多数任务中几乎与全精度无差别,而 INT4 则是一种任务依赖的较小权衡。明智的做法是在为其配备硬件之前,在您计划运行的量化级别上测试您的具体用例。
在请求报价之前,我们应准备哪些信息?
模型及其大小、预期的并发用户数或请求量、您的延迟预期、是否需要训练以及推理,以及硬件应位于何处。这五个答案——这就是全部作业。
我们应该等待下一代GPU吗?
总是有下一代产品。购买时考虑两到三年的工作负载时间:如果目前可用的硬件能够满足您当前和近期模型的需求并留有余地,等待主要会造成您未能获取的几个月价值。新一代通常会增加内存和提高效率,而不是改变可能性。
结论
模型大小决定您的内存底线。内存带宽决定您的实际速度。基准测试—作为参考数据,与某一基准进行比对—用以在任何两个候选方案之间达成比较。其他所有都是您自己工作负载的运算结果。
Compare 78 GPUs and 48 servers on one scale
Free, no signup — sortable benchmarks, head-to-head duels and a team that answers real questions.
Open the comparison