Někdo ve vaší společnosti se rozhodl, že je čas spustit AI na vlastním hardware. Možná chcete soukromý chatbot, který zná vaše interní dokumenty, image pipeline pro produktový tým, nebo model, který čte faktury ve velkém měřítku. A nyní jste osoba porovnávající GPU — zíráte na technické listy plné TFLOPS, VRAM a zkratek propojení, zatímco každý výrobce tvrdí, že je nejrychlejší.
Tento průvodce je napsán pro právě tento okamžik. Vysvětluje jednoduchým jazykem, co skutečně měří GPU benchmarky, které čísla jsou důležitá pro práci s AI a která můžete bezpečně ignorovat, a jak zjistit, kolik hardwaru vaše použití skutečně vyžaduje. Na konci budete umět přečíst jakýkoliv specifikace GPU, sami porovnat dva karty a přesně vědět, na jaké otázky se ptát, než vložíte rozpočet na pět nebo šest místního čísla.
Co vám ve skutečnosti sděluje GPU benchmark
Benchmark je opakovatelný test: stejný úkol, prováděný za stejných podmínek na různém hardwaru. Protože se úkol nemění, lze výsledky spravedlivě porovnávat — karta A dokončila zátěž tak rychle, karta B tak rychle. To je vše, čím je benchmark, a je to nejvíce užitečný nástroj, který má kupující k dispozici.
Je to důležité, protože samotná technická specifikace nedokáže zodpovědět vaši otázku. Výrobci uvádějí teoretické maximum — výpočetní výkon, který čip může dosáhnout za perfektních laboratorních podmínek. Skutečná práce s AI je složitější: data se musí přesouvat dovnitř a ven z paměti, software přidává režii a různé úkoly zatěžují různé části karty. Dvě GPU se podobnými technickými specifikacemi se mohou chovat velmi odlišně, jakmile spustí skutečný jazykový model.
Protože zátěžové testy jsou čísla, která stojí za pozornost. Místo abstraktního hodnocení měří, jaké úkoly AI hardware skutečně plní po celý den: generování textu pomocí jazykového modelu, vytváření obrázků pomocí difuzního modelu a čtení nebo analýzu obrázků. Pokud vaše plánované použití odpovídá zátěži, test vám poskytne něco skutečného.
Jedno čestné omezení, hned na začátku: benchmarky jsou referenční body, nikoli záruky. Výsledky se mění s verzemi ovladačů, softwarovými rámci, velikostmi batchů a nastavením modelů. Seriózní srovnání — včetně našeho — je založeno na veřejně publikovaných datech z benchmarků a vždy to tak bude uvádět. Považujte každé číslo v tomto průvodci a na jakékoli stránce srovnání za orientační, nikoli za garantovaný výsledek.

Reading a benchmark chart: one baseline, proportional bars, and a healthy dose of context.
13 pojmů, které se vyplatí znát při porovnávání hardwaru pro AI
K nákupu správného GPU není třeba inženýrského titulu. Stačí vám třináct termínů, seřazených zde v pořadí, ve kterém se s vámi setkají při skutečném rozhodování o nákupu.
Model a to, co potřebuje

Inference runs the model. Training teaches it — and typically needs two to four times the memory.
Rychlost, kterou cítíte
Skrytý úzký hrdlo
Škálování a náklady
Každý z těchto termínů se objevuje jako sloupec nebo štítek v našem
Tabulka srovnání GPU, takže je můžete vidět připojené ke skutečným kartám namísto abstraktních definic.
Kolik GPU skutečně potřebujete?
Velikost modelu stanoví minimální požadavky. Často uváděná přibližná hodnota: při plné přesnosti FP16 potřebuje model přibližně 2 GB VRAM na miliardu parametrů. Kvantizace tento prostor zmenšuje — INT8 potřebuje asi polovinu, INT4 zhruba čtvrtinu. K tomu, co potřebují váhy, naplánujte přibližně 15 až 20 procent navíc na cache a aktivace, a víc, pokud požadujete dlouhé kontextové okna.
Dvě praktické poznámky k této tabulce. Za prvé, jedná se o odhady pro váhy plus běžné režie — dlouhý kontextový okno nebo velká dávka přidávají další. Za druhé, trénink vše mění: výuka nebo doladění modelu obvykle vyžaduje dvakrát až čtyřikrát více paměti než samotný běh, protože gradienty a stavy optimalizátoru jsou uloženy ve VRAM vedle vah.
Rychlost následuje podobnou logiku. Pro inference obvykle paměťová sběrnice určuje, jak rychle se objevují tokeny, což je důvod, proč karty v datových centrech s pamětí HBM působí nepřiměřeně rychleji u velkých modelů než jejich výhoda v TFLOPS naznačuje.

The memory ladder: what common model sizes need at full precision versus quantized to INT4.
Pokud chcete přeskočit výpočty, rozdělili jsme každou kartu do čtyř praktických tříd — od základního hardwaru pro prototypování po vlajkové karty pro produkci přesahující 70 miliard, sloužící k
úrovně pracovního zatížení na stránce srovnání.
Jak poznat, která GPU je lepší: 4 otázky, které byste si měli položit
Když na vašem seznamu jsou dvě karty, čtyři otázky vyřeší téměř každé srovnání.
Existuje ještě jeden trik, který výrazně usnadní srovnání: indexování. Místo toho, abyste museli pracovat se čtyřmi technickými listy, položte každou kartu na jednu váhu. Naše stránka srovnání hodnotí každé GPU v oblasti inferencí LLM, generování obrázků a vizuálních úloh a poté vše indexuje vůči RTX 3090 jako základnímu bodu s hodnotou 100 — skóre 200 jednoduše znamená přibližně dvojnásobný celkový throughput než tato dobře známá karta. Najednou je otázka, která je lepší, odpovězelná na první pohled.

One scale for every card: when the RTX 3090 is 100, a 403 speaks for itself.
Můžete vidět celé indexované pole v
Tabulka 78-GPUnebo přejděte rovnou k
souboj dvou karet přímo proti soběOtázka H100 versus H200 se například vyřeší během sekund: stejný výpočet na papíře, ale 141 GB rychlejší paměti na H200 proti 80 GB na H100.
Zdarma způsob, jak porovnat: Uvnitř nástroje pro benchmark GPU
Plná transparentnost: nástroj popsaný zde je náš. Je zdarma, funguje bez jakéhokoliv registrace a existujeProtože jsme neustále odpovídali na stejné porovnávací otázky od zákazníků ručně. Zde je, co každý jeho část dělá — včetně toho, co neumí.
Tabulka 78-GPU
Každá aktuální karta v jedné řaditelné tabulce: VRAM, AI Inference Index s poměrovým pruhem, teoretické FP16 TFLOPS, zveřejněná propustnost trénování, kde je dostupná, a poznámka v jednoduchém jazyce o tom, na co je každá karta nejvhodnější. Filtrujte podle třídy VRAM, vyhledávejte podle názvu a seřaďte jakoukoli sloupec. A
pódium současného prvního, druhého a třetího místasedí nad tím pro netrpělivé.
Jeho čestné omezení: tabulka GPU záměrně nezobrazuje žádné ceny. Tržní ceny hardwaru pro AI se mění každý týden a zastaralá cena je horší než žádná — ceny se stanovují v rámci nabídky, nikoli v statické tabulce.
Aréna soubojů
Vyberte libovolné dvě karty a
arenaPostaví je vedle sebe: VRAM, inference index, FP16 výpočet a průchodnost tréninku jako zrcadlené pruhy, plus písemný verdikt v jedné větě jednoduchou angličtinou. Je to nejrychlejší způsob, jak vyřešit interní spor mezi dvěma vybranými kartami.
Jeho omezení: verdikt odráží zveřejněný index, nikoliv váš přesný softwarový stack. Karta, která vyhraje v indexu, může stále prohrát na vašem specifickém rámcové nebo verzi modelu — proto verdikt uvádí rozdíl místo toho, aby předstíral laboratorní zprávu.

The arena in three steps: pick two cards, compare the bars, read the verdict.
48 kompletních AI serverů
Jakmile jedna karta nestačí, měřítko se změní: server s více GPU je posuzován podle jeho kombinované paměti a kombinovaného výkonu.
sekce serverunabízí 48 kompletních systémů — od kompaktních pracovních stanic po rackové stroje s 8 GPU — s celkovým VRAM a celkovým FP16 výpočetem vypočítaným na stejném měřítku jako jednotlivé karty, takže jsou čísla srovnatelná po celé stránce.
Třídy, metodologie a drobné detaily
The
úrovně zátěžepřeveďte třídy hardwaru na jednoduché případové studie — Flagship pro vícenájemné služby nad 70B, High-End pro výrobní práce od 30B do 70B, Mid-Range pro rozmezí 8B až 30B, Entry pro prototypování a vzdělávání. Metodika je veřejně dostupná: pouze veřejně dostupná benchmarková data, tři rodiny skutečných pracovních zátěží, vše indexováno vůči RTX 3090 na úrovni 100. A stránka opakuje své vlastní upozornění, které zde znovu uvádíme: referenční data jsou určena k orientaci, nikoli ke zárukám výkonu.
Často kladené otázky – 16 otázekzakrývá podrobnosti.
Pět chyb, kterých se při nákupu poprvé dopouštějí kupující
Od užšího výběru k nabídce: Co je třeba připravit a co se stane dál
V určitý okamžik končí fáze tabulky a začnete komunikovat s dodavatelem. Rozhovor je krátký a produktivní, pokud přinesete pět faktů:
S těmi odpověďmi je to u nás jednoduché: otázku pošlete prostřednictvím the
formular na stránce srovnánínebo přes WhatsApp nebo Telegram, a skutečný inženýr — nikoli bot — odpoví, obvykle do přibližně dvou hodin. 78 GPU a 48 serverů na stránce jsou to, co uvádíme veřejně; můžeme zajistit i více, nabídnout B2B a velkoobjemové ceny, doručit po celém světě s vyřízením celních formalit nebo spravovat hardware ve vašich datových centrech. A abychom se postavili čestně: MillionMiner je reseller a Hoster, nikoli výrobce — což je přesně důvod, proč doporučení není vázáno na žádnou konkrétní značku.
Get a free hardware recommendation
Tell us your model, your users and your timeline — an engineer replies with a concrete suggestion, usually within two hours.
Ask your questionFree, no obligation, no signup.
Často kladené otázky
Potřebujeme interní znalosti hardwaru pro nákup serveru AI?
Ne. Pokud jste schopni zodpovědět na výše uvedených pět přípravných otázek — model, uživatelé, latence, inference nebo trénink, umístění — schopný dodavatel je může přeložit do hardwaru. Slovník v této příručce existuje proto, abyste mohli ověřit jejich logiku, nikoli abyste museli dělat jejich práci.
Máme-li koupit GPU nebo je pronajmout v cloudu?
Často uváděný vzorec: zatížení, které běží při dlouhodobé vysoké využitelnosti, se vám s překvapivou rychlostí vrátí z vlastního hardwaru, zatímco špičková nebo experimentální zatížení dávají přednost pronájmu. Mnoho podniků se nachází někde uprostřed — vlastní hardware a nechat jej hostovat, což kombinuje předvídatelné náklady s minimem práce na zařízení. Před rozhodnutím si spočítejte své reálné využití.
Ztrácí kvantovaný model výraznou kvalitu?
Publikované hodnocení systematicky ukazují, že FP8 je téměř nerozeznatelný od plné přesnosti u většiny úkolů, a INT4 představuje malý, úkolově závislý kompromis. Rozumný přístup je otestovat váš konkrétní případ použití na úrovni kvantizace, na kterou se chystáte provozovat — před tím, než navrhnete hardware pro dané použití.
Jaké informace bychom měli připravit před žádostí o nabídku?
Model a jeho velikost, očekávaní souběžní uživatelé nebo objem požadavků, vaše očekávání latence, zda potřebujete trénink i inferenci, a kde by měl hardware být umístěn. Pět odpovědí — to je celé zadání.
Měli bychom počkat na další generaci GPU?
Vždy existuje další generace. Kupujte s horizontem zátěže na dva až tři roky: pokud hardware dostupný dnes splňuje vaše současné a krátkodobé modely s rezervou, čekání vám většinou pouze přijde na měsíce z hodnoty, kterou jste nezískali. Nové generace mají obvykle tendenci přidávat paměť a efektivitu, než aby měnily to, co je možné.
Shrnutí
Velikost modelu určuje vaše minimální využití paměti. Šířka pásma paměti stanoví vaše reálné rychlosti. Benchmarky — čtené jako referenční data, indexovaná k jedné základní hodnotě — usnadňují srovnání mezi dvěma kandidáty. Vše ostatní je aritmetika na vašem vlastním pracovním zatížení.
Compare 78 GPUs and 48 servers on one scale
Free, no signup — sortable benchmarks, head-to-head duels and a team that answers real questions.
Open the comparison