Million Miner Logo

Koupit GPU NVIDIA pro AI: H100, H200 a RTX PRO 6000

Kupte si NVIDIA H100, H200, RTX PRO 6000 nebo L40S pro trénování, inferenci a lokální LLM. Všechny karty jsou nové a doručíme je k vám včetně cla. Poradíme vám, jaký model a provedení se hodí do vašich serverů.

Menší rozpočet nebo kompaktní sestava: RTX PRO 4000 Blackwell, RTX PRO 4500 Blackwell nebo RTX 4000 SFF Ada. Software, který nepotřebuje CUDA, poběží i na AMD Instinct MI210 nebo Intel Data Center GPU Flex.

43 produktů
Zobrazeno 12 z 43

Ověřené sklady

Každé GPU je před odesláním testováno a inspekováno

Rychlé odeslání

Odesíláme do 1–3 pracovních dní

Přijímáme kryptoměny

Plaťte s BTC, ETH, USDT a dalšími

Odborná podpora

Specialisté na AI a GPU infrastrukturu k dispozici

AI a GPU výpočty

Profesionální AI GPU pro školení, inference a HPC úlohy

Revoluce AI je poháněna překvapivě malým množstvím křemíkových čipů. Sortiment GPU pro datová centra od NVIDIA, od GPU Tensor Core H100 a H200 po RTX PRO 6000 Blackwell a RTX 5090, představuje výpočetní substrát, na kterém běží velké jazykové modely, difuzní modely, vědecké simulace a pipeline s vysokou frekvencí inference. Nabízíme kompletní profesionální sortiment NVIDIA — akcelerátory pro datová centra, GPU pro pracovní stanice a profesionální vizualizační karty — pro podnikové zákazníky, výzkumné laboratoře, startupy v oblasti AI a provozovatele cloudové infrastruktury.

H200 Paměťové BW

4.8 TB/s

HBM3e @ kapacita 141 GB

H100 AI Výkon

3.9 PFLOPS

Operace s řídkým tensorovým formátem FP8

RTX PRO 6000 VRAM

96 GB

GDDR7 ECC — architektura Blackwell

RTX 5090 VRAM

32 GB GDDR7

Blackwell GB202 — 3352 GB/s BW


NVIDIA Profesionální řada GPU

Z pracovního stanice na hyperscale datové centrum

H100 SXM / PCIe

80 GB HBM2e

Pracovník podnikové tréninku AI. 3,35 TFLOPS FP64, NVLink 900 GB/s. Varianta SXM je preferována pro multi-GPU NVSwitch struktury v systémech DGX H100.

H200 SXM / PCIe

141 GB HBM3e

Nástupce H100. Stejná GPU die Hopper, ale s 1,76× více paměti a přenosovou rychlostí 4,8 TB/s — klíčové pro inference LLM s dlouhými kontextovými okny.

A100 PCIe / SXM

40 GB / 80 GB HBM2e

Pracovní stroj předchozí generace stále ve velkém provozu. 312 TFLOPS FP16 Tensor Core. Je široce dostupný v originálních a upravených konfiguracích PCIe.

RTX PRO 6000 Blackwell

96 GB GDDR7 ECC

Nejvýkonnější pracovní stanice GPU vůbec vyvinutá. Plný formát PCIe, podpora NVLink bridge, čtvrtá generace Tensor Core. Ideální pro místní inference LLM a rendering.

RTX 5090 (GB202)

32 GB GDDR7

NVIDIA spotřebitelská vlajková loď na architektuře Blackwell. 21 760 CUDA jader, 3 352 GB/s paměťové pásmo. Nejlepší jednodeskový GPU pro smíšené pracovní zatížení a inference.

RTX 4090 (Ada)

24 GB GDDR6X

Předchozí generace Ada. 16 384 CUDA jader, 1008 GB/s přenosové pásmo. Stále silný výkon a cenově dostupnější možnost pro inference clustery.

T1000 (Professional)

8 GB GDDR6

Profesionální GPU s nízkým profilem pro edge inference a workloads s výstupem na displej. Minimální spotřeba energie, tichý chod, hustá instalace v racku.

A2 / L4 (PCIe)

16 / 24 GB GDDR6

Inferenčně optimalizované PCIe GPU Ada a Ampere. Navrženo pro servery s omezeným výkonem — TDP 72 W — s vysokým throughputem v INT8 pro nasazení ve velkém měřítku.

Příběh architektury NVIDIA

Hopper, Ada Lovelace a Blackwell — Tři generace pohánějící éru AI

NVIDIA dodala od začátku AI boomu tři hlavní mikroarchitektury GPU. Architektura Hopper (H100, H200) zavedla Transformer Engine — hardwarový blok, který dynamicky přepíná přesnost mezi FP8 a FP16 v rámci jedné vrstvy, čímž maximalizuje propustnost bez podstatné ztráty přesnosti. Tento návrhový průlom umožnil komerční nasazení tréninku modelů s více než 70 miliardami parametrů.

Ada Lovelace (RTX 4090, L4, L40S) přinesla čtvrtou generaci Tensor Core na trh profesionálů a prosumerů spolu s výrazně vylepšeným hardwarem pro ray tracing. Karty Ada obsazují ideální střední pozici mezi přístupností pro spotřebitele a profesionální výkonností, což z nich činí dominantní volbu pro boutique inference nasazení a kreativní AI pracovní stanice.

Blackwell (RTX 5090, RTX PRO 6000, GB200 NVL72) je současná generace. Blackwell zavedl dvoudílný návrh GPU pro vrcholné díly datových center, NVLink 5.0 s datovou šířkou 1,8 TB/s die-to-die a pátou generaci Tensor Core s podporou FP4. RTX PRO 6000 Blackwell přináší 96 GB ECC paměti do úrovně pracovních stanic — více kapacity než H100 PCIe — což umožňuje lokální běh dříve výhradně cloudových úloh.


Vedle sebe

H100 versus H200 versus RTX PRO 6000 Blackwell

Tři GPU, které určují moderní infrastrukturu AI na úrovni pracovního stanice a jednočlánkového serveru.

Hopper

H100 SXM5

Pro nejlepší trénink
Paměť 80 GB HBM2e
Paměťová šířka pásma 3.35 TB/s
FP8 Sparse 3.9 PFLOPS
TDP 700 W (SXM)
NVLink NVLink 4 — 900 GB/s
Formát SXM5 / PCIe

Zlatý standard pro distribuované trénování. Varianta SXM připojená pomocí NVSwitch je povinná pro 8-GPU uzly třídy DGX. Varianta PCIe odpovídá standardním serverům.

Hopper

H200 SXM5

Nejlepší pro inference
Paměť 141 GB HBM3e
Paměťová šířka pásma 4.8 TB/s
FP8 Sparse 3.9 PFLOPS
TDP 700 W (SXM)
NVLink NVLink 4 — 900 GB/s
Formát SXM5 / PCIe

Stejná GPU Hopper jako H100, ale s téměř dvojnásobnou kapacitou paměti a podstatně vyšší datovou průchodností. Ideální pro obsluhu modelů s více než 70 miliardami parametrů ve velkém měřítku s dlouhými kontextovými délkami.

Blackwell

RTX PRO 6000 BW

Nejlepší pracovní stanice
Paměť 96 GB GDDR7 ECC
Paměťová šířka pásma ~1.8 TB/s
Tensorové jádro 5th-gen, FP4/FP8/FP16
TDP 300 W (PCIe)
NVLink NVLink Bridge (optional)
Formát Dual-slot PCIe x16

Více VRAM než H100 ve standardní PCIe zásuvce. Vhodný pro jakoukoli pracovní stanici nebo tower server. Spouští modely o velikosti 70B lokálně. RTX PRO 6000 Server Edition odstraní výstupy zobrazení pro rackově optimalizované nasazení.


Výběr správného GPU

Trénink vs Inference vs Pracoviště: Který GPU potřebujete?

GPU, který trénuje model, není nutně nejlepší GPU pro jeho nasazení. Trénování vyžaduje maximální FLOPS a velkou paměť pro současné uložení parametrů, gradientů a stavů optimalizátoru — například 70B model jemně doladěný s AdamW vyžaduje přes 500 GB VRAM napříč clusterem. Pro trénování v této velikosti jsou průmyslovým standardem uzly H100 nebo H200 SXM připojené přes NVSwitch, které nabízejí kombinaci surového výpočetního výkonu a šířky pásma NVLink potřebné k tomu, aby všechny GPU byla napojeny.

Zátěžové práce na inferenci méně záleží na FLOPS a více na kapacitě paměti a šířce pásma. Kvantizovaný model o velikosti 70B při INT4 se vejde přibližně do 40 GB — což znamená, že H200 jej může obsloužit s rezervou, a dva karty RTX PRO 6000 Blackwell připojené přes NVLink Bridge to dokážou také. Pro služby inference s vysokou průchodností udrží šířka pásma H200 o hodnotě 4,8 TB/s nízkou latenci i při současných požadavcích na skupiny požadavků.

Případy použití lokální pracovní stanice — výzkum, kreativní AI, místní LLM chat, generování obrázků, syntéza videa — jsou dobře obsluhovány grafickými kartami RTX PRO 6000 Blackwell (96 GB), RTX 5090 (32 GB) nebo A100 (40/80 GB) v závislosti na požadované velikosti modelu. RTX 4090 zůstává nejvíce cenově výhodnou možností pro uživatele používající kvantizované modely do 24 GB.

Rychlý průvodce výběrem

Přizpůsobte svou zátěž správnému hardwaru

Trénink LLM (70B+)
H100 / H200 SXM

Multi-node NVSwitch cluster. Povinné pro rozsáhlé předtrénování a úplné doladění.

Inferenční model LLM (70B)
H200 or 2× RTX PRO 6000

Vysoce pásmová paměť je nezbytná pro poskytování dlouhého kontextu. NVLink Bridge pro páry pracovních stanic.

Inference LLM (7–13B)
RTX 5090 / A100 80GB

32–80 GB postačuje pro kvantizované poskytování služeb. Silný průchod INT8.

Lokální AI pracovní stanice
RTX PRO 6000 BW (96 GB)

Nejvíce VRAM na PCIe kartě. Spouští modely za 34 miliardů bez kvantizace. ECC pro spolehlivost.

Obrázek / Video Generátor
RTX 5090 / RTX 4090

Vyšší počet CUDA jader + rychlá šířka pásma GDDR7 ideální pro difuzní inference.

Edge / Nízká Spotřeba Inference
T1000 / L4 / A2

TDP pod 75 W. Jednotlivá nebo nízkoprofilová karta. Husté rozmístění ve stojanu.

Profesionální vizualizace
RTX PRO 6000 / A100

Paměť ECC, certifikovaní ovladače, velké rámcové bufferové paměti pro 3D/CAD/simulaci.


Hlavní rysy architektury Blackwell

Proč je Blackwell krokem do nové generace

Design GPU s dvojitým čipem

GB200 spojuje dva čipy Blackwell GPU v jednom balení, propojené pomocí NVLink-C2C rychlostí 1,8 TB/s — čímž zcela eliminuje limitaci PCIe mezi výpočetními jednotkami.

5. generace Tensor Core

Nový režim přesnosti FP4 dosahuje až dvojnásobné průchodnosti oproti FP8 u inference úloh. Zachovává přesnost pomocí NVIDIA mikroškálovacího formátu (MXFP4).

NVLink 5,0

Rozšíření šířky pásma zdvojnásobí v porovnání s Hopper — 1,8 TB/s oboustranně na GPU. Klíčové pro konfiguraci stojanu NVL72, která spojuje 72 GPU Blackwell do jednoho logického celku.

RAS Engine

Dedikovaný engine pro Reliability, Availability & Serviceability pro prediktivní detekci hardwarových poruch — snižuje neplánované odstávky v produkčních inference klastrech.

Důvěrné výpočty

Hardwarově izolované TEE (Důvěryhodné prostředí pro spuštění) pro pracovní zátěže GPU. Umožňuje bezpečné spuštění vlastních modelů a citlivé inference v sdílené cloudové infrastruktuře.

RTX PRO 6000 — PCIe vlajková loď

96 GB GDDR7 ECC ve standardním formátu PCIe s dvojitým slotem. Spolehlivost úrovně pracovního stanice s kapacitou paměti třídy datového centra. Serverová edice odstraňuje výstupy pro displej.

NVIDIA Blackwell

RTX 5090 a RTX PRO 6000: Blackwell pro profesionály

GeForce RTX 5090 uvádí Blackwell na trh spotřební a pro-sumerové grafické karty. Postavena na čipu GB202 s 21 760 CUDA jádry a 32 GB GDDR7 pamětí s přenosovou rychlostí 1 792 GB/s, je to nejsilnější jednotný GPU, který se vejde do standardního stolního počítače. Pro AI výzkumníky a vývojáře, kteří potřebují místní inference a experimentování bez cloudových nákladů, je RTX 5090 rozumnou volbou.

RTX PRO 6000 Blackwell přistupuje odlišně: namísto maximalizace výkonu pro spotřebitelské herní využití navrhla společnost NVIDIA pracovní stanici GPU s 96 GB ECC GDDR7 paměti — více než jakékoliv předchozí PCIe GPU od jakéhokoliv výrobce. Varianty Server Edition a Max-Q Workstation Edition pokrývají nasazení v racku a na mobilních zařízeních. Dvě karty RTX PRO 6000 připojené pomocí NVLink Bridge poskytují 192 GB sdílené paměti — dostatečné pro provoz modelů s 70 miliardami parametrů ve formátu bez kvantování.

Pro studia, výzkumné laboratoře a AI startupy, které nemohou nebo nechtějí provozovat veškerou zátěž v cloudu, mění řada Blackwell workstation zcela výpočty. Vlastní modely zůstanou na místě. Latence inference se sníží. Svrchovanost dat je zachována. Počáteční náklady na hardware jsou amortizovány na základě cloudových nákladů na inference, které by jinak narůstaly nepřetržitě.


Často kladené otázky

Často kladené otázky

Oba používají stejnou GPU jádro GH100 Hopper a poskytují identické výpočetní FLOPS (~3,9 PFLOPS FP8 sparse). H200 nahrazuje HBM2e pamětí HBM3e: kapacita se zvyšuje z 80 GB na 141 GB a šířka pásma roste z 3,35 TB/s na 4,8 TB/s. H200 je proto vhodnější pro inference náročné úlohy, kde musí velké modely zapadat na jedno GPU a je požadován vysoký výkon.

Pro inference úlohy ano — jeho kapacita 96 GB ECC GDDR7 přesahuje 80 GB H100 PCIe a vejde se do kteréhokoliv standardního PCIe slotu ve stanici. Pro školení poskytuje formát H100/H200 SXM s NVSwitchem podstatně vyšší inter-GPU datovou propustnost a větší surový výkon FLOPS při stejné TDP. RTX PRO 6000 je lepší volbou, když potřebujete vysokou kapacitu VRAM lokálně bez infrastruktury NVSwitch.

SXM GPU (H100 SXM5, H200 SXM5) se montují na specializovanou základní desku namísto PCIe slotu a propojují se navzájem pomocí NVSwitch fabric, což umožňuje 900 GB/s mezigrafovou šířku pásma na GPU. Varianty PCIe se hodí do standardních serverů a pracovních stanic, ale jsou omezeny na NVLink Bridge (2 GPU) nebo PCIe šířku pásma (x16, přibližně 64 GB/s) pro multi-GPU komunikaci. Pro klastry s 8 a více GPU, které vyžadují vzájemnou komunikaci všech GPU, jsou systémy SXM NVSwitch nezbytné.

U přesnosti FP16 (16bit) model o velikosti 70B vyžaduje přibližně 140 GB VRAM — jedno H200 (141 GB) to zvládne na hranici. U kvantizace INT8 je potřeba přibližně 70 GB. U INT4 (GGUF Q4) je to přibližně 35–40 GB, což se vejde do H100 80 GB nebo do dvojice RTX 4090. RTX PRO 6000 Blackwell (96 GB) zvládne INT8 70B modely na jednom GPU s rezervou pro KV cache.

RTX 5090 je vynikající pro místní inferenci AI, generování obrázků (Stable Diffusion, Flux, DALL-E 3 repliky), syntézu videa a doladění malých až středních modelů. Její 32 GB GDDR7 postačuje pro provoz 13B modelů v FP16 a 70B modelů v INT4. U více GPU trénovacích clusterů zůstávají data centre GPU stále preferovanou volbou kvůli pásmu NVLink a větší kapacitě paměti.

NVIDIA A100 (architektura Ampere, 2020) zůstává výkonným a široce používaným GPU pro AI. Dodává se ve konfiguracích 40 GB a 80 GB HBM2e, poskytujících výkon 312 TFLOPS FP16 Tensor Core. Díky uvolnění dodávek ve srovnání s H100 je cena A100 dostupnější. Pro inference a středně náročné tréninkové úlohy zůstává silný. Pro nejpokročilejší výzkum nebo největší modely jsou nyní preferované H100/H200.

Ano. MillionMiner poskytuje služby firemním, výzkumným a cloudovým zákazníkům s objednávkami GPU na velké objemy. Kontaktujte náš prodejní tým ohledně cen za nákup vícekusových H100, H200, A100 a RTX PRO 6000. Můžeme zajistit přepravní logistiku, přípravu a fakturaci v různých měnách včetně kryptoměn.

Náš tým je k dispozici 24/7 prostřednictvím WhatsApp (+49 176 777 888 33), e-mailu a telefonu. Pomáháme s výběrem GPU pro tréninkové vs. inference workloady, návrhem multi-GPU clusterů a B2B nákupem. Kontaktujte nás nebo navštivte náš FAQ pro okamžité odpovědi.

Připraveni vybudovat svou AI infrastrukturu?

Prohlédněte si naši kompletní nabídku profesionálních GPU NVIDIA výše, od jednotlivých karet pro pracovní stanice po více GPU v serverových konfiguracích. Ať už trénujete svůj první model nebo škálujete inference cluster, náš tým Vám pomůže sladit správný hardware s Vaší pracovní zátěží a rozpočtem.