NVIDIA
Model: H100 NVL
Dwie karty NVIDIA H100 PCIe połączone za pomocą 3x mostów NVLink tworzą jednolitą pamięć HBM3 o pojemności 94 GB i łącznej przepustowości 3 938 GB/s. Architektura Hopper z czwartą generacją Tensor Cores i silnikiem… Transformer FP8. 14 592 rdzeni CUDA na kartę, TDP 400W na kartę. PCIe Gen 5 x16. MIG do maksymalnie 7 instancji na kartę. Specjalnie zaprojektowany do inferencji LLM, gdy modele przekraczają pojedynczą kartę GPU o pojemności 80 GB. Pasuje do standardowych platform serwerowych PCIe bez płyty głównej HGX. Pasywne chłodzenie dla obudowy serwera. Skontaktuj się z MillionMiner w celu uzyskania ceny.
Wybierz dostępność
Ilość
$26,500.00
Kupujesz 10 lub więcej? Uzyskaj niestandardową cenę hurtową
Pay withCeny i dostępność zmieniają się wraz z rynkiem. Potwierdzamy oba z Państwem, zanim zamówienie stanie się wiążące. Sprawdź cenę i dostępność
Prawdziwe
Przetestowane urządzenia
Na świecie
Globalne wysyłki
Wsparcie
Eksperci ds. kopania
Dwie karty NVIDIA H100 PCIe połączone za pomocą 3x mostów NVLink tworzą jednolitą pamięć HBM3 o pojemności 94 GB i łącznej przepustowości 3 938 GB/s. Architektura Hopper z czwartą generacją Tensor Cores i silnikiem… Transformer FP8. 14 592 rdzeni CUDA na kartę, TDP 400W na kartę. PCIe Gen 5 x16. MIG do maksymalnie 7 instancji na kartę. Specjalnie zaprojektowany do inferencji LLM, gdy modele przekraczają pojedynczą kartę GPU o pojemności 80 GB. Pasuje do standardowych platform serwerowych PCIe bez płyty głównej HGX. Pasywne chłodzenie dla obudowy serwera. Skontaktuj się z MillionMiner w celu uzyskania ceny.
Pick a workload to check the H100 NVL with 94 GB.
Llama 3.1 8B
A common local assistant model at 4-bit quantisation.
Tell us the workload and we will size a multi-GPU server for it.
Stacking that many cards is rarely the right answer. Ask us to size a server instead
VRAM figures are estimates for single-user inference and include headroom for context and system overhead. Throughput depends on model, settings and driver stack.
Cennik, czas realizacji i opcje hostingu. Osobista porada od naszego zespołu sprzedaży.
Cennik, czas realizacji i opcje hostingu. Osobista porada od naszego zespołu sprzedaży.
H100 NVL jest odpowiedzią NVIDIA na problem limitu 80 GB w własnej linii H100. H100 SXM zapewnia 80 GB na kartę na podstawce HGX, co jest liderem w branży dla treningu. Jednak do inferencji na modelach powyżej 70 miliardów parametrów w FP16 (pamięć powyżej 140 GB) pojedyncza karta o pojemności 80 GB jest niewystarczająca. NVL rozwiązuje ten problem, łącząc dwie karty PCIe H100 za pomocą trzech mostków NVLink w jednolitą pulę HBM3 o pojemności 94 GB, którą stos softwarowy widzi jako pojedynczą przestrzeń pamięci. Architekturą na kartę jest GPU GH100 w technologii TSMC 4nm z 14 592 rdzeniami CUDA (132 SM z pełnych 144 włączonych), 456 czwartej generacji Tensor Cores obsługujących precyzję… FP64, TF32, FP16, BF16, FP8 i INT8 z Transformer Engine, który dynamicznie wybiera optymalną precyzję dla warstwy podczas inferencji. 47 GB HBM3 na kartę przy przepustowości około 1 979 GB/s. Dla pary NVLink: 94 GB zintegrowanej przestrzeni przy 3 938 GB/s łącznej przepustowości, połączonej dwukierunkowym NVLink o przepustowości 600 GB/s. Transformer Engine jest kluczową cechą H100 w porównaniu do A100. Automatycznie zarządza obliczeniami mieszanej precyzji pomiędzy FP8 i FP16 na poziomie warstw sieci neuronowych, zapewniając do 4 razy wyższą przepustowość treningu i 30 razy szybszą inferencję na modelach opartych na transformatorach w porównaniu do A100. Obsługa LLM produkcyjnych na parach H100 NVL generuje od 2 do 3 razy więcej tokenów na sekundę za dolara w porównaniu z wdrożeniami A100 80 GB dla modeli w zakresie 30 miliardów do 70 miliardów parametrów. TDP wynosi 400 W na kartę w trybie domyślnym, a konfiguracja z kablem PCIe 16-pin wspiera moc od 200 W do 600 W na kartę. Przy domyślnych 400 W na parę (800 W łącznie) para NVL zużywa mniej więcej tyle samo energii co jedna H100 SXM przy 700 W, ale zapewnia 94 GB zamiast 80 GB przy prostocie infrastruktury slotu PCIe. Możliwość MIG umożliwia utworzenie do 7 w pełni izolowanych instancji na kartę (łącznie 14 w parach) z dedykowaną pamięcią, cache i obliczeniami. Dla wielo-dominium inferencji istotna jest ta granularność: obsługa różnych klientów lub modeli na izolowanych odcinkach GPU z gwarantowaną jakością usług. NVL pasuje do standardowych platform serwerowych PCIe. Każdy serwer z dwoma sąsiednimi slotami PCIe Gen 5 x16, przestrzenią na mostek NVLink (trzy mostki obejmujące obie karty) oraz odpowiednim przepływem powietrza do pasywnego chłodzenia o łącznej mocy 800 W. Platformy Supermicro, Dell PowerEdge, HPE ProLiant i Lenovo ThinkSystem potwierdzają kompatybilność H100 NVL. Nie jest wymagana podstawka HGX. W porównaniu do innych ofert MillionMiner: w porównaniu do H100 SXM 80GB (oddzielny produkt): SXM zapewnia wyższą przepustowość na GPU (3 350 GB/s) oraz połączenie NVSwitch dla wielogpu treningu, ale wymaga infrastruktury HGX. W porównaniu do H200 NVL 141GB: H200 podwaja pojemność pamięci z nowszym HBM3e dla operatorów potrzebujących jeszcze większej przestrzeni VRAM. W porównaniu do RTX PRO 6000 96GB (10 000–13 000 USD): RTX PRO 6000 oferuje nowszą architekturę Blackwell z wyższą precyzją FP32 TFLOPS, ale brakuje mu przepustowości HBM, Transformer Engine i sprawdzonego ekosystemu data centre Hopper.
H100 NVL istnieje, aby rozwiązać konkretny problem: standardowy H100 SXM ma 80 GB na kartę, co nie wystarcza do pomieszczenia modeli o 70 mld parametrów w FP16 (ok. 140 GB) na pojedynczym GPU. NVL łączy dwie karty PCIe H100 za pomocą trzech mostków NVLink w zunifikowaną pulę pamięci o pojemności 94 GB przy 3 938 GB/s łącznej przepustowości, umożliwiając obsługę modeli przekraczających 80 GB bez konieczności korzystania z infrastruktury podstawki HGX, którą wymagają karty SXM. To produkt PCIe. Pasuje do standardowych płyt głównych serwerów z… dwoma przyległymi slotami PCIe Gen 5 x16 i odpowiednią przestrzenią na mostki NVLink. Nie wymaga podstawki HGX, fabric NVSwitch ani niestandardowej obudowy serwerowej. Para NVL podłącza się do istniejącej infrastruktury serwerowej, pierwotnie zaprojektowanej dla kart A100 PCIe lub podobnych, zapewniając możliwość modernizacji bez wymiany serwera. Na kartę: 14 592 rdzenia CUDA, 456 czwartego pokolenia Tensor Cores z precyzją FP8 i Transformer Engine, 47 GB HBM3. Na parę: 29 184 rdzeni CUDA łącznie, 94 GB HBM3 zunifikowane, 3 938 GB/s łącznej przepustowości pamięci. TDP 400W na kartę (800W na parę, konfigurowalne od 200W do 600W na kartę). Pasywne chłodzenie wymagające przepływu powietrza w obudowie serwera. MIG dzieli każdą kartę na do 7 odseparowanych instancji. Decyzja między NVL a SXM zależy od infrastruktury. SXM zapewnia wyższą przepustowość na GPU (3 350 GB/s w kontraście do ok. 1 979 GB/s na karcie w NVL) i łączy do 8 GPU przez NVSwitch z prędkością 900 GB/s dla zadań szkoleniowych. NVL pasuje do istniejących platform serwerowych PCIe do zadań inferencyjnych, gdzie ważniejsza jest zunifikowana pula 94 GB niż szybkość łącza między wieloma GPU podczas szkolenia.
Nasi specjaliści ds. kopania mogą pomóc Ci znaleźć idealny miner dla Twojej konfiguracji i budżetu.
Dwie karty H100 PCIe połączone za pomocą 3x NVLink tworzą jednolitą pamięć HBM3 o pojemności 94 GB przy 3 938 GB/s łącznej przepustowości. 14 592 rdzeni CUDA na kartę, czwarta generacja rdzeni Tensor z silnikiem Transformer FP8. TDP 400W na kartę. PCIe Gen 5 x16. MIG dla 7 instancji na kartę. Zaprojektowane specjalnie do inferringu LLM, gdy modele przekraczają pojedynczy GPU VRAM 80GB. Pasuje do standardowych platform serwerowych PCIe bez płyty głównej HGX. Chłodzenie pasywne. Skontaktuj się z MillionMiner, aby uzyskać cenę i dostępność.
Dwie karty H100 PCIe połączone w jeden pulę pamięci HBM3 o pojemności 94 GB przy przepustowości 3 938 GB/s. Pasuje do modeli przekraczających pojemność pojedynczego GPU 80 GB.
4. generacja Tensor Cores automatycznie wybiera FP8/FP16 dla każdej warstwy. Do 30 razy wyższa przepustowość wnioskowania w porównaniu do A100 na modelach transformerów.
Pasuje do standardowych płyt głównych serwerów z dwoma slotami PCIe Gen 5 x16. Brak podstawki HGX. Ścieżka rozbudowy z istniejącej infrastruktury A100 PCIe.
Dwie karty PCIe H100 połączone trzema mostkami NVLink, tworząc wspólną pulę pamięci HBM3 o wielkości 94 GB. Para jest widoczna jako jedna dostępna przestrzeń pamięci w stosie oprogramowania. 47 GB na kartę, 94 GB razem. Potwierdź z MillionMiner, czy cena podana obejmuje parę kart czy pojedynczą kartę.
NVL: format PCIe, 94GB zintegrowane na parę, pasuje do standardowych płyt głównych serwerów, zoptymalizowany do wnioskowania LLM. SXM: format mezzanine, 80GB na kartę, wymaga płyty bazowej HGX, NVSwitch łączy do 8 GPU z przepustowością 900 GB/s, zoptymalizowany do treningu wielogPU. NVL to prostsza ścieżka infrastruktury. SXM to ścieżka o wyższej wydajności treningu.
Modele z 70 miliardami parametrów w FP16 (około 140 GB z zapasem pamięci KV na parę). Modele od 30 do 40 miliardów w FP16 z dużymi rozmiarami batching. Llama 3 70B, DeepSeek 67B i podobne modele open-weight z czołówki działają na parze NVL bez kwantyzacji.
Automatyczne zarządzanie precyzją na poziomie sprzętowym, unikalne dla architektur Hopper i nowszych NVIDIA. Dynamicznie wybiera precyzję FP8 lub FP16 dla każdej warstwy sieci neuronowej podczas inferencji i treningu, maksymalizując przepustowość bez ręcznego dostrajania precyzji. Zapewnia do 4-krotnego zwiększenia szybkości treningu i 30-krotnej przepustowości inferencji w porównaniu do A100 na modelach transformerów.
Każdy serwer z dwoma sąsiednimi gniazdami PCIe Gen 5 x16 oraz fizycznym miejscem na trzy mostki NVLink rozciągnięte na obie karty. Supermicro, Dell PowerEdge, HPE ProLiant, Lenovo ThinkSystem wszyscy dokumentują kompatybilność. Obsługiwane platformy procesorów AMD EPYC i Intel Xeon Scalable.
Tak. Do 7 w pełni izolowanych instancji na kartę (łącznie 14 w parze) z dedykowaną pamięcią, cache i obliczeniami. Każda instancja działa niezależnie z gwarantowaną jakością usług.
Para H100 NVL: architektura Hopper, zjednoczony 94GB HBM3, 3 938 GB/s łączne pasmo, silnik Transformer FP8, 800W na parę. A100 80GB: Ampere, 80GB HBM2e, 1 935 GB/s, brak FP8, 300W. H100 NVL zapewnia około 2 do 3 razy więcej tokenów inferencyjnych na sekundę dla modeli transformer. A100 kosztuje znacznie mniej za kartę.
Ta sama architektura Hopper jako podstawowa. H200 NVL zostaje zaktualizowany do 141GB HBM3e (w porównaniu do 94GB HBM3) z wyższą przepustowością. Dla modeli przekraczających 94GB, H200 NVL jest lepszym wyborem. Dla modeli mieszczących się w 94GB, H100 NVL oferuje korzystny stosunek cena/wydajność.
Para H100 NVL: 94GB HBM3, 3.938 GB/s przepustowości, Transformer Engine FP8, MIG 7 instancji na kartę, sprawdzony ekosystem data centre. RTX PRO 6000: 96GB GDDR7, 1.792 GB/s, bez Transformer Engine, nowsza architektura Blackwell, 125 TFLOPS FP32. H100 NVL wygrywa w zakresie przepustowości HBM (2,2x) oraz throughput inference Transformer Engine. RTX PRO 6000 wygrywa w zakresie obliczeń FP32 i kosztów na kartę.