NVIDIA
Model: H200 SXM
Poproś o wycenę swojego klastra GPU
Podaj nam swoje wymagania dotyczące wdrożenia. Nasz specjalista ds. sprzętu AI odpowie w ciągu 24 godzin e-mailem, przez WhatsApp lub telefonicznie.
Dlaczego GPU sprzedawane są na podstawie konsultacji
Klastery GPU do zadań AI i HPC są konfigurowane zgodnie z Twoimi dokładnymi wymaganiami — ilość, topologia połączeń, zużycie energii i chłodzenie wpływają na ostateczną cenę. Wypełnij poniższy formularz, a nasz specjalista odpowie w ciągu 24 godzin z pełną wyceną dostosowaną do Twojej implementacji.
Dziękujemy! Nasz specjalista odpowie w ciągu 24 godzin z Twoją spersonalizowaną wyceną.
Jak działa Twoje zamówienie na GPU
Złóż formularz
Powiedz nam, jaki jest Twój przypadek użycia oraz ilość
Uzyskaj wycenę
Kompleksowa wycena w ciągu 24 godzin
Recenzja z specjalistą
Omów konfigurację, połączenia, chłodzenie
Wdrożenie
Sprzęt wysłany i gotowy do uruchomienia
Prawdziwe
Przetestowane urządzenia
Na świecie
Globalne wysyłki
Wsparcie
Eksperci ds. kopania
NVIDIA H200 NVL 141GB Tensor Core GPU. Architektura Hopper z pierwszą na świecie pamięcią HBM3e: 141GB przy przepustowości 4 800 GB/s, wzrost VRAM o 76 procent i zwiększenie przepustowości o 43 procent w porównaniu do H100 SXM. Ten sam obliczeniowy Hopper co H100: 16 896 rdzeni CUDA, 528 czwartego pokolenia Tensor Cores z FP8 Transformer Engine, 67 TFLOPS FP32, 3 958 TFLOPS FP8. Forma PCIe obsługująca do 4 GPU za pomocą mostów NVLink. Konfigurowalny TDP do 600W. Pasowe chłodzenie powietrzem dla standardowych obudów serwerowych. MIG dla 7 instancji po 16,5GB każda. Upgrade typu drop-in z infrastruktury PCIe A100 i H100.
Cennik, czas realizacji i opcje hostingu. Osobista porada od naszego zespołu sprzedaży.
Cennik, czas realizacji i opcje hostingu. Osobista porada od naszego zespołu sprzedaży.
Bezpłatna wycena, odpowiedź w ciągu 24h. Brak telefonów sprzedażowych.
4.7 / 5 na Trustpilot
Zweryfikowane opinie klientów
Ponad 30 000 minery dostarczone
Wysyłka na cały świat od 2020 roku
Ponad 1 200 klientów na całym świecie
Zaufany w ponad 50 krajach
H200 nie jest nową architekturą. To ta sama inżynieria Hopper GH100 napędzana tymi samymi rdzeniami CUDA, tymi samymi rdzeniami Tensor i tym samym Transformer Engine co H100. To, co NVIDIA zmieniła, to podsystem pamięci: HBM3 zastąpiono HBM3e, pojemność zwiększono z 80GB do 141GB, przepustowość z 3 350 GB/s do 4 800 GB/s. Wszystkie inne specyfikacje pozostają identyczne. Jest to ukierunkowana rozbudowa pamięci dla obciążeń, w których 80GB w H100 staje się ograniczeniem. Praktyczny wpływ można podzielić na trzy kategorie, które odzwierciedlają decyzje dotyczące wdrożenia. Inference LLM z pełną precyzją. Model z 70 miliardami parametrów w FP16, z narzutem na KV cache, wymaga około 140GB do 160GB pamięci GPU, w zależności od rozmiaru partii i długości sekwencji. H100 z 80GB nie mieści tego bez kwantyzacji do FP8 lub INT8, co zmniejsza dokładność modelu. H200 NVL z 141GB mieści 70B w FP16 na pojedynczym GPU, zachowując pełną precyzję. Dla zastosowań, gdzie utrata dokładności kwantyzacji jest nieakceptowalna (medyczna AI, analiza dokumentów prawnych, modelowanie finansowe), jest to różnica między "możliwe" a "gotowe do produkcji". Skalowanie inference na długi kontekst. Modele Transformer alokują pamięć KV cache proporcjonalnie do długości okna kontekstowego. Model obsługujący okna kontekstowe 128K tokenów na H100 może wyczerpać 80GB zanim sekwencja się zakończy. 141GB H200 wydłuża maksymalne okno kontekstowe, które może obsłużyć pojedynczy GPU, o 76 procent, zanim konieczne będzie offloading pamięci. Dla RAG pipelines, przetwarzania dokumentów i agentów konwersacyjnych z długą historią rozmów, oznacza to bezpośrednio dłuższe konteksty bez komplikacji infrastrukturalnych. Gęstość wieloklientowa dzięki większym partycjom MIG. Każda instancja MIG na H200 ma 16,5GB w porównaniu do 10GB na H100. To 65-procentowe zwiększenie na instancję pozwala każdej partycji obsługiwać większe modele inferencyjne. Gdzie na H100 partycja o 10GB obsługuje modele od 3B do 7B, na H200 partycja o 16,5GB obsługuje modele od 7B do 13B na partię. Siedem jednoczesnych instancji modeli 7B na pojedynczym GPU H200 to praktyczna konfiguracja wieloklientowa inference. Szczegóły formatu PCIe NVL. Do 4 GPU połączonych przez mostki NVLink w jednym serwerze. Kompatybilne z chłodzeniem powietrznym przy TDP do 600W, konfigurowalne (w przeciwieństwie do 700W na H200 SXM, które wymaga chłodzenia cieczą). Interfejs PCIe Gen 5 x16. Pasywny radiator wymagający przepływu powietrza w obudowie serwera. Pasuje do tych samych platform serwerowych z kartami A100 PCIe lub H100 PCIe, co czyni go możliwością wymiany typu drop-in. Lenovo, Supermicro, Dell i HPE dokumentują zgodność H200 NVL na istniejących liniach serwerów. Przepustowość ma znaczenie dla szybkości generowania tokenów. Generacja tokenów LLM w autoregresywnym dekodowaniu jest ograniczona przez przepustowość pamięci: każdy nowy token wymaga odczytu całych wag modelu z HBM. Przy 4 800 GB/s w porównaniu do 3 350 GB/s w H100, H200 generuje tokeny około 43 procent szybciej w obciążeniach ograniczonych przepustowością. Benchmarki RunPod potwierdzają, że przekłada się to na rzeczywiste zyski w przepustowości inference od 1,5x do 1,9x w dużych modelach językowych. Decyzja między NVL a SXM dla H200 odzwierciedla linię H100. SXM: TDP 700W, chłodzenie cieczą, płyta bazowa HGX, sieć NVSwitch łącząca 8 GPU po 900 GB/s każdy, zoptymalizowana do rozproszonego treningu. NVL: do 600W, chłodzenie powietrzem, standardowe serwery PCIe, do 4 GPU przez NVLink, zoptymalizowane pod inference i elastyczne wdrożenia. SXM dla klastrów treningowych. NVL dla serwerów inference i modernizacji istniejącej infrastruktury. Te same kontrole eksportowe co H100. Podlegają ograniczeniom USA dotyczącym zaawansowanego sprzętu AI.
H200 NVL odpowiada na konkretne pytanie, które pozostawił wciąż otwarte H100: co się dzieje, gdy 80 GB pamięci VRAM to za mało, ale nie chce się przejść na cenę Blackwell? 141 GB HBM3e o przepustowości 4 800 GB/s na tej samej die Hopper GH100, która zasila H100. Te same 16 896 rdzeni CUDA. Te same 528 czwartego pokolenia Tensor Cores. Ten sam FP8 Transformer Engine o mocy 3 958 TFLOPS. Ten sam MIG, ten sam poufny computing, ten sam stos oprogramowania CUDA. Jedyna zmiana to pamięć: o 76 procent większa pojemność (141 GB wobec 80 GB) na szybszym magistrali HBM3e dostarczającej o 43 procent więcej przepustowości (4 800 wobec 3 350 GB/s). Ta rozbudowa pamięci ma trzy praktyczne skutki. Po pierwsze, modele z 70 miliardami parametrów w FP16 mieszczą się na pojedynczym GPU bez kwantowania. H100 z 80 GB wymaga kwantowania FP8 lub INT8 dla modeli 70 miliardów, co poświęca nieco dokładności. H200 NVL z 141 GB uruchamia je w pełnej precyzji FP16. Po drugie, długie kontekstowe inferencje z dużymi buforami KV skalują się dalej, zanim osiągną limity pamięci. Okna kontekstowe wyczerpujące 80 GB na H100 mają o 76 procent więcej marginesu na H200. Po trzecie, instancje MIG wzrastają z 10 GB do 16,5 GB każda, czyniąc każdą odizolowaną partycję przydatną dla większych modeli inferencyjnych w wielo-najemczej konfiguracji. Nazwa NVL oznacza formfaktor PCIe z obsługą mostka NVLink dla do czterech GPU w jednym serwerze. Kompatybilne z chłodzeniem powietrznym do TDP do 600W. Pasuje do standardowych platform serwerowych, które obecnie obsługują karty A100 lub H100 PCIe. Nie jest wymagana płyta bazowa HGX. To ścieżka rozwoju dla operatorów, którzy chcą pojemności pamięci H200 bez wymiany infrastruktury serwera.
Nasi specjaliści ds. kopania mogą pomóc Ci znaleźć idealny miner dla Twojej konfiguracji i budżetu.
Pierwszy GPU z pamięcią HBM3e. 141 GB przy przepustowości 4 800 GB/s: o 76 procent większa VRAM i o 43 procent szybsza pamięć niż H100 SXM. Ta sama jednostka obliczeniowa Hopper (16 896 rdzeni CUDA, 3 958 TFLOPS FP8 Transformer Engine). Form Factor PCIe z możliwością skalowania do 4 GPU NVLink. Zamiennik w miejsce PCIe H100 i A100. MIG dla 7 instancji po 16,5 GB każda. Pasive chłodzenie powietrzem do 600 W TDP konfigurowalnego. Zaprojektowany do inferencji LLM, gdzie rozmiar modelu i KV cache przekraczają 80 GB na GPU.
Pierwszy GPU z pamięcią HBM3e. Szerokość pasma 4 800 GB/s. Uruchom modele 70 miliardów na pełnej precyzji FP16 na jednym GPU bez kwantyzacji.
Identyczne 16 896 rdzeni CUDA i 3 958 TFLOPS FP8 Transformer Engine jak H100. Ta sama stosowana oprogramowania. Tylko pamięć uległa zmianie.
Pasuje do istniejącej infrastruktury serwerowej. Do 4 GPU za pomocą mostów NVLink. Kompatybilny z chłodzeniem powietrznym. Nie wymaga płyty głównej HGX.
NVIDIA
Kontakt w sprawie ceny
NVIDIA
$4,633.00
NVIDIA
$12,430.00
NVIDIA
Kontakt w sprawie ceny
1,128GB (1,1TB) łącznej pamięci HBM3e. 38 400 GB/s łącznej przepustowości. Ponad 32 petaFLOPS mocy obliczeniowej FP8. 7 200 GB/s przepustowości NVLink w sieci NVSwitch. Całkowita moc systemu DGX H200 wynosi około 8 500W.
SXM: 700W TDP, wymaga płyt głównych HGX i chłodzenia cieczą, NVSwitch łączy 8 GPU z przepustowością 900 GB/s każde, około 18 procent wyższa przepustowość, zoptymalizowane do treningu rozproszonego. NVL: 600W TDP, chłodzenie powietrzem, standardowe serwery PCIe, do 4 GPU przez mosty NVLink bez NVSwitch, zoptymalizowane do inferencji. Oba korzystają z identycznych 141GB HBM3e z przepustowością 4,800 GB/s i tej samej mocy obliczeniowej Hopper.
Ten samy układ GH100, te same rdzenie CUDA, te same Tensor Cores, te same TFLOPS obliczeniowe. H200 zwiększa pamięć z 80 GB HBM3 przy 3 350 GB/s do 141 GB HBM3e przy 4 800 GB/s. Na węzeł: 1,1 TB versus 640 GB, 38 400 versus 26 800 GB/s. Benchmarki NVIDIA wskazują, że przepustowość inferencji Llama2 70B niemal się podwaja na H200 w porównaniu do H100 przy tej samej konfiguracji batching.
Frontier LLM (70B do 175B+ parametrów) podczas treningu z tensor parallelism. Architektury Mixture-of-Experts (Mixtral, DeepSeek V3), w których routing ekspertów korzysta z przepustowości NVSwitch. Inferencja na długi kontekst, gdzie bufor KV wyczerpuje 80 GB pamięci H100. Każde obciążenie, w którym ograniczeniem była pojemność lub przepustowość pamięci H100.
Podstawowa płyta NVIDIA HGX H200 lub system DGX H200. TDP 700W na GPU (5 600W dla 8 GPU) wymaga chłodzenia cieczą w większości konfiguracji. Platformy HGX dostępne od Supermicro, Dell, HPE i Lenovo. DGX H200 to gotowy do użycia system z 8 GPU firmy NVIDIA. Obiekt centrum danych z odpowiednią infrastrukturą zasilania, chłodzenia i sieciową.
NVSwitch zapewnia pełną siatkę łączności GPU typu all-to-all. Każdy GPU komunikuje się z dowolnym innym GPU z prędkością 900 GB/s bez udziału CPU lub PCIe. Synchronizacja gradientów podczas rozproszonego szkolenia kończy się w mikrosekundach, utrzymując narzut poniżej 10 procent czasu obliczeń. Bez NVSwitch, wydajność szkolenia znacznie się pogarsza przy 4 i więcej GPU, ponieważ PCIe o prędkości 128 GB/s nie nadąża za wymogami wymiany gradientów.
B200 przechodzi na architekturę Blackwell z wyższą mocą obliczeniową TFLOPS, nowszą generacją Tensor Core i ulepszeniami architektonicznymi. H200 SXM oferuje sprawdzoną dojrzałość ekosystemu Hopper z ustaloną stabilnością sterowników, wsparciem stosu oprogramowania i wieloletnią dokumentacją wdrożeń produkcyjnych. Do natychmiastowego wdrożenia na sprawdzonym sprzęcie, H200 SXM jest najwłaściwszą opcją. Dla wydajności następnej generacji, platformą przyszłości jest Blackwell.
Do 7 odseparowanych od sprzętu instancji po 16,5 GB każda (w porównaniu do 10 GB w H100 SXM). 65 procent większa pamięć na instancję umożliwia obsługę modeli od 7 miliardów do 13 miliardów danych na partycję MIG. Każda instancja otrzymuje dedykowane rdzenie CUDA, Tensor Cores, pamięć podręczną L2 oraz HBM z wymuszoną izolacją sprzętową.
Tak. Środowisko Trusted Execution Environment (TEE) oparte na sprzęcie chroni dane i wagi modeli podczas przetwarzania na GPU. Konieczne w przypadku wdrożeń AI w środowiskach wymagających zgodności, takich jak opieka zdrowotna (HIPAA), finanse (SOC 2) oraz sektor rządowy (FedRAMP), gdzie ochrona prywatności danych podczas przetwarzania jest obowiązkowa.
Takie same amerykańskie ograniczenia eksportowe jak w przypadku H100. Nie dostępne w Chinach, Hongkongu i Makau. NVIDIA stworzyła warianty o ograniczonej przepustowości dla rynków objętych ograniczeniami. Potwierdź uprawnienia eksportowe z MillionMiner dla miejsca dostawy.