Supermicro
Model: AS-8126GS-NB3RT
Platforma Supermicro 8U A+ dla płyty głównej NVIDIA HGX B300 NVL8: osiem GPU Blackwell Ultra B300 SXM z 288 GB HBM3e każde, łączących 2,3 TB pamięci GPU na węzeł za pomocą piątej generacji NVLink i NVSwitch, z portami… sieciowymi o przepustowości 800 Gb/s zintegrowanymi bezpośrednio na płycie głównej. Podwójne procesory AMD EPYC serii 9005 lub 9004, do 6 TB DDR5 6400, osiem zatok NVMe E1.S oraz sześć zasilaczy Titanium 6600W zapewniają jej zasilanie. Węzeł inferencyjny do uczenia i wnioskowania, podany i wysyłany na całym świecie DDP przez MillionMiner.
Zamów Wycenę Serwera
Opowiedz nam o swoich potrzebach dotyczących obciążenia i wdrożenia. Nasz specjalista odpowie w ciągu 24 godzin drogą e-mailową, WhatsApp lub telefonicznie.
Dlaczego ten serwer jest wyceniany na zamówienie
Te serwery są konfigurowane i wyceniane na zamówienie. Twój wybór dotyczący konfiguracji, przechowywania, sieci, gwarancji oraz integracji z rackiem decyduje o ostatecznej cenie, a miejsce dostawy ustala koszty wysyłki i celne. Wypełnij poniższy formularz, a nasz specjalista odpowie w ciągu 24 godzin, przekazując pełną wycenę obejmującą sprzęt, gwarancję oraz dostawę DDP na cały świat.
Dziękujemy! Nasz specjalista odpowie w ciągu 24 godzin z Twoją spersonalizowaną wyceną.
Ceny i dostępność zmieniają się wraz z rynkiem. Potwierdzamy oba z Państwem, zanim zamówienie stanie się wiążące. Sprawdź cenę i dostępność
Jak działa Twój proces zamawiania serwera
Złóż formularz
Udostępnij szczegóły dotyczące podziału zadań i wdrożenia
Uzyskaj wycenę
Kompleksowa wycena w ciągu 24 godzin
Recenzja z specjalistą
Zakończ konfigurację i dostawę
Dostawa
Wysłano i gotowe do wdrożenia
Prawdziwe
Przetestowane urządzenia
Na świecie
Globalne wysyłki
Wsparcie
Eksperci ds. kopania
Platforma Supermicro 8U A+ dla płyty głównej NVIDIA HGX B300 NVL8: osiem GPU Blackwell Ultra B300 SXM z 288 GB HBM3e każde, łączących 2,3 TB pamięci GPU na węzeł za pomocą piątej generacji NVLink i NVSwitch, z portami… sieciowymi o przepustowości 800 Gb/s zintegrowanymi bezpośrednio na płycie głównej. Podwójne procesory AMD EPYC serii 9005 lub 9004, do 6 TB DDR5 6400, osiem zatok NVMe E1.S oraz sześć zasilaczy Titanium 6600W zapewniają jej zasilanie. Węzeł inferencyjny do uczenia i wnioskowania, podany i wysyłany na całym świecie DDP przez MillionMiner.
Cennik, czas realizacji i opcje hostingu. Osobista porada od naszego zespołu sprzedaży.
Cennik, czas realizacji i opcje hostingu. Osobista porada od naszego zespołu sprzedaży.
Blackwell Ultra to pierwsza generacja GPU zaprojektowana po tym, jak branża dowiedziała się, ile kosztują modele reasoningowe w zakresie obsługi. B200 odpowiedział na pytanie dotyczące treningu; B300 odpowiada na pytanie dotyczące epoki inferencji, które nastąpiło po nim, a zmiany są konkretne, a nie kosmetyczne. Ta platforma Supermicro A+ to węzeł z 8 GPU w tej zmianie. Kompleks GPU. Ośmiu NVIDIA Blackwell Ultra B300 SXM GPU montuje się na podstawce HGX B300 NVL8, z każdą zawierającą 288GB HBM3e, o 60 procent więcej niż B200, łącząc 2 304GB w obrębie węzła. Piąta generacja NVLink łączy każde GPU z prędkością 1,8 TB/s poprzez NVSwitch w pełnej siatce. NVIDIA ocenia gęstą przepustowość FP4… B300 na 1,5-krotność B200, co skupia się dokładnie tam, gdzie żyje obsługa o dużej objętości, a mikro-tensoryczny skalowanie Transformer Engine drugiej generacji jest tym, co pozwala inwencji czterobitowej osiągnąć dokładność produkcyjną. Przepustowość pamięci na GPU pozostaje w klasie 8 TB/s; głównym atutem jest pojemność, ponieważ to ona jest pierwsza wyczerpywana przez obciążenia reasoningowe. Dlaczego pojemność definiuje erę reasoningu. Model, który myśli przed odpowiedzią, generuje wewnętrzne tokeny, a każdy z nich zajmuje KV cache przez cały czas trwania odpowiedzi. Długie ścieżki reasoningowe, rozszerzone okna kontekstowe i obsługa wysokiej równoczesności mnożą ten ślad razem. Na mniejszych węzłach efekt to offloading, zanik rozmiaru wsadu lub oba jednocześnie, a marginesy obsługi spadają z nimi. Węzeł o pojemności 2,3TB przechowuje wagi na poziomie frontiera i cache, które generują jednocześnie, co stanowi różnicę między modelem, który mieści się w pamięci, a wdrożeniem, które przynosi zyski. Zintegrowany fabric, a co zmienia w obudowie. Podstawka HGX B300 NVL8 posiada własną sieć: osiem portów OSFP o prędkości 800 Gb/s, po jednym na GPU, dwukrotnie szybciej niż w poprzedniej generacji adapterów add-in. Dlatego też specyfikacja pokazuje tylko dwie rozbudowane sloty PCIe 5.0, podczas gdy systemy klasy B200 miały ich dwanaście; dwanaście slotów służyło do mocowania NIC, a te NIC teraz znajdują się na podstawce. W przypadku wdrożeń wielowęzłowych, konsekwencją jest czystsza budowa, szybszy fabric i topologia GPUDirect RDMA gwarantowana z założenia, a nie montowana na zamówienie. Pozostałe dwa sloty obsługują magazynowanie i sieć zarządzania. Host Supermicro. Dualne procesory AMD EPYC 9005 lub 9004, do 192 rdzeni na gniazdo w przypadku serii 9005, obsługują preprocessing, tokenizację i ładowanie danych, które wymagają ośmiu GPU tej klasy. Dwudziestoczteroelementowe moduły DDR5 o prędkości 6400 MT/s zapełniają jeden na kanał w dwanaście kanałów na procesor i skalują do 6TB, zapewniając pełną przepustowość, siedząc daleko powyżej puli GPU, co jest zasadą rozmiaru, której uczy ten katalog, z miejscem na zapas. Ośmiu frontowych gniazd NVMe E1.S hot-swap trzyma dane na węźle, a sześć zasilaczy Titanium o mocy 6600W w redundancji określa zakres mocy, który jest jednoznaczny co do tego, czym jest to urządzenie: maszyną data center na szczycie klasy pojedynczego węzła z chłodzeniem powietrznym. Decyzja przeciwko HGX B200 w tym katalogu. Węzeł Gigabyte B200 oferuje 1,4TB i tę samą generację NVLink, a dla programów treningowych i flot obsługujących w ramach tego zakresu pamięci pozostaje rozsądnym wyborem Blackwell. B300 zyskuje swoje miejsce w trzech sytuacjach: flotach reasoningowych i inferencyjnych o długim kontekście, gdzie głębokość KV cache decyduje o rozmiarze wsadu i tym samym o ekonomii jednostki, wdrożeniach obsługujących modele na poziomie frontier, które przekraczają 1,4TB, oraz operatorach standaryzujących zintegrowany fabric 800G dla rozwoju wielowęzłowego. Poniżej tych progów, zwycięża B200 pod względem ekonomicznym; na nich, B300 jest jedynym węzłem, który się mieści. Decyzja przeciwko rularnej skali. Nad tym urządzeniem znajdują się systemy klasy GB200 i GB300, gdzie 72 GPU dzielą jeden domen NVLink pod chłodzeniem cieczy i inżynierią obiektu, aby sprostać temu. Granica pozostaje bez zmian: jeśli trening równoległy naprawdę potrzebuje więcej niż ośmiu GPU w jednym spójnym domenie, odpowiedzią jest skala rackowa. Dla wszystkiego, co mieści osiem GPU Blackwell Ultra, w tym obsługę największych wdrożonych modeli, to węzeł dostarcza generację bez projektu obiektu i skaluje się na zewnątrz przez wbudowany fabric 800G. Zgodność eksportowa i zamówienia. Akceleratory klasy Blackwell podlegają amerykańskim regulacjom eksportowym, a MillionMiner potwierdza kwalifikowalność celowości wysyłki jako część każdej oferty. Każdy system jest konfigurowany na zamówienie, testowany i wysyłany na cały świat DDP, z obsługą ceł i opłat celnych. Planowanie wdrożeń i hosting w własnych data center MillionMiner jest dostępny dla zespołów, które wolą nie prowadzić zasilania racka na miejscu na taką skalę.
Ekonomia inferencji zmieniła się, gdy modele zaczęły wnioskować. Odpowiedź typu chain-of-thought spala od dziesięciu do stu razy więcej tokenów niż bezpośrednia odpowiedź, każdy ślad rozumowania inflacja bufor VK, a obsługa tego zyskownie przestała być problemem obliczeniowym, a stała się problemem pamięci i precyzji. Blackwell Ultra to bezpośrednia odpowiedź NVIDIA, a ta platforma Supermicro to 8-GPU, w które jest wbudowana. Odpowiedź dotycząca pamięci to 288GB HBM3e na GPU, o 60 procent więcej niż 180GB w B200, łącząc 2,3TB w cały węzeł. Ta… rezerwa to ta siła, która utrzymuje frontierowe modele wraz z długimi buforami KV generowanymi przez ślady rozumowania i rozszerzone okna kontekstowe, bez offloadingu, który zabija opóźnienia serwowania. Odpowiedź dotycząca precyzji: NVIDIA ocenia gęsty FP4 w B300 na 1,5 raza więcej niż w B200, przepustowość celowana w wysokowydajny inference, gdzie czteroBitowe serwowanie z mikro-tensorowym skalowaniem utrzymuje dokładność i zmniejsza koszty na token. Odpowiedź związana z fabricem: płyta główna HGX B300 NVL8 bezpośrednio integruje osiem portów OSFP 800 Gb/s, po jednym na GPU przy dwukrotnie wyższej przepustowości niż poprzednia generacja, co sprawia, że ten chassis potrzebuje tylko dwóch slotów PCIe na rozbudowę, podczas gdy systemy B200 wymagały dwunastu. Sieć klastrów nie jest już dodatkiem, jest częścią kompleksu GPU. Hoster Supermicro zachowuje proporcje. Dualne procesory AMD EPYC 9005 lub 9004 osiągają 192 rdzenie na gniazdo dla pipeline'ów intensywnych w preprocessing, dwadzieścia cztery moduły DDR5 o prędkości 6400 MT/s skalują do 6TB, znacznie powyżej 2,3TB puli GPU, a osiem frontowych uchwytów NVMe E1.S do hot-swapów przechowują dane lokalnie. Sześć zasilaczy Titanium o mocy 6600W w redundantnym układzie zapewnia bezpieczną operację. Cytowane na konfigurację i wysyłane na całym świecie DDP przez MillionMiner.
Nasi specjaliści ds. kopania mogą pomóc Ci znaleźć idealny miner dla Twojej konfiguracji i budżetu.
Największa pojedyncza pamięć w tym katalogu: osiem GPU NVIDIA Blackwell Ultra B300 SXM o pojemności 288 GB HBM3e każde, 2,3 TB na węzeł, połączonych piątą generacją NVLink z prędkością 1,8 TB/s na GPU poprzez NVSwitch. NVIDIA ocenia gęste FP4 B300 jako 1,5 raza wydajniejsze od B200, a płyta bazowa HGX B300 NVL8 integruje własną fabricę o przepustowości 800 Gb/s, osiem portów OSFP, więc klastrowanie nie wymaga kart dodatkowych. Supermicro umieszcza je na platformie z dwoma procesorami AMD EPYC 9005 lub 9004, z do 6TB DDR5 6400, osiem zatok E1.S… NVMe oraz sześcioma zasilaczami Titanium o mocy 6600W w obudowie 8U. Cytowane i wysyłane na całym świecie DDP przez MillionMiner.
Osiem GPU Blackwell Ultra B300 SXM po 288 GB każda, o 60 procent więcej niż B200. Cache KV do wag Frontier i skali rozumowania pasują do siebie.
NVIDIA wycenia gęsty FP4 na 1,5-krotność B200. Obsługa łańcucha, długi kontekst i wysokie równoczesne zapytania to cechy, za które ta węzłowa cena jest adekwatna.
Osiem zintegrowanych portów OSFP o przepustowości 800 Gb/s, po jednym na GPU. Klasteryzacja jest wbudowana, a sieć działa z dwukrotną prędkością poprzedniej.
HGX B300 NVL8 jest 8-GPU'owym blokiem budulcowym NVIDIA Blackwell Ultra: osiem GPU B300 SXM, tkanina NVSwitch łącząca je z przepustowością 1,8 TB/s każda oraz zintegrowane porty sieciowe o przepustowości 800 Gb/s, dostarczane producentom takim jak Supermicro. W porównaniu do B200, pamięć wzrasta o 60 procent do 288 GB HBM3e na GPU, NVIDIA ocenia gęstą przepustowość FP4 na 1,5 razy wyższą, a porty tkaniny podwajają się do 800 Gb/s, przenosząc się na podstawową płytę.
2 304 GB połączonego HBM3e na osiem GPU, piątej generacji NVLink z przepustowością 1,8 TB/s na GPU przez NVSwitch, gęstą przepustowością FP4 według NVIDIA na poziomie 1,5 raza wyższym niż HGX B200, oraz osiem zintegrowanych portów fabric o przepustowości 800 Gb/s. W ujęciu obciążeniowym: modele na skalę frontier obsługują pełną rezerwę KV cache, modele liczące setki miliardów parametrów fine-tune'ują w pełnej precyzji na jednym węźle, a zespoły rozumujące obsługują rozmiary partii, które mniejsze pule pamięci nie mogą pomieścić.
Ponieważ mnożą liczbę tokenów. Model, który Reasoning przed odpowiedzią generuje wewnętrzne łańcuchy myślowe, z których każdy token zajmuje bufor KV przez cały czas trwania odpowiedzi, a długie konteksty i wysoka równoległość jeszcze bardziej zwiększają ten rozmiar. Gdy pamięć podręczna wyczerpie pamięć GPU, obsługa opiera się na offloadingu lub mniejszych partiach, a ekonomika jednostkowa maleje wraz z tym. 288GB na GPU w modelu B300 służy do jednoczesnego przechowywania wag i buforów na skalę reasoning, a jego gęsty uplift FP4 obniża koszt każdego z tych dodatkowych tokenów.
Trzy sytuacje. Floty wnioskowania obsługujące zadania o długim kontekście lub z rozumowaniem, gdzie głębokość pamięci podręcznej KV ustala rozmiar partii i margines. Modele, które przekraczają 1,4 TB węzła B200. I operatorzy standardizujący na zintegrowanej infrastrukturze 800G do wzrostu wielo-węzłowego. Programy treningowe i floty obsługujące komfortowo wewnątrz 1,4 TB zwykle lepiej obsługiwane przez system Gigabyte HGX B200, a modele MillionMiner zarówno w ofercie.
Ponieważ sieć przeniosła się na płytę główną GPU. Systemy klasy B200 wyposażone były w kilkanaście slotów głównie po to, aby pomieścić jeden adapter o przepustowości 400 Gb/s na GPU; HGX B300 NVL8 integruje bezpośrednio osiem portów OSFP o przepustowości 800 Gb/s, dzięki czemu topologia GPUDirect RDMA z jednym portem na GPU jest wbudowana z dwukrotną prędkością. Dwa pozostałe sloty PCIe 5.0 obsługują pamięć masową i zarządzanie siecią, co jest wszystkim, co można jeszcze dodać.
Podwójne procesory AMD EPYC 9005 lub 9004 serii, osiągające 192 rdzenie na gniazdo w linii 9005, z dwudziestoma czterema modułami DDR5 o prędkości 6400 MT/s, z jednym modułem na kanał dla pełnej przepustowości i skalowania do 6TB, co jest znacznie powyżej 2,3TB puli GPU. Pamięć masowa działa na osiemch hot-swap bay’ach NVMe E1.S z przodu do lokalnych zestawów danych. Proporcje odpowiadają zasadom rozmiarowania, które są nauczane w pozostałej części tego katalogu, z marginesem.
Granica to domena NVLink. Ten węzeł łączy osiem GPU w jeden spójny fabric na infrastrukturze gotowej do deploymentu na miejscu; systemy na skalę racka łączą 72 GPU pod chłodzeniem cieczy i projektem inżynieryjnym obiektu. Jeśli równoległość treningu faktycznie wymaga więcej niż ośmiu GPU w jednej domenie, odpowiedzią jest skalowanie rackowe. Do obsługi nawet największych wdrożonych modeli oraz do treningu, który mieści osiem GPU Blackwell Ultra, ten węzeł dostarcza generację bez zobowiązań związanych z obiektem i rozkłada się na zewnątrz wzdłuż swojej zintegrowanej sieci fabric o przepustowości 800G.
Na własnej strukturze podstawki: osiem portów OSFP o przepustowości 800 Gb/s, po jednym na GPU, obsługujących GPUDirect RDMA, dzięki czemu gradienty i aktywacje przemieszczają się pomiędzy węzłami bez angażowania CPU. Topologia, którą systemy z epoki B200 montowały z kart rozszerzeń, jest tu wliczona w zamysł. MillionMiner doradza przy architekturze switcha i sieci, gdy wdrożenie przekracza jedną maszynę.
Sześć redundantnych zasilaczy Titanium o mocy 6600W wyznacza granice, co czyni ten system najwyższym w klasie pojedynczych węzłów przenośnych powietrzem i jednoznacznie zalicza go do obszaru data centre. MillionMiner potwierdza dokładne zużycie energii i plan termiczny Twojej wybranej konfiguracji podczas wyceny, a hosting w własnych obiektach MillionMiner jest dostępny dla zespołów, które wolą nie zapewniać zasilania szafy na taką skalę.
Prześlij szczegóły dotyczące obciążenia, skalowania oraz wdrożenia za pomocą formularza wyceny. Specjalista MillionMiner potwierdza konfigurację, uprawnienia do dostawy według amerykańskich przepisów eksportowych obowiązujących dla akceleratorów klasy Blackwell oraz plan dostawy. Każdy system jest testowany przed wysyłką i dostarczany na cały świat w systemie DDP, z obsługą ceł i formalności celnych. Wsparcie w integracji racków oraz wdrożenie w środowisku hostowanym są dostępne.