Menyiapkan server AI multi-GPU tidaklah sulit, tetapi mode kegagalan sangat tidak memaafkan dan sebagian besar terjadi sebelum Anda menjalankan beban kerja. Ini adalah urutan pertama saat boot secara praktis: satu langkah yang mengubah segalanya, pengaturan BIOS yang menentukan apakah GPU bahkan muncul, driver dan tumpukan CUDA dalam urutan yang benar, cara memverifikasi bahwa fabric itu asli, dan sejumlah kesalahan kecil yang hampir semua orang lakukan. Ini mencerminkan proses kamiPanduan Pengaturan ASIC Mineruntuk sisi AI dari rak.
Versi singkat
- Pertama, tentukan server mana yang Anda miliki: PCIe multi-GPU (2 sampai 8 kartu, tanpa Fabric Manager) atau SXM / papan dasar HGX (8-GPU, NVSwitch, Fabric Manager wajib).
- Di BIOS, Above 4G Decoding dan Resizable BAR harus diaktifkan atau GPU tidak akan inisialisasi. Atur PCIe ke Gen5 dan boot UEFI.
- Pasang sesuai urutan: OS, kemudian driver nvidia-open, kemudian CUDA Toolkit secara terpisah, lalu Fabric Manager (HGP hanya), lalu Container Toolkit. Verifikasi di setiap langkah.
- Pada sistem NVSwitch apa pun, versi Fabric Manager harus cocok dengan driver secara tepat, atau CUDA akan gagal diluncurkan meskipun setiap GPU terlihat.
- Jalur tercepat bagi kebanyakan tim adalah menggunakan server yang sudah dibangun sebelumnya, telah diuji, dan telah melalui proses burn-in, kemudian didistribusikan ke data centre sehingga daya dan pendingin ditangani.
Pertama, ketahui mesin apa yang Anda miliki

SXM / HGX adalah bentuk padat: delapan GPU H100, H200, atau B200 dipasang pada papan dasar bersama, sepenuhnya terhubung oleh NVLink melalui NVSwitch. Koneksi antar perangkat semua ke semua, skalabilitas mencapai 80 hingga 90 persen, dan papan dasar B200 terbaru dilengkapi pendingin cair dan hanya dikirim dalam bentuk SXM. Masalahnya adalah bahwa Fabric Manager wajib digunakan: itu mengonfigurasi jaringan NVSwitch menjadi satu domain memori, dan tanpa itu GPU terdaftar tetapi CUDA tidak akan menginisialisasi, sesuai dengan NVIDIA.Panduan Pengguna Fabric Manager. Jika Anda masih bingung memilih di antara ini, kami akan membantu Anda.Perbandingan H100 vs H200 vs B200dan yangPanduan Pemilih GPUungkapkan keputusan perangkat keras; panduan ini mengasumsikan bahwa kotak sudah ada di meja Anda.
Sebelum Anda menghidupkan daya
- Pengiriman daya.Sebuah node 8-GPU menarik daya lebih dari 10 kW, sehingga memerlukan rangkaian yang sesuai: 208 hingga 240V, sering kali tiga fase, dengan PSU redundan yang memiliki kapasitas di atas menarik puncak, bukan saat puncaknya. Setiap GPU dual-slot membutuhkan konektor daya PCIe yang terpasang sendiri, bukan kabel rantai.
- Siapkan daya menyala.Node padat memiliki lonjakan besar saat mulai. Nyalakan server pada sirkuit yang dapat menyerapnya daripada yang dibagikan dengan beban hidup lainnya, atau Anda akan memutuskan pemutus sirkuit saat boot pertama.
- Pendingin dan aliran udara.Kartu blower membuang udara keluar dari bagian belakang dan harus ditempatkan dalam chassis tertutup dengan aliran udara dari depan ke belakang. Kartu open-air memerlukan ruang yang cukup. Baseboard SXM dan B200 perlu dihubungkan dan mengalirkan loop cairan sebelum beban diterapkan. Menata ruangan dengan baik adalah topik tersendiri, terkait dengandaya yang membuat situs AI menjadi layak. Saat menyuplai lebih dari 10 kW dan pendinginan yang sesuai tidak praktis di lokasi,hosting GPU AI, atau colocazione, menyerahkan masalah tersebut kepada fasilitas yang dibangun untuknya.
- Siapkan semuanya dua kali.Pasang kembali setiap GPU, setiap kabel daya, dan kabel motherboard. Kartu yang menonjol 1 mm dari slot adalah kartu yang tidak akan muncul di nvidia-smi.
Pengaturan BIOS yang menentukan keberhasilannya
- Dekoding di atas 4G: ON.Tidak dapat dinegosiasikan untuk multi-GPU. Tanpa itu, sistem tidak dapat memetakan jendela memori besar yang digunakan GPU, dan GPU akan gagal untuk inisialisasi atau tidak muncul sama sekali.
- Resizable BAR: Aktif.Pasangan dengan Decoding 4G di atas dan diperlukan untuk pemetaan memori GPU yang benar pada kartu modern.
- Kecepatan link PCIe: Gen5.Paksa itu daripada membiarkannya dalam Mode Otomatis, yang terkadang menegosiasikan turun dan diam-diam membagi setengah bandwidth Anda ke setiap kartu.
- Mode boot: UEFI, CSM dinonaktifkan.Mode kompatibilitas legacy mengganggu pemetaan BAR besar dan inisialisasi GPU modern.
- IOMMU dan ACS: aktif, jika Anda akan melakukan virtualisasi.Dibutuhkan untuk passthrough VFIO dan partisi multi-tenant. Tidak perlu diaktifkan untuk satu kotak bare-metal untuk menghindari beban performa yang kecil.
- Profil yang sensitif terhadap kinerja / latensiJika vendor Anda mengaktifkan mode performa maksimal atau sensitif terhadap latensi, aktifkan mode tersebut, dan nonaktifkan deep C-states untuk memastikan throughput yang konsisten.
Susunan perangkat lunak, secara berurutan

2. Driver NVIDIA.Pasang driver kernel terbuka. Pada B200 diperlukan varian terbuka; untuk semua lainnya, ini adalah jalur yang direkomendasikan untuk GPU data-center.
sudo apt install nvidia-open # lalu: sudo update-initramfs -u && sudo reboot
Setelah memulai ulang,nvidia-smiharus mencantumkan setiap GPU. Perlu dicatat bahwa versi CUDA yang ditampilkan di sana adalah versi tertinggi yang didukung oleh driver, bukan toolkit yang terinstal.
3. CUDA Toolkit, secara terpisah.Pengemudi saja tidak menyediakan nvcc atau perpustakaan CUDA. Instal toolkit yang sesuai dengan pengemudi dan kerangka kerja Anda menggunakan NVIDIA'sDokumentasi CUDAdan matriks versinya. Hindari paket meta cuda-drivers yang bersifat umum jika Anda ingin menjaga modul kernel terbuka tetap utuh.
nvcc --version # Pastikan toolkit terpasang dan cocok
4. Manajer Fabric, hanya HGX.Pada semua motherboard NVSwitch, instal Fabric Manager pada versi yang cocok secara tepat dengan driver, lalu aktifkan dan mulai layanan tersebut. Lewati langkah ini sama sekali pada sistem PCIe, di mana fitur ini tidak diperlukan maupun diinginkan.
5. NVIDIA Container Toolkit.Jika Anda menjalankan beban kerja di Docker, yang paling banyak dilakukan oleh tim, instal Container Toolkit sehingga wadah melihat GPU, lalu tarik gambar kerangka kerja dari NGC yang sudah menyertakan CUDA, cuDNN, dan runtime.
Siap Memulai Penambangan?
Pengiriman DDP gratis seluruh dunia. Hosting profesional mulai dari $0.055/kWh.
Periksa kain sebelum Anda mempercayainya
Konfirmasi pendaftaran fabric (HGX).Pada sistem NVSwitch, pastikan bahwa GPU telah selesai mendaftar dengan fabric. Segala sesuatu selain Completed / Success berarti CUDA tidak akan berjalan dengan benar.
nvidia-smi -q -i 0 | grep -A 2 Fabric # ingin: State: Completed, Status: Success
Baca topologi.Perintah ini menunjukkan bagaimana setiap GPU terhubung ke setiap GPU lainnya, selain affinitas CPU dan NUMA yang Anda perlukan untuk penempatan. entri NV# adalah NVLink, PXB adalah jembatan PCIe, SYS melintasi soket CPU.
nvidia-smi topo -m
Periksa NVLinks.Pastikan tidak ada tautan yang tidak aktif atau menimbulkan kesalahan.
nvidia-smi nvlink -s
Hormati afinitas NUMA.Pada server dengan dual-socket, beban kerja yang dipasang ke socket yang salah akan mengalami penalti bandwidth nyata. Gunakan kolom affinity dari nvidia-smi topo -m untuk menetapkan proses dan memori agar terikat pada socket yang lokal ke GPU mereka.
Ukur bandwidth nyata.Jalankan pengujian NCCL standar untuk memastikan bahwa Anda mendapatkan bandwidth GPU-ke-GPU yang asli, bukan fabric yang mengalami penurunan performa, menggunakan NVIDIA'sDokumentasi NCCL.
Kegagalan yang hampir selalu dialami oleh hampir semua orang
- Di atas 4G / Resizable BAR berhenti.GPU hilang dari nvidia-smi atau gagal untuk diinisialisasi. Penyebab tunggal yang paling umum.
- Manajer Fabrikasi hilang pada kotak NVSwitch.Setiap GPU terlihat, tetapi CUDA tidak akan berjalan. Masalah pasti Matthew. (Dan jangan pernah menginstalnya di kotak PCIe.)
- Versi Fabric Manager tidak cocok dengan driver.Kegagalan inisialisasi CUDA yang rumit dan NVLink yang hilang. Kedua versi harus identik.
- Varian driver yang salah.B200 memerlukan driver terbuka; jalur khusus tidak akan menghidupkannya.
- Meta paket cuda-drivers.Ini dapat memuat modul yang dapat merusak tumpukan kernel terbuka. Instal driver dan toolkit sebagai bagian terpisah yang cocok.
- Daya listrik PCIe atau jalur PCIe.Sebuah konektor yang tidak terpasang atau kartu di slot yang kekurangan jalur akan muncul sebagai GPU yang hilang atau berkinerja rendah.
Buktikan di bawah beban, lalu jalankan sesuatu
- Pantau thermals dan daya secara langsung. Siarkan suhu GPU, pemanfaatan, dan konsumsi daya saat Anda menjalankan beban kerja pada mesin. nvidia-smi dmon -s pucm # daya langsung, pemanfaatan, kecepatan, memori
- Tetapkan batas daya yang masuk akal. Pada node yang padat, membatasi daya per GPU dapat meningkatkan stabilitas dan total throughput. Tetapkan dan konfirmasi batas tersebut daripada mengasumsikan bahwa default cocok dengan rangkaian listrik Anda.
- sudo nvidia-smi -pl <watt>
- Kenakannya. Jalankan beban yang berkelanjutan (pengujian burn-in GPU dan tes NCCL all-reduce) cukup lama untuk mencapai keadaan tetap termal, dan perhatikan throttling atau kesalahan link.
- Pertama inferensi nyata. Luncurkan sebuah wadah dan layani sebuah model, atau jalankan pengujian awal pelatihan terdistribusi singkat. Jika kapasitas pemrosesan meningkat secara kasar dengan jumlah GPU, maka fabric berfungsi dengan baik. Periksa secara menyeluruh angka-angka tersebut terhadap data yang adaUji kinerja GPU dan AIjadi Anda tahu seperti apa tampilan yang baik untuk kartu Anda.
Rute tercepat yang diambil kebanyakan tim

Setengah lain dari pintasan tersebut adalah tempat di mana itu berjalan. Server yang dikonfigurasi masih membutuhkan lebih dari 10 kW per rak, pendinginan, dan tingkat daya yang menentukan apakah ekonomi tersebut layak, yang tepatnya adalahpower moat mengemudi pivot AI miner publikIni adalah kasus untukHosting GPU AI (koleksi)men-deploy ke dalamhosting profesionaldengan biaya $0,07 hingga $0,08 per kWh, dengan manajemen jarak jauh, berarti node dipasang di rak, diberdayai, didinginkan, dan dipantau tanpa Anda harus berada di Rechenzentrum. Jika Anda menimbang prosesornya sendiri, thePerbandingan NVIDIA vs AMD vs Intelmenutupi pertukaran itu.
Kesimpulan utama
Lakukan itu dan sebuah Node 8-GPU akan beralih dari rack ke inferensi pertama dalam satu sore. Lewati satu langkah dan Anda akan menghabiskan sore itu membaca kode kesalahan CUDA. Jika Anda lebih memilih kotak itu sudah dikonfigurasikan dan diuji sebelumnya, mulai dengan kamiServer GPU, atau miliki merekaditempatkan ke dalam hostingjadi daya dan pendinginan adalah pekerjaan orang lain.
Pertanyaan yang Sering Diajukan
Hanya pada sistem berbasis NVSwitch, yaitu HGX dan DGX dengan motherboard 8-GPU yang dilengkapi GPU H100, H200, atau B200. Di sana, Fabric Manager wajib digunakan: mengonfigurasi fabric NVSwitch, dan tanpa itu CUDA tidak akan menginisialisasi meskipun setiap GPU muncul di nvidia-smi. Pada server PCIe multi-GPU (2 hingga 8 kartu di slot), Fabric Manager sama sekali tidak digunakan. Versi-nya harus cocok secara tepat dengan driver yang terinstal.
Mengapa kartu GPU saya tidak muncul di nvidia-smi?
Penyebab yang paling umum adalah BIOS: Above 4G Decoding atau Resizable BAR yang dinonaktifkan, sehingga sistem tidak dapat memetakan memori GPU dan kartu gagal inisialisasi. Aktifkan keduanya, atur PCIe ke Gen5, dan boot dalam mode UEFI dengan CSM dinonaktifkan. Penyebab lain adalah konektor daya PCIe yang tidak terpasang dengan benar, kartu yang tidak sepenuhnya terpasang di slot-nya, atau GPU di slot yang kekurangan jalur. Pasang kembali perangkat keras dan periksa pengaturan firmware terlebih dahulu.
Driver yang harus Anda instal untuk server AI tergantung pada perangkat keras yang digunakan. Berikut adalah panduan umum: 1. GPU NVIDIA: Instal driver NVIDIA terbaru yang kompatibel dengan GPU Anda dari situs resmi NVIDIA. 2. GPU AMD: Instal driver AMD Radeon atau AMD Radeon PRO terbaru dari situs resmi AMD. 3. CPU dan chipset: Pastikan driver chipset yang sesuai dari pabrikan CPU dan motherboard. 4. Perangkat lainnya: Instal driver perangkat tambahan sesuai kebutuhan, seperti kartu jaringan, penyimpanan, dan lain-lain. Sebaiknya kunjungi situs resmi produsen perangkat keras Anda dan unduh driver yang paling baru dan sesuai dengan model perangkat yang digunakan.
Pasang driver kernel terbuka NVIDIA (nvidia-open) untuk GPU data-centre; pada B200 varian terbuka diperlukan. Pasang CUDA Toolkit secara terpisah dan cocok dengan driver, daripada menggunakan paket meta cuda-drivers yang umum, yang dapat merusak tumpukan modul kernel terbuka. Verifikasi dengan nvidia-smi untuk driver dan nvcc --version untuk toolkit, dan pilih versi CUDA serta framework secara bersamaan dari matriks dukungan NVIDIA.
Bagaimana cara memverifikasi NVLink dan topologi GPU?
Jalankan nvidia-smi topo -m untuk melihat bagaimana setiap GPU terhubung ke yang lain dan ke CPU, di mana entri NV adalah NVLink, PXB adalah PCIe bridge, dan SYS melintasi socket. Ini juga menunjukkan afinitas CPU dan NUMA untuk penempatan. Gunakan nvidia-smi nvlink -s untuk mengonfirmasi bahwa tidak ada link yang tidak aktif atau dalam kesalahan, dan pada sistem HGX periksa nvidia-smi -q untuk status Fabric yang Completed. Kemudian jalankan tes NCCL untuk mengukur bandwidth nyata.
Pengaturan BIOS apa yang diperlukan untuk server dengan banyak GPU?
Aktifkan Decoding Di Atas 4G dan Resizable BAR, keduanya diperlukan untuk pemetaan memori multi-GPU. Paksa PCIe ke Gen5 bukan Auto. Boot dalam UEFI dengan CSM dinonaktifkan. Aktifkan IOMMU dan ACS hanya jika Anda berencana untuk virtualisasi atau partisi GPU, dan aktifkan profil kinerja maksimal atau sensitif terhadap latensi dengan pengurangan deep C-states untuk throughput yang konsisten. Pengaturan firmware ini memutuskan apakah GPU bahkan muncul sebelum driver terlibat.
Berapa banyak daya dan pendinginan yang dibutuhkan oleh server 8-GPU?
Sebuah Node Miner 8-GPU yang padat menarik daya lebih dari 10 kW, sehingga memerlukan sirkuit 208 sampai 240V, sering kali tiga fase, dengan PSU cadangan yang berukuran di atas daya puncak dan rencana untuk lonjakan daya saat dinyalakan. Kartu blower membutuhkan aliran udara dari depan ke belakang dalam chassis tertutup; SXM dan B200 baseboard memerlukan loop cairan yang terhubung. Karena daya dan pendinginan per rak dengan kerapatan ini sulit disediakan secara langsung di lokasi, banyak operator menempatkan perangkat mereka ke dalam layanan hosting profesional.
Apa perbedaan antara server GPU PCIe dan SXM (HGX)?
Server PCIe menampung 2 hingga 8 GPU di slot ekspansi yang berkomunikasi melalui pasangan jembatan PCIe atau NVLink, tidak memerlukan Fabric Manager, dan dapat diskalakan sekitar 60 hingga 80 persen. Server SXM/HGX memasang 8 GPU pada papan dasar bersama yang sepenuhnya terhubung melalui NVLink via NVSwitch, memerlukan Fabric Manager, memiliki skalabilitas 80 hingga 90 persen, dan pada generasi B200 telah menggunakan pendinginan cair dan hanya SXM. Proses pengaturan berbeda terutama pada langkah Fabric Manager dan kebutuhan pendinginan.
Bisakah saya mengatur server AI multi-GPU sendiri, atau sebaiknya membelinya dalam kondisi jadi?
Anda dapat melakukannya sendiri; proses ini adalah urutan pengaturan BIOS yang terdefinisi, driver dan tumpukan CUDA dari bawah ke atas, serta verifikasi fabric. Tetapi pencocokan versi dan jebakan firmware membuatnya mudah kehilangan satu hari, sehingga banyak tim membeli server yang sudah dipasang, diuji, dan dijalankan, kemudian menempatkannya ke dalam hosting di mana daya dan pendinginan ditangani. Sistem yang sudah dipasang menghilangkan pekerjaan terkait kompatibilitas, pengiriman daya, dan kestabilan; hosting mengurangi masalah fasilitas.
Apa sistem operasi terbaik untuk server AI multi-GPU?
Ubuntu Server LTS adalah pilihan standar dan menjadi target utama driver NVIDIA serta tumpukan CUDA, dengan dukungan kerangka kerja dan wadah terluas. Pasang, pastikan sistem dapat masuk ke shell dan memiliki jaringan, lalu lapiskan driver NVIDIA, CUDA Toolkit, Fabric Manager jika diperlukan, dan Container Toolkit di atasnya. Selalu konfirmasi kombinasi OS, driver, CUDA, dan kerangka kerja tertentu sesuai dengan matriks dukungan vendor sebelum melakukan komitmen terhadap build produksi.
Sumber dan kredit gambar
Prosedur teknis yang didasarkan pada dokumentasi NVIDIA's CUDA Toolkit, panduan pengguna Fabric Manager, dokumentasi driver data-center, dan dokumentasi NCCL. Foto hero dari superkomputer Sierra GPU oleh Departemen Energi AS (domain publik) dan foto rig multi-GPU oleh BluberdeBlubBlub (CC BY 4.0), keduanya melalui Wikimedia Commons, dipotong dan dikoreksi warna untuk MillionMiner. Diagram: grafik asli MillionMiner. Periksa versi OS, driver, CUDA, dan kerangka kerja yang sesuai dengan Matriks dukungan vendor saat ini sebelum membangun proses produksi.

