Sebuah perusahaan rintisan menyewa delapan H100 cloud untuk melayani satu model yang telah disesuaikan, kemudian menyaksikan tagihan melebihi empat puluh ribu dolar dalam satu kuartal untuk beban kerja yang seharusnya dijalankan oleh satu server milik sendiri dengan biaya yang jauh lebih rendah. Kesalahannya bukan pada perangkat keras. Itu adalah memilih node terbesar dari menu alih-alih yang benar-benar dibutuhkan oleh pekerjaan tersebut. Server AI di sini dinilai berdasarkan fungsi mereka, sama seperti GPU: berdasarkan pekerjaan yang mereka dirancang untuk lakukan, bukan berdasarkan harga mentahnya.
Sebuah server AI bukanlah PC yang lebih besar. Itu adalah delapan GPU yang terhubung melalui fabric switch sehingga mereka berperilaku sebagai satu mesin, dibungkus dalam CPU, memori, penyimpanan, dan jaringan yang membuat mereka tetap berjalan. Panduan ini merangking delapan yang terbaik
Server AIAnda sebenarnya dapat membeli pada tahun 2026, mulai dari sebuah simpul inferensi kecil hingga rak dengan 72 GPU, lengkap dengan spesifikasi dan penggunaan masing-masing pilihan. Jika Anda memilih kartu individu daripada sebuah simpul lengkap, panduan kami untuk the
GPU terbaik untuk pelatihan AIadalah pendamping untuk yang ini.
Jawaban singkat
- Inferensi dan tim kecil:server PCIe L40S. Cukup untuk layanan dan tuning ringan, tanpa daya listrik data centre.
- Pelatihan nilai: sebuah DGX A100.Mature, terhubung NVLink, dan masih menjadi tolok ukur biaya per jalannya.
- Standar Pelatihan Perusahaan: sebuah HGX H100 (8x H100). Node pelatihan serius bawaan.
- Memori terbatas dan konteks panjang:sebuah HGX H200 (8x H200, 1,1 TB). Memori yang lebih besar, masalah sharding yang lebih sedikit.
- Skala Frontier:sebuah HGX B200, atau rak GB200 NVL72 ketika satu node tidak cukup.
- Aturan di bawah ini:cocokkan terlebih dahulu tingkat server dengan beban kerja. Membeli lebih banyak node daripada yang diperlukan pekerjaan adalah cara tercepat untuk membuang-buang anggaran AI.
Apa yang menjadikan sebuah server sebagai server AI?
Kata server melakukan banyak penyembunyian di sini. Sebuah server web adalah satu CPU yang melakukan banyak pekerjaan kecil. Sebuah server AI adalah kebalikannya: delapan GPU terkuat yang dibuat, melakukan satu pekerjaan besar bersama-sama. Yang mengubah delapan kartu menjadi satu mesin adalah penghubung, dan itu adalah spesifikasi yang membedakan server AI sejati dari sebuah kotak dengan GPU yang dipasang.
Ketika GPU melatih bersama mereka menyelaraskan diri pada setiap langkah, dan kecepatan tautan tersebut menentukan apakah GPU kedelapan menambah throughput atau hanya menghasilkan panas. NVLink dan NVSwitch menghubungkan GPU data-centre dengan kecepatan 900 GB/s ke atas, jauh melampaui jalur PCIe yang digunakan oleh desktop. Di sekitar mereka terdapat dua CPU, hingga empat terabyte RAM,
penyimpanan NVMe cepat, dan InfiniBand 400 Gb/s. Jika Anda memasang kartu sendiri, panduan kami untuk
mengatur server AI multi-GPUmenutupinya.
Server AI terbaik tahun 2026, sekilas
Berikut adalah setiap server dalam satu tampilan, disusun dari node entry hingga skala rak. Bacalah kolom memori dan daya terlebih dahulu: kedua angka tersebut menentukan sebanyak nama GPU.
| Server | GPU
| Total memori
| Konektivitas
| Kekuatan
| Terbaik untuk
|
|---|
Peladen GPU PCIe ASUS
| 4 hingga 8x L40S
| hingga 384 GB
| PCIe Gen5
| ~3 sampai 4 kW
| Inferensi, tim kecil
|
Server GPU AMD EPYC
| 8x MI300X
| 1,5 TB
| Infinity Fabric
| ~10 kW
| ROCm, memori yang berat
|
NVIDIA DGX A100
| 8x A100 80GB
| 640 GB
| NVLink + NVSwitch
| ~6,5 kW
| Pelatihan Nilai
|
Gigabyte HGX H100
| 8x H100 80GB
| 640 GB
| NVLink 4
| ~10,2 kW
| Pelatihan perusahaan
|
Dell PowerEdge XE9680
| 8x H100 80GB
| 640 GB
| NVLink + NVSwitch
| ~10 kW
| OEM Kunci Selesai
|
Lenovo HGX H200
| 8x H200 141GB
| 1,1 TB
| NVLink 4
| ~10 kW
| Memori panjang, konteks panjang
|
Gigabyte HGX B200
| 8x B200 180GB
| 1,44 TB
| NVLink 5
| ~14,3 kW
| Pelatihan Frontier
|
NVIDIA GB200 NVL72
| 72x B200 + Grace
| ~13,5 TB
| Domain NVLink 72
| ~120 kW/rak
| Pekerjaan terbesar
|
Server AI terbaik untuk 2026, peringkat
Delapan sistem, mulai dari node yang melayani model pertama Anda hingga rak yang melatih frontier satu, masing-masing ditempatkan sesuai dengan beban kerja nyata daripada berdasarkan harga stiker.
1. ASUS PCIe GPU Server: titik masuk inference
4 hingga 8x L40S 48GB · hingga 384 GB · PCIe Gen5 · ~3 hingga 4 kWNode awal yang masuk akal. The
Server GPU ASUS PCIePaket kartu L40S untuk menangani pelayanan model, pekerjaan diffusi, dan penyempurnaan LoRA ringan tanpa daya, kebisingan, atau harga dari sistem SXM. Dengan hingga 384 GB memori ECC dan PCIe standar, ini adalah server AI paling dapat dioperasikan untuk tim yang membutuhkan inferensi lebih dari throughput pelatihan. Batasan utamanya adalah interkoneksi: PCIe cukup untuk inferensi tetapi membatasi skala pelatihan multi-GPU. Untuk pelayanan dan penyempurnaan model kecil dengan anggaran terbatas, ini adalah server pertama yang tepat, dan lebih mudah dipasang dan didinginkan daripada apa pun di bawahnya.
2. AMD EPYC GPU Server: alternatif yang kaya memori
8x Instinct MI300X · 1,5 TB HBM3 · Infinity Fabric · ~10 kWSatu node non-NVIDIA yang patut diperhatikan dengan serius. Yang
Server GPU AMD EPYCmenjalankan delapan kartu Instinct MI300X dengan 192 GB masing-masing, sehingga sebuah node tunggal menyimpan 1,5 TB HBM3, lebih banyak per node daripada sistem NVIDIA dengan 8 GPU mana pun. Untuk inferensi pada model yang sangat besar dan tim yang siap ROCm, keunggulan memori ini sering kali menjadi faktor penentu. Eksploitasi utama adalah kejenuhan perangkat lunak: CUDA masih memiliki alat yang lebih lengkap dan dukungan kerangka kerja yang lebih luas, jadi MI300X menghargai tim yang siap ROCm dan membuat frustrasi yang lainnya. Di tempat ia cocok, ini adalah juara memori dalam daftar, dan ia berdampingan dengan NVIDIA dalam rangkaian kami
GPU AI.
3. NVIDIA DGX A100: kendaraan kerja bernilai
8x A100 80GB · 640 GB HBM2e · NVLink + NVSwitch · ~6,5 kWLebih tua dari Hopper dan Blackwell, tetapi masih merupakan pembelian paling cerdas untuk bagian besar dari pelatihan nyata. The
NVIDIA DGX A100menggabungkan delapan A100 yang terhubung NVLink dengan tumpukan perangkat lunak paling matang di bidang AI dan cocok untuk penyempurnaan QLoRA dari model 70B dengan nyaman. Pada pekerjaan kecil, seringkali menang dalam hal biaya per jalankan yang selesai, karena node yang lebih baru tidak pernah mengisi Tensor Cores-nya untuk pekerjaan tersebut. Ini mengorbankan FP8 dan bandwidth Hopper, sehingga pelatihan FP8 besar dilakukan di node H100 di bawah. Untuk pelatihan nilai dan tim yang menginginkan platform terbukti dengan titik masuk yang lebih rendah, DGX A100 adalah tolok ukur yang diukurkan terhadap semuanya.
4. Gigabyte HGX H100: standar pelatihan perusahaan
8x H100 80GB · 640 GB HBM3 · NVLink 4, 900 GB/s · ~10,2 kWNode bawaan untuk pelatihan serius, dan yang menjadi basis sebagian besar klaster. The
Server Gigabyte HGX H100memberikan Anda delapan Hopper GPU dengan FP8 Transformer Engine dan NVLink 4, sekitar tiga kali lebih efisien biaya dibandingkan node A100 pada menjalankan FP8 besar. Ketika memori dan skalabilitas multi-GPU sama pentingnya, ini adalah standar industri. Catatannya adalah kejenuhan dan biaya: pada jalur kecil, A100 lebih murah, dan memiliki sebuah node adalah komitmen bernilai enam digit yang diperoleh dari jalur panjang lebih dari 30B. Beli dalam bentuk HGX untuk harga, atau dalam bentuk turnkey di bawah ini untuk dukungan.
5. Dell PowerEdge XE9680: node perusahaan siap pakai
8x H100 80GB · 640 GB HBM3 · NVLink + NVSwitch · ~10 kWDelapan H100 yang sama, dikirim sebagai produk perusahaan yang sepenuhnya terintegrasi untuk tim yang menginginkan dukungan vendor daripada unit dasar.
Dell PowerEdge XE9680dengan garansi dan platform yang sudah diverifikasi sebelumnya. Untuk sebuah perusahaan yang sedang membangun kapasitas AI serius pertamanya, kontrak dukungan tersebut seringkali bernilai lebih dari selisih harga. Anda membayar premi OEM di atas kotak HGX dasar, sehingga pembangun anggaran lebih memilih HGX sementara TI perusahaan cenderung memilih solusi jadi. GPU dan batas kemampuan adalah sama; perbedaannya adalah siapa yang Anda hubungi ketika sebuah node bermasalah pada pukul 2 pagi.
6. Lenovo HGX H200: memori maksimum untuk konteks panjang
8x H200 141GB · 1,1 TB HBM3e · NVLink 4 · sekitar 10 kWSebuah node H100 dengan transplantasi memori.
Lenovo HGX H200membawa 141 GB HBM3e yang lebih cepat per kartu, 1,1 TB di seluruh node, dan memori tersebut bukan sekadar fleksibilitas dalam lembar spesifikasi. Ini sering memungkinkan Anda melewati langkah sharding pada pelatihan konteks panjang dan batch besar, yang dapat mengungguli node H100 dari segi biaya per jalankan selesai meskipun harganya lebih tinggi. Ini berbagi mesin komputasi Hopper, sehingga throughput per kartu cocok dengan H100; yang menarik adalah memorinya. Perbandingan generasi lengkap ada di dalam
Perincian H100 vs H200 vs B200.
7. Gigabyte HGX B200: node pelatihan frontier
8x B200 180GB · 1,44 TB HBM3e · NVLink 5, 1,8 TB/s · ~14,3 kWKelas mesin yang berbeda. Yang
Gigabyte HGX B200Mengemas delapan Blackwell B200 dengan 1,44 TB HBM3e, NVLink 5 pada 1,8 TB/s, dan dukungan FP4, memberikan pelatihan sekitar 2,2 kali lebih cepat dibandingkan node H100. Untuk pra-pelatihan dan penyempurnaan skala besar, ini adalah standar terbaru saat ini. Mengonsumsi sekitar 14,3 kW dan membutuhkan pendinginan serta pasokan listrik yang sesuai, sehingga ini adalah node data-centre. Untuk pekerjaan yang tidak sebesar pekerjaan terbesar sekalipun, ini berlebihan, tetapi ketika pekerjaan mencapai ukuran terbesar yang mungkin, ini adalah nodenya.
8. NVIDIA GB200 NVL72: superkomputer skala rak yang unggul
72x B200 + 36 CPU Grace · ~13,5 TB HBM3e · domain NVLink dari 72 · ~120 kW/rakJika sebuah node tunggal tidak cukup, batasannya adalah satu rak penuh yang berfungsi sebagai satu GPU. The
NVIDIA GB200 NVL72menghubungkan 72 GPU Blackwell dan 36 CPU Grace ke dalam satu domain NVLink, didinginkan cairan, dengan daya sekitar 120 kW per rak. Ini adalah mesin yang digunakan oleh frontier labs untuk model terbesar, dan keputusan fasilitas sama pentingnya dengan keputusan perangkat keras. Tidak ada yang membeli ini secara tidak sengaja. Perlu pendinginan cairan, pengiriman daya yang serius, dan fasilitas Rechenzentrum yang dibangun untuk kepadatan tersebut. Untuk tingkatan itu, pembicaraan kurang tentang kotak dan lebih tentang di mana ia dijalankan.
Siap Memulai Penambangan?
Pengiriman DDP gratis seluruh dunia. Hosting profesional mulai dari $0.055/kWh.
Bagaimana Anda memilih server AI yang tepat?
Potong melalui nama model dan keputusannya adalah tangga pendek. Mulailah dari beban kerja, dan tingkat server akan keluar dari situ. Urutan untuk menanganinya selalu sama, dan melewati sebuah langkah adalah cara tim melakukan pembelian berlebihan:
- Sebutkan beban kerja.Inferensi, penyetelan halus, atau pelatihan awal penuh. Ini saja sudah menghilangkan sebagian besar daftar tersebut.
- Ukurlah memori.Jumlah memori node menentukan apakah sebuah Model cocok tanpa sharding, yang seringkali lebih penting daripada kecepatan mentah.
- Periksa koneksi antar perangkat.PCIe cocok untuk inferensi; pelatihan multi-GPU membutuhkan NVLink dan NVSwitch.
- Cocokkan daya dan pendinginan.Sebuah node 14 kW adalah keputusan fasilitas, bukan keputusan kantor. Bersikap jujur tentang tempat di mana itu akan dijalankan.
- Putuskan untuk membeli, menyewa, atau menghostingPenggunaan, bukan harga stiker, yang menentukan keputusan ini.
Haruskah Anda membeli, menyewa, atau meng-host server AI?
Keputusan terakhir bergantung pada tingkat keberhasilan server. Penyewaan cocok untuk beban puncak, jangka pendek, atau jalur yang sangat besar, di mana memiliki Node bernilai enam digit yang digunakan dua kali sebulan tidak masuk akal. Untuk inferensi rutin dan fine-tuning yang dilakukan hampir setiap hari, kepemilikan lebih unggul, karena tarif per jam cloud dengan cepat menumpuk. Metrik yang digunakan adalah biaya per menjalankan yang selesai, bukan tarif per jam.
Ada jalur ketiga yang diabaikan: miliki server dan tempatkan di fasilitas. Membeli sebuah node dan menjalankannya dengan daya dari data center yang didinginkan secara profesional dan biaya rendah menangkap ekonomi kepemilikan tanpa panas, kebisingan, dan konsumsi daya dari rig pelatihan di kantor Anda, dan ini sering kali menjadi opsi nyata termurah untuk server yang berjalan terus menerus. Itulah model di balik kemampuan MillionMiner untuk
hosting perangkat keras GPU pada daya pusat data, dan ada baiknya melakukan pemodelan terhadap cloud murni sebelum Anda memutuskan salah satu.
Bagaimana MillionMiner cocok
MillionMiner menyediakan berbagai jenis server dalam panduan ini, sistem HGX dan DGX dari OEM utama, sebagai node yang dikonfigurasi dengan GPU, penyimpanan, dan jaringan sesuai kebutuhan beban kerja Anda, dan dapat menampungnya di fasilitas yang diatur di AS yang sama yang menjalankan operasi Bitcoin-nya. Jika Anda membandingkan sistem, yang
Alat benchmark GPU dan AImenampilkan kinerja nyata di seluruh 78 GPU dan 48 server, serta panduan ke arah
GPU yang menjalankan modelmenutupi sisi inferensi. Tawaran ini sederhana: node yang tepat untuk pekerjaan tersebut, dikonfigurasi sesuai pesanan, dikirim ke mana saja, dan(optional) dihosting pada daya murah. Spesifikasi bangunan atau dapatkan penawaran lengkap melalui
perangkat keras AI perusahaantim, biasanya dalam satu hari.
Kesimpulan utama
Startup yang menyewa delapan H100 tidak salah tentang perangkat kerasnya, hanya tentang ukuran pekerjaan. Server AI memberi ganjaran pada pencocokan tier dengan beban kerja: sebuah node PCIe untuk inferensi, DGX A100 atau HGX H100 untuk pelatihan nyata, H200 ketika memori menjadi hambatan, dan Blackwell hanya ketika pekerjaan tersebut berskala frontier. Sebutkan beban kerja terlebih dahulu, dan server hampir secara otomatis terpilih sendiri. Ini adalah konten informasional, bukan nasihat keuangan. Mulai a
Bangun bersama timKetika Anda mengetahui beban kerja.
Pertanyaan yang Sering Diajukan
Apa itu server AI?
Sebuah server AI adalah sistem yang dibangun di sekitar beberapa GPU, biasanya delapan, yang terhubung melalui koneksi berkecepatan tinggi seperti NVLink dan NVSwitch sehingga mereka bekerja sebagai satu mesin, dengan CPU server, hingga empat terabyte RAM, penyimpanan NVMe cepat, dan jaringan berkecepatan tinggi di sekitarnya. Koneksi ini yang membedakannya dari desktop dengan GPU tambahan.
Apa perbedaan antara HGX dan DGX?
HGX adalah papan dasar GPU delapan milik NVIDIA yang dibangun ke dalam server mereka sendiri oleh OEM seperti Gigabyte dan Supermicro, yang memberi Anda pilihan dan biasanya harga yang lebih baik. DGX adalah sistem yang sepenuhnya terintegrasi, teruji, dan didukung oleh NVIDIA sendiri, opsi turnkey yang harganya lebih mahal tetapi langsung berfungsi. GPU di bawahnya sama; perbedaannya adalah integrasi dan dukungan.
Berapa banyak GPU yang terdapat dalam sebuah server AI?
Standarnya adalah delapan GPU per node, terhubung melalui fabric NVSwitch sehingga mereka berkembang sebagai satu mesin. Server PCIe mungkin memuat empat hingga delapan kartu, sementara sistem skala rak seperti GB200 NVL72 menghubungkan 72 GPU ke dalam satu domain NVLink. Delapan adalah jumlah yang menjadi dasar pembuatan node pelatihan HGX dan DGX.
Berapa biaya server AI pada tahun 2026?
Harga bervariasi secara luas tergantung tingkatnya: sebuah node inference PCIe adalah pilihan terjangkau untuk pemula, sebuah node H100 atau H200 delapan-GPU bisa mencapai angka enam digit, dan GB200 NVL72 adalah investasi tingkat fasilitas. Karena harga bergantung pada konfigurasi dan bergerak sesuai pasokan, sebagian besar perangkat keras AI perusahaan dikutip per pembangunan, biasanya dalam waktu satu hari.
Berapa banyak daya yang digunakan oleh server AI?
Sebuah node PCIe L40S mengonsumsi sekitar tiga hingga empat kilowatt, sebuah node H100 atau H200 sekitar sepuluh, sebuah node HGX B200 sekitar 14,3, dan rak GB200 NVL72 mendekati 120. Daya dan pendinginan mengikuti skala dengan GPU, itulah sebabnya node yang lebih besar adalah perangkat keras pusat data, bukan perangkat kantor.
Server AI terbaik untuk pelatihan bergantung pada kebutuhan spesifik Anda, termasuk beratnya model yang akan dilatih, anggaran, dan skala operasional. Secara umum, berikut adalah beberapa pilihan yang dianggap optimal untuk pelatihan AI:
1. NVIDIA DGX Series: Dikenal karena kekuatan komputasi tinggi dan optimalisasi AI, termasuk model DGX H100 dan DGX A100.
2. Google TPU: Cocok untuk pelatihan model besar, terutama yang dioptimalkan untuk TensorFlow.
3. Amazon EC2 P4 and P5 Instances: Menawarkan GPU kelas atas yang cocok untuk pelatihan AI skala besar.
4. Microsoft Azure ND Series: Menyediakan GPU canggih untuk pelatihan model machine learning besar.
5. Custom Server dengan GPU NVIDIA Tesla atau A100: Dapat diatur sesuai kebutuhan spesifik dan skala bisnis Anda.
Sebelum memilih, pertimbangkan faktor berikut:
- Kebutuhan kecepatan dan kapasitas proses.
- Skalabilitas jangka panjang.
- Anggaran dan biaya operasional.
- Dukungan perangkat lunak dan kompatibilitas dengan framework yang Anda gunakan.
Untuk rekomendasi yang lebih spesifik dan sesuai kebutuhan, disarankan untuk berkonsultasi langsung dengan penyedia layanan data center atau vendor perangkat keras yang berpengalaman dalam solusi AI.
Untuk pelatihan perusahaan yang serius, node HGX H100 dengan delapan GPU adalah standar, dengan H200 lebih disukai ketika memori dan konteks panjang penting. Untuk pra-pelatihan frontier, tier-nya adalah HGX B200 atau rak GB200 NVL72. Untuk pelatihan nilai dan pekerjaan QLoRA, DGX A100 tetap memberikan biaya terbaik per jalankan selesai pada banyak pekerjaan.
Apakah saya memerlukan server AI atau cukup GPU saja?
Tergantung pada skala. Untuk inferensi satu kartu atau penyempurnaan pertama, GPU individu dalam sebuah workstation sudah cukup. Setelah Anda membutuhkan pelatihan multiple GPU secara bersamaan, fabric NVLink dan NVSwitch dari sebuah server nyata menjadi faktor penentu, karena interkoneksi tersebut memungkinkan kartu-kartu tersebut berkembang sebagai satu mesin alih-alih bekerja sebagai kepulauan terpisah.
Apakah server AMD MI300X merupakan alternatif yang baik?
Ya, untuk tim yang tepat. Sebuah node MI300X delapan-GPU menyimpan 1,5 TB memori, lebih dari sistem NVIDIA delapan-GPU mana pun, yang merupakan keuntungan nyata untuk inferensi model yang sangat besar. Kendalanya adalah perangkat lunak: CUDA masih memiliki alat yang lebih lengkap dan dukungan kerangka kerja yang lebih luas, jadi MI300X menguntungkan tim yang stack-nya sudah siap ROCm dan mengecewakan mereka yang belum.
Haruskah saya membeli atau menyewa server AI?
Sewa untuk pelatihan yang tajam, singkat, atau sangat besar di mana sebuah Miner dengan enam digit akan menganggur. Beli untuk inferensi yang stabil dan penyempurnaan yang berlangsung sebagian besar hari, di mana tarif per jam cloud akan lebih cepat bertambah daripada kepemilikan. Ada jalur ketiga yang sering diabaikan: miliki minim dan hosting di daya pusat data berbiaya rendah, yang sering mengalahkan keduanya untuk sebuah server yang berjalan terus menerus.
Apa itu GB200 NVL72?
Ini adalah sistem skala rak yang menghubungkan 72 GPU Blackwell B200 dan 36 CPU Grace menjadi satu domain NVLink, sehingga sebuah rak berpendingin cairan berperilaku seperti satu GPU yang sangat besar. Dengan daya sekitar 120 kilowatt, ini adalah apa yang digunakan oleh frontier labs untuk melatih model terbesar, dan penggunaannya merupakan keputusan fasilitas sekaligus keputusan pembelian.
Sumber dan catatan: konfigurasi server dan spesifikasi tahun 2026 disusun dari dokumentasi produk NVIDIA dan OEM (Dell, Lenovo, Gigabyte, ASUS) serta data perangkat keras data centre saat ini; angka-angka ini bersifat perkiraan dan dapat berubah dengan rilis dan konfigurasi baru. Gambar kartu adalah foto produk MillionMiner; gambar utama adalah foto dari FDA AS (domain publik), berkwalitas; diagram merupakan grafik asli dari MillionMiner. Ini adalah konten informatif, bukan nasihat keuangan; biaya dan penggunaan bervariasi tergantung pada beban kerja dan penggelaran.