Million Miner Logo
Comparisons · 19 dengan membaca minimal · Jul 06, 2026 · Diperbarui Aug 11, 2026

H100 vs H200 vs B200: Perbandingan GPU Data-Center NVIDIA (2026)

Mike Okonkwo

Hardware Review Editor

H100 vs H200 vs B200: Perbandingan GPU Data-Center NVIDIA (2026)
Wei menjalankan infrastruktur untuk sebuah tim yang melayanimodel dengan 70 miliar parameter, dan dia memiliki anggaran untuk salah satu dari tiga GPU. Pada lembar spesifikasi, H200 dan H100 terlihat hampir identik, B200 tampak seperti tingkat yang berbeda, dan harga tidak sesuai dengan jarak angka-angkanya. Pertanyaan sebenarnya bukanlah mana yang paling cepat. Tetapi mana dari ketiganya yang benar-benar cocok dengan modelnya, pekerjaan, dan daya yang dapat disediakan oleh bangunannya. Salah menilai itu, Anda bisa saja membayar berlebihan untuk ruang cadang yang tidak pernah digunakan atau membeli kartu yang sama sekali tidak mampu menjalankan model Anda.

Itu adalah cara jujur untuk membacaKeputusan antara H100, H200, dan B200Dua dari kartu ini berbagi sebuah chip dan hanya berbeda pada memori. Yang ketiga adalah lompatan arsitektur asli yang juga mengubah tampilan data centre Anda. Panduan ini merinci spesifikasi yang penting, di mana masing-masing kartu unggul, berapa harganya, dan satu kendala yang paling sering dilupakan oleh pembeli saat menganggarkan.

Versi singkat

  • TheH100 dan H200berbagi hopper die yang sama, sehingga komputasi mereka identik. Keunggulan H200 hanya pada memori: 141 GB dengan 4,8 TB/dt dibandingkan 80 GB dengan 3,35 TB/dt.
  • Memori tersebut bernilai sekitar8 hingga 12 persen untuk pelatihan tetapi 25 hingga 35 persen pada inferensi terbatas memori dari model 70B dan yang lebih besar. Untuk inferensi, H200 adalah pilihan yang jelas dari keduanya.
  • TheB200 adalah arsitektur baru (Blackwell), bukan penyegaran memori: 192 GB, sekitar 8 TB/s, native FP4, dan kira-kira 4x throughput pelatihan H100.
  • Intinya adalah daya dan panas. H100 dan H200 adalahPending pendingdan mendorong rak melampaui 120 kW. Lonjakan fasilitas tersebut sering kali menjadi faktor penentu yang sebenarnya.


Tiga GPU sekilas

Sebelum analisis, angka ditampilkan berdampingan. Setiap angka di bawah ini adalah nilai padat (non-spare) dari brief produk NVIDIA dan tarif pasar tahun 2026. Perlakukan pengganda kinerja sebagai petunjuk arah dan bandingkan beban kerja Anda sendiri sebelum mengalokasikan anggaran.
The full spec sheet. Notice that H100 and H200 differ only in the memory rows. The B200 changes almost every line.
Dua pola yang mencolok. Pertama, baris H100 dan H200 identik kecuali untuk memori dan bandwidth, karena keduanya menggunakan silikon yang sama. Kedua, B200 bukanlah langkah bertahap; itu adalah chip yang berbeda dengan format presisi yang berbeda dan kebutuhan pendinginan yang berbeda. Kedua fakta tersebut menjadi dasar seluruh keputusan.

H100 dan H200: chip yang sama, memori yang berbeda

Ini adalah bagian yang membingungkan pembeli, sehingga layak untuk dijelaskan secara terbuka. H200 menggunakan die GH100 yang sama persis dengan H100. Tensor Cores yang sama, throughput FP16 dan FP8 yang sama, clock yang sama. Jika Anda meletakkan H100 dan H200 berdampingan untuk tugas yang bergantung pada komputasi, keduanya akan selesai pada waktu yang sama.

Apa yang diubah NVIDIA adalah memorinya. H100 memiliki 80 GB HBM3 dengan kecepatan 3,35 TB/s. H200 memiliki 141 GB HBM3e dengan kecepatan 4,8 TB/s, yang merupakan 1,76 kali kapasitas dan sekitar 1,4 kali bandwidth-nya. Tidak ada perubahan lain.

Perubahan tunggal ini sangat berpengaruh untuk satu pekerjaan tertentu: melayani model besar. Generasi teks terbatas oleh bandwidth memori, karena GPU harus membaca seluruh bobot model untuk setiap token yang dihasilkan. Lebih banyak bandwidth berarti lebih banyak token per detik, dan kapasitasan yang lebih besar berarti model dapat muat tanpa tumpah. NVIDIA melaporkan bahwa H200 menghasilkan hingga 1,9 kali throughput inference H100 pada Llama 2 70B, dan dalam praktiknya Anda akan melihat peningkatan 25 hingga 35 persen pada model terbatas memori di kisaran 70B ke atas. Untuk pelatihan, di mana bottleneck biasanya adalah komputasi bukan memori, perangkat keras yang sama memberikan peningkatan yang lebih modest sebesar 8 hingga 12 persen.
Ada juga tebing kapasitas tersembunyi di balik angka-angka tersebut. Model 70B dalam FP16 membutuhkan sekitar 140 GB memori untuk bobotnya saja. Itu cocok pada satu H200 (141 GB) tetapi tidak pada satu H100 (80 GB), di mana Anda akan membutuhkan dua kartu dan overhead interkoneksi yang menyertainya. Jika model Anda berada di rentang tersebut, H200 bukanlah sedikit lebih cepat, melainkan perbedaan antara satu GPU dan dua GPU.

B200 adalah makhluk yang berbeda

Di mana H200 adalah peningkatan memori pada chip lama, B200 adalah arsitektur baru sepenuhnya. NVIDIA mencapai batas reticle dengan Hopper, proses lithografi die terbesar yang dapat dicetak, sehingga Blackwell mengemas dua die dalam satu modul, terhubung dengan kecepatan 10 TB/s, dan memperlakukannya sebagai GPU koheren tunggal. Hasilnya adalah 208 miliar transistor, lebih dari 2,5 kali lipat H100.

Spesifikasi yang mengikuti dari itu:
  • Memori.192 GB HBM3e sekitar 8 TB/s. Itu 2,4 kali kapasitas dan bandwidth H100, dan memungkinkan satu B200 menampung model yang sebelumnya membutuhkan dua atau tiga H100.
  • Presisi FP4.Tensor Core generasi kelima Blackwell menambahkan titik angka berjalan empat-bit secara native. FP4 mengurangi jejak memori dibandingkan FP8 dan, dikombinasikan dengan bandwidth, mendukung klaim utama NVIDIA tentang sekitar 4 kali lipat throughput inferensi H100. Model sebesar 70B dalam FP4 menyusut menjadi sekitar 35 GB, yang meninggalkan sebagian besar kartu bebas untuk konteks dan batch.
  • NVLink 5,0.1,8 TB/s per GPU, dua kali lipat Hopper yang 900 GB/s, yang menjadi penting saat Anda meningkatkan skala di atas satu kartu.
Ekonomi mengikuti throughput. Dalam skala besar, kombinasi FP4 dan bandwidth dari B200 dapat secara dramatis mengurangi biaya per token; perkiraan independen menempatkannya mendekati pengurangan 7x dibandingkan H100 meskipun tarif per jam yang lebih tinggi, karena peningkatan throughput mengungguli premi harga. Itulah alasan utama untuk Blackwell: bukan karena itu lebih cepat secara abstrak, tetapi karena lebih murah per token saat Anda melayani volume tinggi.

Lompatan generasi dari H100 ke B200 adalah yang terbesar yang pernah dikirim NVIDIA di segmen data centre, dan itu terfokus pada tiga hal yang membatasi inference LLM: kapasitas memori, bandwidth, dan throughput presisi rendah.
· Analisis platform NVIDIA B200, 2026


Pelatihan versus inferensi: di mana masing-masing menang

Kartu GPU yang tepat lebih bergantung pada bagian mana dari beban kerja AI yang Anda jalankan, daripada merek atau tingkatnya.

Untuk inferensi,aturan memori. Melayani sebuah model adalah bandwidth-bound, jadi peringkatnya jelas: B200 pertama dengan selisih besar, H200 kedua, H100 ketiga. Jika Anda menjalankan 70B atau lebih besar di produksi dan peduli dengan biaya per token, jalur FP4 dari B200 berada dalam kelas yang berbeda, dan H200 adalah pilihan Hopper-generasi yang masuk akal saat 141 GB cukup dan Anda menginginkan perangkat lunak yang matang.

Untuk pelatihan,masalah komputasi lebih penting dan celah-celah menjadi lebih rapat. H100 dan H200 dilatih dengan kecepatan yang sama karena keduanya berbagi die. B200 menghasilkan sekitar 4 kali throughput pelatihan H100 pada model transformator berkat FP8 dan FP4 mixed precision, jadi untuk pelatihan besar yang baru, pilihan yang jelas adalah ini, tetapi beban kerja pelatihan atau HPC yang sensitif terhadap biaya berjalan dengan baik pada H100 yang lebih murah dan tersedia. Pola umum pada tahun 2026 adalah armada hybrid: Blackwell untuk inferensi produksi di mana peningkatan throughput membayar dirinya sendiri, Hopper untuk pelatihan dan tugas latar belakang.

Siap Memulai Penambangan?

Pengiriman DDP gratis seluruh dunia. Hosting profesional mulai dari $0.055/kWh.

Pendakian pendinginan yang tidak pernah Anda anggarkan

Berikut adalah batasan yang secara diam-diam menentukan lebih banyak pembelian ini daripada tolok ukur mana pun. Sistem H100 dan H200 keduanya mengkonsumsi 700 watt dan dirancang untuk berjalan dengan pendingin udara. Sistem DGX dan HGX Hopper dikirim dengan pendinginan udara, dengan nyaman ditempatkan di rak 20 hingga 45 kW yang sudah dapat ditangani oleh fasilitas biasa, dengan penukar panas di pintu belakang untuk ruang cadangan.

B200 mengkonsumsi 1.000 watt, lonjakan sebesar 43 persen, dan itu mengubah segalanya di hilir. Rak B200 yang padat mendorong jauh melebihi kemampuan udara untuk menghilangkan panas, dan pada skala rak konfigurasi GB200 NVL72 mencapai 120 kW atau lebih dan memerlukan pendinginan cairan langsung ke chip tanpa opsi udara saja. Dalam prakteknya, itu berarti adanya loop air fasilitas, unit distribusi pendingin, dan beban lantai yang sebagian besar bangunan tidak pernah dirancang untuk menampung.

Versi jujur dari keputusan B200 bukanlah "Apakah saya mampu membeli GPU." Melainkan "Apakah saya mampu membangun infrastruktur yang dibutuhkan oleh GPU tersebut." Sebuah B200 yang tidak bisa didinginkan lebih lambat daripada H200 yang bisa. Untuk siapa saja yang melakukan deploy di tempat, ini adalah garis antara peningkatan perangkat keras dan proyek konstruksi, itulah sebabnya begitu banyak kapasitas Blackwell digunakan di cloud atau fasilitas yang sudah mengatasi masalah daya dan pendinginan.


Berapa harganya: beli versus sewa

Harga stiker bergerak secara konstan, tetapi bentuk 2026 tetap stabil. Kartu H100 dan H200 baru masuk dengan kisaran kasar $25.000 hingga $40.000 tergantung pada faktor bentuk dan volume, dengan modul H100 SXM bekas diperdagangkan jauh lebih rendah karena pembeli beralih ke perangkat keras yang lebih baru. B200 berada di sekitar $30.000 hingga $40.000 baru, dan Blackwell Ultra B300, dengan 288 GB dan 1.400 watt, beroperasi lebih tinggi dan tiba pada paruh pertama tahun 2026.

Menyewa menceritakan kisah yang lebih bersih bagi sebagian besar tim. Pada pertengahan 2026, sewa cloud H100 sekitar $2 hingga $3 per GPU-jam, H200 sedikit di atasnya, dan B200 sekitar $5 hingga $6 sesuai permintaan, dengan tarif spot menurun di dekat $2. Karena perangkat keras B200 pemesanan jauh ke tahun, akses cloud sering kali menjadi satu-satunya jalan cepat menuju Blackwell sama sekali. Aturan umum: menyewa saat beban kerja Anda puncak atau saat Anda masih memilih perangkat keras, dan membeli saat utilisasi cukup tinggi sehingga kepemilikan lebih menguntungkan daripada meteran per jam, yang untuk kartu yang sering digunakan biasanya dalam beberapa bulan.

Jadi, yang mana yang harus Anda beli?

Tanyakan tiga pertanyaan secara berurutan dan jawaban akan keluar.
The buy decision in three cards. The cooling requirement at the bottom is the one that turns a GPU choice into a facility choice.
  • Seberapa besar model Anda?Di bawah 70B, H100 sudah cukup. Pada 70B dalam FP16, Anda membutuhkan 141 GB dari H200 atau 192 GB dari B200 agar tetap satu kartu. Di atas 100B dengan presisi penuh, B200 adalah opsi GPU tunggal yang praktis.
  • Pelatihan atau inferensi?Pelatihan berbasis komputasi berjalan dengan baik pada H100 atau H200. Inferensi berbasis memori dalam skala besar adalah di mana H200 dan terutama B200 mendapatkan nilai tambah mereka.
  • Bisakah situs Anda didinginkan?Jika Anda memiliki rak berpendingin udara dan tidak menggunakan loop cair, pilihan yang realistis adalah H100 atau H200. B200 hanya cocok jika Anda dapat menyediakan pendinginan cair dan daya yang mendukungnya.
    Catatan singkat tentang tetangga. B100 adalah bagian Blackwell berdaya rendah yang dirancang untuk dimasukkan ke dalam sistem HGX H100 yang ada, sebagai jalur peningkatan yang lebih lembut. GB200 NVL72 memadukan 72 Miner B200 dengan CPU Grace secara skala rak untuk deployment terbesar. Dan generasi berikutnya dari NVIDIA, Vera Rubin, telah memasuki produksi dan diperkirakan akan dikirimkan pada paruh kedua tahun 2026 dengan peningkatan throughput FP4 lebih jauh, sehingga pembeli yang merencanakan pembangunan baru memiliki peta jalan untuk dipertimbangkan. Anda dapat menempatkan dua dari ini berdampingan, dengan angka saat ini yang tepat, dalamAlat benchmark GPU dan AI MillionMiner.

    Di mana posisi MillionMiner

    Memilih kartu adalah setengah dari pekerjaan. Mengoperasikannya adalah setengah lainnya, dan itulah setengah yang telah kami kerjakan selama bertahun-tahun. Kekebalan dan pendingin yang digunakan untuk menjalankan 30.000 Mesin Miner adalah apa yang dibutuhkan untuk penerapan AI, hanya saja lebih banyak lagi, itulah mengapa bagian tersulit dari pembangunan B200 jarang terkait dengan GPU. Jika Anda masih menyaring pilihan, yangPanduan sederhana untuk memilih GPU untuk AImencakup dasar-dasar, dan theKatalog perangkat keras AIDaftarkan kartu H100, H200, dan Blackwell dengan pengiriman seluruh dunia yang sudah termasuk biaya bea masuk.

    Bagi para pembeli yang mencapai batas pendinginan dan daya, itulah satu-satunya alasan mengapaSisi daya dari AIpendapat seberapa penting silikon. Mengamankan kapasitas murah, berenergi, dan mampu menampung cairan adalah kendala, dan itulah yang tepat dari kamisitus siap pakaidibangun untuk menyelesaikan. Kisah para Penambang yang mengalihkan daya mereka ke dalamAI komputasi adalah, di bawah, pelajaran yang sama yang terus dikembalikan oleh perbandingan ini: GPU adalah bagian yang mudah.

    Kesimpulan utama

    Wei membeli H200s. Model 70B-nya muat dalam satu kartu, rak-raknya didinginkan udara, dan tumpukan perangkat lunak Hopper sudah siap hari ini. B200 akan melayani lebih banyak token per dolar saat skala besar, tetapi hanya setelah dia membangun kembali fasilitasnya untuk pendinginan cair, dan saat itu dia belum melayani volume yang cukup untuk membenarkan itu. Itulah pola sebagian besar tim pada tahun 2026: B200 adalah masa depan dan seringkali pilihan yang tepat untuk inferensi dengan volume tinggi, tetapi H200 adalah kartu yang sesuai dengan model dan bangunan yang sudah Anda miliki.

    Padankan GPU dengan model, beban kerja, dan pendinginan yang sebenarnya dapat Anda berikan, dalam urutan tersebut. Lakukan itu dan pertanyaan tentang H100 versus H200 versus B200 akan terjawab dengan sendirinya. Ketika Anda ingin melihat angka pasti untuk daftar singkat Anda, jalankan mereka melalui yang berikut inialat pengujian tolok ukur.

    Pertanyaan yang Sering Diajukan

    Apa perbedaan antara H100, H200, dan B200?
    H100 dan H200 berbagi die Hopper yang sama dan compute yang identik; H200 hanya menambahkan memori (141 GB HBM3e dengan bandwidth 4,8 TB/s dibandingkan H100 yang memiliki 80 GB HBM3 dengan bandwidth 3,35 TB/s). B200 adalah arsitektur Blackwell baru dengan 192 GB, sekitar 8 TB/s bandwidth, presisi FP4 asli, dan sekitar 4 kali lipat throughput pelatihan H100, tetapi memerlukan pendinginan cair.

    Apakah H200 lebih cepat daripada H100?
    Hanya untuk kerja yang terbatas pada memori. Karena mereka menggunakan die yang sama, H100 dan H200 identik dalam tugas yang terbatas pada komputasi seperti sebagian besar pelatihan. Untuk melayani model besar, bandwidth dan kapasitas tambahan dari H200 memberikan hingga 1,9 kali lipat throughput inferensi pada model kelas 70B, dan sekitar 25 hingga 35 persen dalam kasus yang biasanya terbatas pada memori.

    Apakah H100 dan H200 memiliki performa yang sama?
    Pada perhitungan, keduanya identik, karena keduanya menggunakan die GH100 dengan Tensor Cores dan kecepatan yang sama. Keunggulan H200 sepenuhnya terletak pada memori: 141 GB versus 80 GB dan 4,8 TB/s versus 3,35 TB/s. Hal ini penting untuk inferensi model besar dan untuk memuat model 70B dalam satu kartu, tetapi tidak untuk pelatihan yang terbatas pada komputasi.

    Apakah B200 layak dipilih dibandingkan H200?
    Untuk inferensi volume tinggi dan jalur pelatihan baru yang besar, ya. Dukungan FP4 B200 dan bandwidth 8 TB/s dapat secara dramatis mengurangi biaya per token pada skala besar, dan 192 GB-nya menyimpan model yang membutuhkan dua H200. Tetapi, perangkat ini mengonsumsi 1.000 watt dan memerlukan pendinginan cairan, jadi jika lokasi Anda menggunakan pendinginan udara atau volume Anda tidak besar, H200 seringkali merupakan pilihan praktis yang lebih baik.

    GPU terbaik untuk inferensi LLM tergantung pada kebutuhan spesifik dan anggaran Anda. Namun, secara umum, beberapa GPU unggulan yang sering direkomendasikan meliputi: NVIDIA A100 : Dengan Tensor Core dan kapasitas memori besar, cocok untuk inferensi skala besar dan beban kerja intensif. NVIDIA H100 : Terbaru dari NVIDIA, menawarkan peningkatan performa dan efisiensi untuk inferensi LLM. NVIDIA RTX 40 Series (misalnya RTX 4090) : Pilihan populer untuk pengembang dan penelitian dengan kebutuhan inferensi yang tidak terlalu ekstrem. Google TPU v4 : Alternatif yang kuat dan hemat biaya untuk inferensi LLM, tergantung pada platform yang digunakan. Pastikan mempertimbangkan faktor seperti kapasitas memori VRAM, kecepatan clock, dan kompatibilitas perangkat lunak saat memilih GPU untuk inferensi LLM.
    Untuk inferensi LLM berbasis memori dalam skala besar, B200 secara jelas unggul berkat FP4 dan bandwidth, diikuti oleh H200, kemudian H100. Jika 141 GB cukup untuk model Anda dan Anda menginginkan tumpukan perangkat lunak Hopper yang matang, H200 adalah pilihan yang masuk akal; tingkatkan ke B200 untuk biaya terendah per token dalam volume besar atau untuk model di atas 141 GB.

    GPU terbaik untuk pelatihan AI adalah NVIDIA A100, NVIDIA H100, dan NVIDIA RTX 4090, tergantung pada kebutuhan dan anggaran Anda.
    The B200 menyediakan sekitar 4 kali lipat throughput pelatihan H100 pada model transformer dan merupakan pilihan untuk jalur baru yang besar. H100 dan H200 melatih dengan kecepatan yang sama dan tetap menjadi opsi yang kuat dan hemat biaya untuk pelatihan yang lebih kecil atau dengan anggaran terbatas. Banyak tim menjalankan armada hibrida: Blackwell untuk inferensi produksi, Hopper untuk pelatihan.

    Apakah B200 membutuhkan pendinginan cairan?
    Dalam praktiknya, ya. Pada 1.000 watt per GPU, rak B200 padat melebihi kapasitas pendinginan udara, dan GB200 NVL72 berskala rak sebesar 120 kW atau lebih membutuhkan pendinginan cair langsung ke chip tanpa opsi pendinginan udara saja. H100 dan H200 dengan konsumsi 700 watt dirancang untuk berjalan dengan pendinginan udara dalam rak standar sebesar 20 hingga 45 kW.

    Berapa banyak VRAM yang dimiliki oleh H100, H200, dan B200?
    H100 memiliki 80 GB HBM3, H200 memiliki 141 GB HBM3e, dan B200 memiliki 192 GB HBM3e. Sebagai referensi, model 70B dalam FP16 membutuhkan sekitar 140 GB, sehingga cocok untuk satu H200 atau B200 tetapi tidak untuk satu H100. Blackwell Ultra B300 meningkatkan kapasitas hingga 288 GB.

    Berapa harga H100, H200, dan B200 pada tahun 2026?
    Kartu New H100 dan H200 dijual dengan harga sekitar $25.000 hingga $40.000 tergantung pada faktor bentuk dan volume, dengan H100 bekas diperdagangkan lebih rendah. B200 baru berharga sekitar $30.000 hingga $40.000. Penyewaan cloud sekitar $2 hingga $3 per GPU-jam untuk H100, sedikit lebih tinggi untuk H200, dan sekitar $5 hingga $6 secara on-demand untuk B200, dengan tarif spot mendekati $2.

    Haruskah saya membeli atau menyewa GPU ini?
    Sewa ketika beban kerja Anda menyala-nyala, Anda masih memilih perangkat keras, atau Anda membutuhkan Blackwell dengan cepat, karena stok B200 sedang dalam pesanan. Beli ketika tingkat pemanfaatan cukup tinggi sehingga memiliki perangkat keras lebih menguntungkan daripada biaya per jam, yang untuk kartu yang sering digunakan biasanya memakan waktu beberapa bulan. Di tempat, pertimbangkan pendinginan dan daya listrik yang dibutuhkan kartu, terutama untuk B200 yang didinginkan cairan.

    Sumber dan kredit gambar
    Spesifikasi dari ringkasan produk NVIDIA H100, H200, dan B200; angka kinerja dari hasil NVIDIA dan MLPerf Inference; harga tahun 2026 dari tarif cloud publik. Fotografi makro hero dari die GPU NVIDIA oleh Fritzchens Fritz (CC0) dan fotografi klaster GPU oleh CSIRO (CC BY 3.0), keduanya melalui Wikimedia Commons, dipotong dan disesuaikan untuk MillionMiner. Diagram: grafik asli MillionMiner.

    Siap Memulai Penambangan?

    Pengiriman DDP gratis seluruh dunia. Hosting profesional mulai dari $0.055/kWh.

    Mike Okonkwo

    Ditulis oleh

    Mike Okonkwo

    Hardware Review Editor

    Mike stress-tests every major ASIC before it reaches the MillionMiner catalogue, benchmarking real-world hashrate, power draw, and thermal behaviour across multiple firmware versions.

    Komentar 0

    Tolong Masuk untuk meninggalkan komentar

    Hapus Komentar?

    Tindakan ini tidak dapat dibatalkan.