Itu adalah cara jujur untuk membacaKeputusan antara H100, H200, dan B200Dua dari kartu ini berbagi sebuah chip dan hanya berbeda pada memori. Yang ketiga adalah lompatan arsitektur asli yang juga mengubah tampilan data centre Anda. Panduan ini merinci spesifikasi yang penting, di mana masing-masing kartu unggul, berapa harganya, dan satu kendala yang paling sering dilupakan oleh pembeli saat menganggarkan.
Versi singkat
- TheH100 dan H200berbagi hopper die yang sama, sehingga komputasi mereka identik. Keunggulan H200 hanya pada memori: 141 GB dengan 4,8 TB/dt dibandingkan 80 GB dengan 3,35 TB/dt.
- Memori tersebut bernilai sekitar8 hingga 12 persen untuk pelatihan tetapi 25 hingga 35 persen pada inferensi terbatas memori dari model 70B dan yang lebih besar. Untuk inferensi, H200 adalah pilihan yang jelas dari keduanya.
- TheB200 adalah arsitektur baru (Blackwell), bukan penyegaran memori: 192 GB, sekitar 8 TB/s, native FP4, dan kira-kira 4x throughput pelatihan H100.
- Intinya adalah daya dan panas. H100 dan H200 adalahPending pendingdan mendorong rak melampaui 120 kW. Lonjakan fasilitas tersebut sering kali menjadi faktor penentu yang sebenarnya.
Tiga GPU sekilas

H100 dan H200: chip yang sama, memori yang berbeda
Apa yang diubah NVIDIA adalah memorinya. H100 memiliki 80 GB HBM3 dengan kecepatan 3,35 TB/s. H200 memiliki 141 GB HBM3e dengan kecepatan 4,8 TB/s, yang merupakan 1,76 kali kapasitas dan sekitar 1,4 kali bandwidth-nya. Tidak ada perubahan lain.
Perubahan tunggal ini sangat berpengaruh untuk satu pekerjaan tertentu: melayani model besar. Generasi teks terbatas oleh bandwidth memori, karena GPU harus membaca seluruh bobot model untuk setiap token yang dihasilkan. Lebih banyak bandwidth berarti lebih banyak token per detik, dan kapasitasan yang lebih besar berarti model dapat muat tanpa tumpah. NVIDIA melaporkan bahwa H200 menghasilkan hingga 1,9 kali throughput inference H100 pada Llama 2 70B, dan dalam praktiknya Anda akan melihat peningkatan 25 hingga 35 persen pada model terbatas memori di kisaran 70B ke atas. Untuk pelatihan, di mana bottleneck biasanya adalah komputasi bukan memori, perangkat keras yang sama memberikan peningkatan yang lebih modest sebesar 8 hingga 12 persen.
Ada juga tebing kapasitas tersembunyi di balik angka-angka tersebut. Model 70B dalam FP16 membutuhkan sekitar 140 GB memori untuk bobotnya saja. Itu cocok pada satu H200 (141 GB) tetapi tidak pada satu H100 (80 GB), di mana Anda akan membutuhkan dua kartu dan overhead interkoneksi yang menyertainya. Jika model Anda berada di rentang tersebut, H200 bukanlah sedikit lebih cepat, melainkan perbedaan antara satu GPU dan dua GPU.
B200 adalah makhluk yang berbeda
Spesifikasi yang mengikuti dari itu:
- Memori.192 GB HBM3e sekitar 8 TB/s. Itu 2,4 kali kapasitas dan bandwidth H100, dan memungkinkan satu B200 menampung model yang sebelumnya membutuhkan dua atau tiga H100.
- Presisi FP4.Tensor Core generasi kelima Blackwell menambahkan titik angka berjalan empat-bit secara native. FP4 mengurangi jejak memori dibandingkan FP8 dan, dikombinasikan dengan bandwidth, mendukung klaim utama NVIDIA tentang sekitar 4 kali lipat throughput inferensi H100. Model sebesar 70B dalam FP4 menyusut menjadi sekitar 35 GB, yang meninggalkan sebagian besar kartu bebas untuk konteks dan batch.
- NVLink 5,0.1,8 TB/s per GPU, dua kali lipat Hopper yang 900 GB/s, yang menjadi penting saat Anda meningkatkan skala di atas satu kartu.
Lompatan generasi dari H100 ke B200 adalah yang terbesar yang pernah dikirim NVIDIA di segmen data centre, dan itu terfokus pada tiga hal yang membatasi inference LLM: kapasitas memori, bandwidth, dan throughput presisi rendah.
· Analisis platform NVIDIA B200, 2026
Pelatihan versus inferensi: di mana masing-masing menang
Untuk inferensi,aturan memori. Melayani sebuah model adalah bandwidth-bound, jadi peringkatnya jelas: B200 pertama dengan selisih besar, H200 kedua, H100 ketiga. Jika Anda menjalankan 70B atau lebih besar di produksi dan peduli dengan biaya per token, jalur FP4 dari B200 berada dalam kelas yang berbeda, dan H200 adalah pilihan Hopper-generasi yang masuk akal saat 141 GB cukup dan Anda menginginkan perangkat lunak yang matang.
Untuk pelatihan,masalah komputasi lebih penting dan celah-celah menjadi lebih rapat. H100 dan H200 dilatih dengan kecepatan yang sama karena keduanya berbagi die. B200 menghasilkan sekitar 4 kali throughput pelatihan H100 pada model transformator berkat FP8 dan FP4 mixed precision, jadi untuk pelatihan besar yang baru, pilihan yang jelas adalah ini, tetapi beban kerja pelatihan atau HPC yang sensitif terhadap biaya berjalan dengan baik pada H100 yang lebih murah dan tersedia. Pola umum pada tahun 2026 adalah armada hybrid: Blackwell untuk inferensi produksi di mana peningkatan throughput membayar dirinya sendiri, Hopper untuk pelatihan dan tugas latar belakang.
Siap Memulai Penambangan?
Pengiriman DDP gratis seluruh dunia. Hosting profesional mulai dari $0.055/kWh.
Pendakian pendinginan yang tidak pernah Anda anggarkan
B200 mengkonsumsi 1.000 watt, lonjakan sebesar 43 persen, dan itu mengubah segalanya di hilir. Rak B200 yang padat mendorong jauh melebihi kemampuan udara untuk menghilangkan panas, dan pada skala rak konfigurasi GB200 NVL72 mencapai 120 kW atau lebih dan memerlukan pendinginan cairan langsung ke chip tanpa opsi udara saja. Dalam prakteknya, itu berarti adanya loop air fasilitas, unit distribusi pendingin, dan beban lantai yang sebagian besar bangunan tidak pernah dirancang untuk menampung.
Versi jujur dari keputusan B200 bukanlah "Apakah saya mampu membeli GPU." Melainkan "Apakah saya mampu membangun infrastruktur yang dibutuhkan oleh GPU tersebut." Sebuah B200 yang tidak bisa didinginkan lebih lambat daripada H200 yang bisa. Untuk siapa saja yang melakukan deploy di tempat, ini adalah garis antara peningkatan perangkat keras dan proyek konstruksi, itulah sebabnya begitu banyak kapasitas Blackwell digunakan di cloud atau fasilitas yang sudah mengatasi masalah daya dan pendinginan.
Berapa harganya: beli versus sewa
Menyewa menceritakan kisah yang lebih bersih bagi sebagian besar tim. Pada pertengahan 2026, sewa cloud H100 sekitar $2 hingga $3 per GPU-jam, H200 sedikit di atasnya, dan B200 sekitar $5 hingga $6 sesuai permintaan, dengan tarif spot menurun di dekat $2. Karena perangkat keras B200 pemesanan jauh ke tahun, akses cloud sering kali menjadi satu-satunya jalan cepat menuju Blackwell sama sekali. Aturan umum: menyewa saat beban kerja Anda puncak atau saat Anda masih memilih perangkat keras, dan membeli saat utilisasi cukup tinggi sehingga kepemilikan lebih menguntungkan daripada meteran per jam, yang untuk kartu yang sering digunakan biasanya dalam beberapa bulan.
Jadi, yang mana yang harus Anda beli?

- Seberapa besar model Anda?Di bawah 70B, H100 sudah cukup. Pada 70B dalam FP16, Anda membutuhkan 141 GB dari H200 atau 192 GB dari B200 agar tetap satu kartu. Di atas 100B dengan presisi penuh, B200 adalah opsi GPU tunggal yang praktis.
- Pelatihan atau inferensi?Pelatihan berbasis komputasi berjalan dengan baik pada H100 atau H200. Inferensi berbasis memori dalam skala besar adalah di mana H200 dan terutama B200 mendapatkan nilai tambah mereka.
- Bisakah situs Anda didinginkan?Jika Anda memiliki rak berpendingin udara dan tidak menggunakan loop cair, pilihan yang realistis adalah H100 atau H200. B200 hanya cocok jika Anda dapat menyediakan pendinginan cair dan daya yang mendukungnya.
Di mana posisi MillionMiner
Bagi para pembeli yang mencapai batas pendinginan dan daya, itulah satu-satunya alasan mengapaSisi daya dari AIpendapat seberapa penting silikon. Mengamankan kapasitas murah, berenergi, dan mampu menampung cairan adalah kendala, dan itulah yang tepat dari kamisitus siap pakaidibangun untuk menyelesaikan. Kisah para Penambang yang mengalihkan daya mereka ke dalamAI komputasi adalah, di bawah, pelajaran yang sama yang terus dikembalikan oleh perbandingan ini: GPU adalah bagian yang mudah.
Kesimpulan utama
Padankan GPU dengan model, beban kerja, dan pendinginan yang sebenarnya dapat Anda berikan, dalam urutan tersebut. Lakukan itu dan pertanyaan tentang H100 versus H200 versus B200 akan terjawab dengan sendirinya. Ketika Anda ingin melihat angka pasti untuk daftar singkat Anda, jalankan mereka melalui yang berikut inialat pengujian tolok ukur.
Pertanyaan yang Sering Diajukan
H100 dan H200 berbagi die Hopper yang sama dan compute yang identik; H200 hanya menambahkan memori (141 GB HBM3e dengan bandwidth 4,8 TB/s dibandingkan H100 yang memiliki 80 GB HBM3 dengan bandwidth 3,35 TB/s). B200 adalah arsitektur Blackwell baru dengan 192 GB, sekitar 8 TB/s bandwidth, presisi FP4 asli, dan sekitar 4 kali lipat throughput pelatihan H100, tetapi memerlukan pendinginan cair.
Apakah H200 lebih cepat daripada H100?
Hanya untuk kerja yang terbatas pada memori. Karena mereka menggunakan die yang sama, H100 dan H200 identik dalam tugas yang terbatas pada komputasi seperti sebagian besar pelatihan. Untuk melayani model besar, bandwidth dan kapasitas tambahan dari H200 memberikan hingga 1,9 kali lipat throughput inferensi pada model kelas 70B, dan sekitar 25 hingga 35 persen dalam kasus yang biasanya terbatas pada memori.
Apakah H100 dan H200 memiliki performa yang sama?
Pada perhitungan, keduanya identik, karena keduanya menggunakan die GH100 dengan Tensor Cores dan kecepatan yang sama. Keunggulan H200 sepenuhnya terletak pada memori: 141 GB versus 80 GB dan 4,8 TB/s versus 3,35 TB/s. Hal ini penting untuk inferensi model besar dan untuk memuat model 70B dalam satu kartu, tetapi tidak untuk pelatihan yang terbatas pada komputasi.
Apakah B200 layak dipilih dibandingkan H200?
Untuk inferensi volume tinggi dan jalur pelatihan baru yang besar, ya. Dukungan FP4 B200 dan bandwidth 8 TB/s dapat secara dramatis mengurangi biaya per token pada skala besar, dan 192 GB-nya menyimpan model yang membutuhkan dua H200. Tetapi, perangkat ini mengonsumsi 1.000 watt dan memerlukan pendinginan cairan, jadi jika lokasi Anda menggunakan pendinginan udara atau volume Anda tidak besar, H200 seringkali merupakan pilihan praktis yang lebih baik.
GPU terbaik untuk inferensi LLM tergantung pada kebutuhan spesifik dan anggaran Anda. Namun, secara umum, beberapa GPU unggulan yang sering direkomendasikan meliputi: NVIDIA A100 : Dengan Tensor Core dan kapasitas memori besar, cocok untuk inferensi skala besar dan beban kerja intensif. NVIDIA H100 : Terbaru dari NVIDIA, menawarkan peningkatan performa dan efisiensi untuk inferensi LLM. NVIDIA RTX 40 Series (misalnya RTX 4090) : Pilihan populer untuk pengembang dan penelitian dengan kebutuhan inferensi yang tidak terlalu ekstrem. Google TPU v4 : Alternatif yang kuat dan hemat biaya untuk inferensi LLM, tergantung pada platform yang digunakan. Pastikan mempertimbangkan faktor seperti kapasitas memori VRAM, kecepatan clock, dan kompatibilitas perangkat lunak saat memilih GPU untuk inferensi LLM.
Untuk inferensi LLM berbasis memori dalam skala besar, B200 secara jelas unggul berkat FP4 dan bandwidth, diikuti oleh H200, kemudian H100. Jika 141 GB cukup untuk model Anda dan Anda menginginkan tumpukan perangkat lunak Hopper yang matang, H200 adalah pilihan yang masuk akal; tingkatkan ke B200 untuk biaya terendah per token dalam volume besar atau untuk model di atas 141 GB.
GPU terbaik untuk pelatihan AI adalah NVIDIA A100, NVIDIA H100, dan NVIDIA RTX 4090, tergantung pada kebutuhan dan anggaran Anda.
The B200 menyediakan sekitar 4 kali lipat throughput pelatihan H100 pada model transformer dan merupakan pilihan untuk jalur baru yang besar. H100 dan H200 melatih dengan kecepatan yang sama dan tetap menjadi opsi yang kuat dan hemat biaya untuk pelatihan yang lebih kecil atau dengan anggaran terbatas. Banyak tim menjalankan armada hibrida: Blackwell untuk inferensi produksi, Hopper untuk pelatihan.
Apakah B200 membutuhkan pendinginan cairan?
Dalam praktiknya, ya. Pada 1.000 watt per GPU, rak B200 padat melebihi kapasitas pendinginan udara, dan GB200 NVL72 berskala rak sebesar 120 kW atau lebih membutuhkan pendinginan cair langsung ke chip tanpa opsi pendinginan udara saja. H100 dan H200 dengan konsumsi 700 watt dirancang untuk berjalan dengan pendinginan udara dalam rak standar sebesar 20 hingga 45 kW.
Berapa banyak VRAM yang dimiliki oleh H100, H200, dan B200?
H100 memiliki 80 GB HBM3, H200 memiliki 141 GB HBM3e, dan B200 memiliki 192 GB HBM3e. Sebagai referensi, model 70B dalam FP16 membutuhkan sekitar 140 GB, sehingga cocok untuk satu H200 atau B200 tetapi tidak untuk satu H100. Blackwell Ultra B300 meningkatkan kapasitas hingga 288 GB.
Berapa harga H100, H200, dan B200 pada tahun 2026?
Kartu New H100 dan H200 dijual dengan harga sekitar $25.000 hingga $40.000 tergantung pada faktor bentuk dan volume, dengan H100 bekas diperdagangkan lebih rendah. B200 baru berharga sekitar $30.000 hingga $40.000. Penyewaan cloud sekitar $2 hingga $3 per GPU-jam untuk H100, sedikit lebih tinggi untuk H200, dan sekitar $5 hingga $6 secara on-demand untuk B200, dengan tarif spot mendekati $2.
Haruskah saya membeli atau menyewa GPU ini?
Sewa ketika beban kerja Anda menyala-nyala, Anda masih memilih perangkat keras, atau Anda membutuhkan Blackwell dengan cepat, karena stok B200 sedang dalam pesanan. Beli ketika tingkat pemanfaatan cukup tinggi sehingga memiliki perangkat keras lebih menguntungkan daripada biaya per jam, yang untuk kartu yang sering digunakan biasanya memakan waktu beberapa bulan. Di tempat, pertimbangkan pendinginan dan daya listrik yang dibutuhkan kartu, terutama untuk B200 yang didinginkan cairan.
Sumber dan kredit gambar
Spesifikasi dari ringkasan produk NVIDIA H100, H200, dan B200; angka kinerja dari hasil NVIDIA dan MLPerf Inference; harga tahun 2026 dari tarif cloud publik. Fotografi makro hero dari die GPU NVIDIA oleh Fritzchens Fritz (CC0) dan fotografi klaster GPU oleh CSIRO (CC BY 3.0), keduanya melalui Wikimedia Commons, dipotong dan disesuaikan untuk MillionMiner. Diagram: grafik asli MillionMiner.

