Ada seseorang di perusahaan Anda yang memutuskan sudah saatnya menjalankan AI pada perangkat keras Anda sendiri. Mungkin Anda menginginkan chatbot pribadi yang mengenal dokumen internal Anda, jalur gambar untuk tim produk, atau model yang membaca faktur dalam skala besar. Dan kini Anda adalah orang yang membandingkan GPU — menatap lembar spesifikasi penuh TFLOPS, VRAM, dan akronim interkoneksi, sementara setiap vendor mengklaim sebagai yang tercepat.
Panduan ini ditulis untuk saat itu. Ini menjelaskan, dengan bahasa yang sederhana, apa yang sebenarnya diukur oleh benchmark GPU, nomor mana yang penting untuk pekerjaan AI dan mana yang dapat Anda abaikan dengan aman, serta bagaimana menghitung berapa banyak perangkat keras yang benar-benar diperlukan untuk kasus penggunaan Anda. Pada akhirnya, Anda akan mampu membaca spesifikasi GPU mana pun, membandingkan dua kartu sendiri, dan mengetahui dengan tepat pertanyaan apa yang harus diajukan sebelum Anda menginvestasikan anggaran lima atau enam digit.
Apa yang Sebenarnya Dikatakan oleh Benchmark GPU
Sebuah benchmark adalah pengujian yang dapat diulang: tugas yang sama, dijalankan dalam kondisi yang sama, pada perangkat keras yang berbeda. Karena tugas tidak berubah, hasilnya dapat dibandingkan secara adil — kartu A menyelesaikan beban kerja dengan kecepatan ini, kartu B menyelesaikannya dengan kecepatan itu. Itu semua adalah benchmark, dan ini adalah alat yang paling berguna yang dimiliki pembeli.
Ini penting karena lembar spesifikasi saja tidak dapat menjawab pertanyaan Anda. Produsen menerbitkan maksimum teoretis — perhitungan yang dapat dilakukan oleh chip dalam kondisi laboratorium yang sempurna. Pekerjaan AI yang nyata lebih kompleks: data harus bergerak masuk dan keluar dari memori, perangkat lunak menambah overhead, dan berbagai tugas membebani bagian berbeda dari kartu tersebut. Dua GPU dengan spesifikasi kertas yang serupa dapat berperilaku sangat berbeda setelah menjalankan model bahasa sesungguhnya.
Inilah sebabnya mengapa tolok ukur beban kerja adalah angka yang patut dibaca. Alih-alih skor abstrak, mereka mengukur pekerjaan yang benar-benar dilakukan perangkat keras AI sepanjang hari: menghasilkan teks dengan model bahasa, menghasilkan gambar dengan model difusi, dan membaca atau menganalisis gambar. Jika kasus penggunaan yang Anda rencanakan cocok dengan beban kerja, tolok ukur tersebut memberi Anda sesuatu yang nyata.
Satu batasan jujur, tepat di awal: benchmark adalah titik acuan, bukan jaminan. Hasilnya berubah dengan versi driver, kerangka perangkat lunak, ukuran batch, dan pengaturan model. Perbandingan yang serius — termasuk milik kami — dibangun dari data benchmark yang dipublikasikan secara umum dan akan selalu menyatakan demikian. Perlakukan setiap angka dalam panduan ini, dan di halaman perbandingan apa pun, sebagai panduan arah, bukan hasil yang dijanjikan.

Reading a benchmark chart: one baseline, proportional bars, and a healthy dose of context.
13 istilah yang penting saat Anda membandingkan perangkat keras AI
Anda tidak memerlukan gelar teknik untuk membeli GPU yang tepat. Anda memerlukan tiga belas istilah, yang disusun di sini sesuai urutan mereka akan Anda temui dalam sebuah keputusan pembelian yang nyata.
Model dan apa yang dibutuhkannya

Inference runs the model. Training teaches it — and typically needs two to four times the memory.
Kecepatan yang dapat Anda rasakan
Kendala tersembunyi
Skalabilitas dan biaya
Setiap istilah ini muncul sebagai kolom atau label dalam
Tabel perbandingan GPU, sehingga Anda dapat melihatnya terpasang pada kartu nyata daripada definisi abstrak.
Berapa Banyak GPU yang Sebenarnya Anda Butuhkan?
Ukuran model menetapkan batas minimum. Sebuah perkiraan umum yang dipublikasikan: pada presisi FP16 penuh, sebuah model membutuhkan sekitar 2 GB VRAM per miliar parameter. Quantization mengecilkan jejak tersebut — INT8 membutuhkan sekitar setengahnya, INT4 sekitar seperempatnya. Di atas apa pun yang dibutuhkan oleh bobot, rencanakan sekitar 15 hingga 20 persen tambahan untuk cache dan aktivasi, dan lebih jika Anda menginginkan jendela konteks yang panjang.
Dua catatan praktis tentang tabel ini. Pertama, ini adalah perkiraan untuk bobot ditambah overhead normal — jendela konteks yang panjang atau batch besar menambah lagi. Kedua, pelatihan mengubah segalanya: mengajar atau melakukan fine-tuning model biasanya membutuhkan dua hingga empat kali lipat memori dari menjalankannya, karena gradien dan status optimizer disimpan di VRAM bersamaan dengan bobot.
Kecepatan mengikuti logika yang serupa. Untuk inference, bandwidth memori biasanya menentukan seberapa cepat token muncul, itulah sebabnya kartu data centre dengan memori HBM terasa jauh lebih cepat pada model besar daripada keuntungan TFLOPS mereka yang disarankan.

The memory ladder: what common model sizes need at full precision versus quantized to INT4.
Jika Anda lebih memilih untuk melewatkan perhitungan, kami mengelompokkan setiap kartu ke dalam empat kelas praktis — mulai dari perangkat keras entri untuk prototipe hingga kartu flagship untuk layanan produksi lebih dari 70 miliar — dalam
Tingkatan beban kerja pada halaman perbandingan.
Cara Mengetahui GPU Mana yang Lebih Baik: Daftar Pertanyaan 4 Pertanyaan
Ketika dua kartu ada dalam daftar pendek Anda, empat pertanyaan menyelesaikan hampir setiap perbandingan.
Ada satu trik lagi yang membuat perbandingan menjadi jauh lebih mudah: pengindeksan. Daripada mengelola empat lembar spesifikasi, letakkan setiap kartu pada satu timbangan. Halaman perbandingan kami menilai setiap GPU berdasarkan inference LLM, generasi gambar, dan beban kerja visi, kemudian mengindeks semuanya terhadap RTX 3090 sebagai dasar 100 poin — skor 200 berarti sekitar dua kali lipat throughput agregat dari kartu yang terkenal itu. Tiba-tiba pertanyaan mana yang lebih baik memiliki jawaban dalam sekali pandang.

One scale for every card: when the RTX 3090 is 100, a 403 speaks for itself.
Anda dapat melihat seluruh bidang yang diindeks dalam
Tabel 78-GPUatau langsung ke
pertarungan langsung antara dua kartu mana punPertanyaan mengenai H100 versus H200, misalnya, dapat diselesaikan dalam hitungan detik: komputasi identik secara teori, tetapi H200 memiliki 141 GB memori yang lebih cepat dibandingkan dengan 80 GB pada H100.
Cara Gratis untuk Membandingkan: Di Dalam Alat Benchmark GPU
Transparansi penuh: alat yang dijelaskan di sini adalah milik kami. Gratis, berfungsi tanpa pendaftaran apa pun, dan eksis karena kami terus menjawab pertanyaan perbandingan yang sama dari pelanggan secara manual. Berikut adalah apa yang dilakukan oleh setiap bagian — termasuk apa yang tidak dapat dilakukan.
Tabel 78-GPU
Setiap kartu terkini dalam satu tabel yang dapat diurutkan: VRAM, Indeks Inferensi AI dengan bar proporsional, TFLOPS FP16 teoretis, throughput pelatihan yang dipublikasikan jika tersedia, dan catatan bahasa sederhana tentang apa yang terbaik dari setiap kartu. Filter berdasarkan kelas VRAM, cari berdasarkan nama, dan urutkan kolom apa saja.
Podium dari tiga teratas saat initerletak di atasnya untuk mereka yang tidak sabar.
Pembatasan jujur: tabel GPU sengaja tidak menampilkan harga. Harga pasar untuk hardware AI berubah setiap minggu, dan harga yang usang lebih buruk daripada tidak sama sekali — penetapan harga dilakukan dalam penawaran, bukan dalam tabel statis.
Arena kompetisi langsung
Pilih salah satu dari dua kartu dan
arenaletakkan mereka bersebelahan: VRAM, indeks inferensi, perhitungan FP16 dan throughput pelatihan sebagai batang cermin, ditambah dengan verdict tertulis dalam satu kalimat bahasa Inggris sederhana. Ini adalah cara tercepat untuk menyelesaikan debat internal antara dua kartu yang telah disaring.
Pembatasannya: putusan mencerminkan indeks yang diterbitkan, bukan tumpukan perangkat lunak Anda secara tepat. Sebuah Kartu yang memenangkan indeks masih bisa kalah pada kerangka kerja atau versi model spesifik Anda — itulah sebabnya putusan menyebutkan margin sebagai gantinya daripada berpura-pura menjadi laporan laboratorium.

The arena in three steps: pick two cards, compare the bars, read the verdict.
48 server AI lengkap
Begitu satu kartu tidak cukup, satuan perbandingan berubah: sebuah server multi-GPU dinilai berdasarkan memori gabungan dan compute gabungan. The
bagian serverlists 48 sistem lengkap — dari workstation kompak hingga mesin rak 8-GPU — dengan VRAM total dan perhitungan FP16 total dihitung dengan skala yang sama dengan kartu tunggal, sehingga angkanya tetap dapat dibandingkan di seluruh halaman.
Tiers, metodologi, dan ketentuan kecil
The
tingkat beban kerjakelas perangkat keras menjadi penggunaan sederhana — Flagship untuk layanan multi-penyewa lebih dari 70B, High-End untuk pekerjaan produksi 30B hingga 70B, Mid-Range untuk rentang 8B hingga 30B, Entry untuk prototipe dan pembelajaran. Metodologi ini dipublikasikan secara terbuka: hanya data benchmark yang tersedia secara publik, tiga keluarga beban kerja nyata, semuanya diindeks ke RTX 3090 pada 100. Dan halaman ini mengulang penyangkalan dirinya sendiri, yang kami ulangi di sini: data referensi untuk orientasi, bukan jaminan performa. A
FAQ 16 pertanyaanmenutupi rinciannya.
Lima Kesalahan yang Dilakukan Pembeli Pertama Kali
Dari Daftar Pendek ke Penawaran: Apa yang Harus Dipersiapkan dan Apa yang Terjadi Selanjutnya
Pada suatu titik fase spreadsheet berakhir dan Anda berbicara dengan pemasok. Percakapan menjadi singkat dan produktif jika Anda membawa lima fakta:
Dengan jawaban tersebut, inilah cara kerjanya dengan kami, secara sederhana: Anda mengirim pertanyaan melalui the
formulir di halaman perbandinganatau melalui WhatsApp atau Telegram, dan seorang insinyur nyata — bukan bot — akan membalas, biasanya dalam waktu sekitar dua jam. 78 GPU dan 48 server yang tercantum di halaman tersebut adalah apa yang kami publikasi secara terbuka; kami dapat memasok jauh di atas itu, menawarkan harga grosir B2B dan volume, mengirim ke seluruh dunia dengan bea cukai yang diurus, atau menjalankan perangkat keras untuk Anda di fasilitas hosting kami. Dan untuk jujur dalam posisi kami: MillionMiner adalah reseller dan penyedia hosting, bukan produsen — itulah sebabnya rekomendasi tidak terkait dengan merek tertentu.
Get a free hardware recommendation
Tell us your model, your users and your timeline — an engineer replies with a concrete suggestion, usually within two hours.
Ask your questionFree, no obligation, no signup.
Pertanyaan yang Sering Diajukan
Apakah kami perlu memiliki keahlian perangkat keras internal untuk membeli server AI?
Tidak. Jika Anda dapat menjawab lima pertanyaan persiapan di atas — model, pengguna, latensi, inferensi atau pelatihan, lokasi — pemasok yang kompeten dapat menerjemahkannya ke dalam perangkat keras. Kosakata dalam panduan ini ada agar Anda dapat memeriksa alasan mereka, bukan agar Anda harus melakukan pekerjaan mereka.
Haruskah kami membeli GPU atau menyewanya di cloud?
Polanya yang banyak dipublikasikan: beban kerja yang berjalan dengan tingkat utilisasi tinggi secara berkelanjutan membayar perangkat keras yang dimiliki dengan cukup cepat, sementara beban kerja yang bersifat fluktuatif atau eksperimen lebih menguntungkan jika disewa. Banyak bisnis berada di tengah — memiliki perangkat keras dan mengonsumsinya di pusat data, yang menggabungkan biaya yang dapat diprediksi dengan tanpa pekerjaan fasilitas. Hitung angka-angka penggunaan realistis Anda sebelum memutuskan.
Apakah model yang dikuantisasi kehilangan kualitas yang nyata?
Penilaian yang dipublikasikan secara konsisten menunjukkan bahwa FP8 hampir tidak dapat dibedakan dari presisi penuh untuk sebagian besar tugas, dan INT4 merupakan trade-off kecil yang tergantung pada tugasnya. Pendekatan yang bijaksana adalah menguji kasus penggunaan spesifik Anda pada tingkat kuantisasi yang Anda rencanakan — sebelum Anda menentukan perangkat keras untuk itu.
Informasi apa yang harus kami siapkan sebelum meminta penawaran?
Model dan ukurannya, pengguna bersamaan yang diharapkan atau volume permintaan, harapan latensi Anda, apakah Anda membutuhkan pelatihan serta inferensi, dan di mana hardware harus ditempatkan. Lima jawaban — itu seluruh tugas rumah.
Selalu ada generasi berikutnya. Beli untuk horizon beban kerja dua hingga tiga tahun: jika perangkat keras yang tersedia saat ini memenuhi model Anda saat ini dan jangka pendek dengan cadangan, menunggu akan lebih banyak mengorbankan bulan-bulan nilai yang tidak Anda capai. Generasi baru cenderung menambah memori dan efisiensi daripada mengubah apa yang memungkinkan.
Kesimpulan Utama
Ukuran model menetapkan batas bawah memori Anda. Bandwidth memori menentukan kecepatan dunia nyata Anda. Benchmark — dibaca sebagai data referensi, diindeks ke satu basis — menyelesaikan perbandingan antara dua kandidat mana pun. Segala hal lainnya adalah aritmetika pada beban kerja Anda sendiri.
Compare 78 GPUs and 48 servers on one scale
Free, no signup — sortable benchmarks, head-to-head duels and a team that answers real questions.
Open the comparison