Iemand in uw bedrijf heeft besloten dat het tijd is om AI op uw eigen hardware uit te voeren. Misschien wilt u een privé-chatbot die uw interne documenten kent, een beeldverwerkingspipeline voor het productteam of een model dat facturen op schaal leest. En nu bent u de persoon die GPU's vergelijkt — turend naar specificatielijsten vol TFLOPS, VRAM en connectie-acroniemen, terwijl elke leverancier beweert de snelste te zijn.
Deze gids is geschreven voor precies dat moment. Het legt in klare taal uit wat GPU-benchmarks echt meten, welke cijfers belangrijk zijn voor AI-werk en welke u veilig kunt negeren, en hoe u kunt bepalen hoeveel hardware uw gebruikssituatie echt nodig heeft. Aan het einde zult u in staat zijn om elke GPU-specificatie te lezen, twee kaarten zelf te vergelijken, en precies te weten welke vragen u moet stellen voordat u een budget van vijf- of zes cijfers vastlegt.
Wat een GPU-benchmark je werkelijk vertelt
Een benchmark is een reproduceerbare test: dezelfde taak, uitgevoerd onder dezelfde omstandigheden, op verschillende hardware. Omdat de taak niet verandert, kunnen de resultaten eerlijk worden vergeleken — kaart A heeft de workload zo snel voltooid, kaart B zo snel. Dat is alles wat een benchmark is, en het is het allerbelangrijkste hulpmiddel dat een koper heeft.
Het is belangrijk omdat een specificatielijst alleen uw vraag niet kan beantwoorden. Fabrikanten publiceren theoretische maximumwaarden — de compute die een chip kan leveren onder perfecte laboratoriumomstandigheden. Echt AI-werk is onregelmatiger: gegevens moeten in en uit het geheugen verplaatsen, software voegt overhead toe, en verschillende taken belasten verschillende onderdelen van de kaart. Twee GPUs met vergelijkbare specificaties kunnen zich heel anders gedragen zodra ze een daadwerkelijk taalmodel uitvoeren.
Dit is waarom workload-benchmarks de cijfers zijn die de moeite waard zijn om te lezen. In plaats van een abstracte score meten ze de taken die AI-hardware de hele dag daadwerkelijk uitvoert: het genereren van tekst met een taalmodel, het produceren van afbeeldingen met een diffusiemodel en het lezen of analyseren van afbeeldingen. Als uw geplande gebruiksgeval overeenkomt met de workload, vertelt de benchmark u iets echt.
Een eerlijke beperking, meteen aan het begin: benchmarks zijn referentiepunten, geen garanties. Resultaten variëren met driverversies, software frameworks, batchgroottes en modelinstellingen. Een serieuze vergelijking — inclusief die van ons — is gebaseerd op openbaar gepubliceerde benchmarkgegevens en zal dat altijd aangeven. Behandel elk nummer in deze gids, en op elke vergelijkingspagina, als een richtlijn in plaats van een beloofd resultaat.

Reading a benchmark chart: one baseline, proportional bars, and a healthy dose of context.
De 13 termen die ertoe doen bij het vergelijken van AI-hardware
U hoeft geen technische opleiding te hebben om de juiste GPU te kopen. U hebt dertien termen nodig, gesorteerd op de volgorde waarin ze u tegenkomen bij een echte aankoopbeslissing.
Het model en wat het nodig heeft

Inference runs the model. Training teaches it — and typically needs two to four times the memory.
Snelheid die u kunt voelen
De verborgen knelpunt
Schaling en kosten
Elk van deze termen verschijnt als een kolom of label in onze
GPU vergelijkings tabel, zodat u ze daadwerkelijk aan echte kaarten kunt zien in plaats van abstracte definities.
Hoeveel GPU Heeft u ECHT nodig?
Modelgrootte bepaalt de ondergrens. Een veelgebruikte schatting: bij volledige FP16-precisie heeft een model ongeveer 2 GB VRAM per miljard parameters nodig. Quantisatie verkleint dat niet-privé-gebied — INT8 heeft ongeveer de helft nodig, INT4 ongeveer een kwart. Bovenop wat de gewichten nodig hebben, plan ongeveer 15 tot 20 procent extra voor caches en activaties, en meer als u lange contextvensters wilt.
Twee praktische opmerkingen bij deze tabel. Ten eerste zijn dit schattingen voor de gewichten plus de normale overhead — een lange contextvenster of een grote batch vereist meer. Ten tweede verandert training alles: het trainen of fine-tunen van een model duurt meestal twee tot vier keer zoveel geheugen als het uitvoeren ervan, omdat gradiënten en optimizer-gegevens samen met de gewichten in VRAM worden opgeslagen.
Snelheid volgt een vergelijkbare logica. Voor inferentie bepaalt meestal de geheugenbandbreedte hoe snel tokens verschijnen, daarom lijken data-center kaarten met HBM-geheugen onevenredig sneller bij grote modellen dan hun TFLOPS-voordeel suggereert.

The memory ladder: what common model sizes need at full precision versus quantized to INT4.
Als u de rekensom liever overslaat, hebben wij elke kaart ingedeeld in vier praktische klassen — van instaphardware voor prototyping tot vlaggenschipkaarten voor productie van meer dan 70B — in de
Werkbelastingniveaus op de vergelijkingspagina.
Hoe bepaal ik welke GPU beter is: Een checklist met 4 vragen
Als twee kaarten op uw shortlist staan, beantwoorden vier vragen bijna elk vergelijkingspunt.
Er is nog een truc die de vergelijking aanzienlijk eenvoudiger maakt: indexering. In plaats van te jongleren met vier specificatielijsten, zet elke kaart op één schaal. Onze vergelijkingspagina beoordeelt elke GPU op LLM-inferentie, beeldgeneratie en visie-workloads, en indexeert alles tegen de RTX 3090 als basislijn van 100 punten — een score van 200 betekent simpelweg ongeveer het dubbele van de totale doorvoer van die bekende kaart. Plotseling heeft de vraag welke beter is, met één oogopslag een antwoord.

One scale for every card: when the RTX 3090 is 100, a 403 speaks for itself.
U kunt het volledige geïndexeerde veld zien in de
78-GPU tabelof rechtstreeks naar een
Head-to-Head-duel van twee kaartenDe vraag H100 versus H200 wordt bijvoorbeeld binnen enkele seconden opgelost: identieke rekenkracht op papier, maar 141 GB snellere geheugen op de H200 tegenover 80 GB op de H100.
Een gratis manier om te vergelijken: Informatie over de GPU Benchmark Tool
Volledige transparantie: het hier beschreven hulpmiddel is van ons. Het is gratis, het werkt zonder enige registratie en het bestaat omdat we dezelfde vergelijkingsvragen voor klanten handmatig bleven beantwoorden. Hier is wat elk onderdeel doet — inclusief wat het niet kan doen.
De 78-GPU-tabel
Elke huidige kaart in één sorteertabel: VRAM, de AI Inference Index met een proportionele balk, theoretische FP16 TFLOPS, gepubliceerde trainingsdoorvoersnelheid indien beschikbaar, en een eenvoudige notitie over waarvoor elke kaart het beste is. Filter op VRAM-klasse, zoek op naam en sorteer op elke kolom.
podium van de huidige top drieligt er boven voor degenen die ongeduldig zijn.
De eerlijke beperking: de GPU-tabel toont opzettelijk geen prijzen. Marktprijzen voor AI-hardware veranderen wekelijks, en een verouderde prijs is erger dan geen — de prijzen worden vastgesteld in een offerte, niet in een statische tabel.
De competitie in de arena
Kies twee kaarten en de
arenaplaatst ze naast elkaar: VRAM, inference index, FP16 compute en trainingsdoorvoer als spiegelbeeldende balken, plus een schriftelijke conclusie in één zin in eenvoudig Engels. Het is de snelste manier om een interne discussie tussen twee geselecteerde kaarten te beslechten.
De beperking: het verdict weerspiegelt de gepubliceerde index, niet uw exacte softwarestack. Een kaart die de index wint, kan nog steeds verliezen op uw specifieke framework of modelversie — daarom noemt het verdict de marge in plaats van zich voor te doen als een labrapport.

The arena in three steps: pick two cards, compare the bars, read the verdict.
48 volledige AI-servers
Als één kaart niet genoeg is, verandert de vergelijkingsmaat: een multi-GPU-server wordt beoordeeld op basis van het gecombineerde geheugen en de gecombineerde rekenkracht.
serversectielijst 48 complete systemen — van compacte werkstations tot 8-GPU rackmachines — met totale VRAM en totale FP16-waarde berekend op dezelfde schaal als de enkele kaarten, zodat de cijfers door de hele pagina vergelijkbaar blijven.
Tiers, methode en de kleine lettertjes
De
lastenklassenVertaal hardwarecategorieën naar eenvoudige gebruiksscenario's — Flagship voor meer dan 70B multi-tenant diensten, High-End voor productiewerk met 30B tot 70B, Mid-Range voor de schaal van 8B tot 30B, Entry voor prototyping en leren. De methode wordt openlijk gepubliceerd: alleen openbare benchmarkgegevens, drie echte werklastfamilies, alles genormaliseerd op de RTX 3090 op 100. En de pagina herhaalt haar eigen disclaimer, die wij hier herhalen: referentiegegevens voor oriëntatie, geen garantie voor prestaties. A
16-vragen FAQbehandelt de details.
Vijf fouten die eerste kopers maken
Van shortlist tot offerte: wat u moet voorbereiden en wat er daarna gebeurt
Op een gegeven moment eindigt de spreadsheetfase en spreekt u met een leverancier. Het gesprek is kort en productief als u vijf feiten brengt:
Met die antwoorden uitgelegd, zo werkt het bij ons eenvoudig gezegd: u stuurt de vraag door het
formulier op de vergelijkingspaginaof via WhatsApp of Telegram, en een echte engineer — niet een bot — antwoordt, meestal binnen ongeveer twee uur. De 78 GPU's en 48 servers op de pagina zijn wat wij publiekelijk vermelden; wij kunnen daar ver boven uit gaan, bieden B2B- en volumekorting, verzenden wereldwijd inclusief douaneafhandeling, of draaien de hardware voor u in onze hostingfaciliteiten. En om eerlijk te blijven: MillionMiner is een reseller en hosting provider, geen fabrikant — precies daarom is een aanbeveling niet gebonden aan een specifiek merk.
Get a free hardware recommendation
Tell us your model, your users and your timeline — an engineer replies with a concrete suggestion, usually within two hours.
Ask your questionFree, no obligation, no signup.
Veelgestelde vragen
Hebt u interne hardware expertise nodig om een AI-server te kopen?
Nee. Als u de vijf voorbereidende vragen hierboven kunt beantwoorden — model, gebruikers, latency, inferentie of training, locatie — kan een competente leverancier deze vertalen naar hardware. De vocabulaire in deze gids bestaat zodat u hun redenering kunt controleren, niet zodat u hun werk moet doen.
Moeten we GPU's kopen of ze huren in de cloud?
Een veelgepubliceerd patroon: workloads die continu op een hoog gebruik draaien, betalen verrassend snel voor de eigendom van hardware, terwijl spikes of experimentele workloads de voorkeur geven aan huren. Veel bedrijven bevinden zich in het midden — het eigendom van de hardware en deze laten hosten, wat combineert met voorspelbare kosten zonder dat u zich zorgen hoeft te maken over de facilitaire werkzaamheden. Bereken uw realistische gebruik voordat u een beslissing neemt.
Verliest een gekwantiseerd model merkbare kwaliteit?
Publieke beoordelingen tonen consequent aan dat FP8 bijna niet te onderscheiden is van volledige precisie voor de meeste taken, en INT4 een kleine, taakafhankelijke afweging is. De verstandige aanpak is om uw specifieke gebruiksgeval te testen op het quantiseringsniveau dat u van plan bent te gebruiken — voordat u de hardware daarvoor dimensioneert.
Welke informatie moeten wij voorbereiden voordat wij een offerte aanvragen?
Het model en zijn formaat, verwacht gelijktijdig gebruikers of verzoekvolume, uw vertragingverwachting, of u training evenals inferentie nodig heeft, en waar de hardware moet worden ondergebracht. Vijf antwoorden — dat is de hele opdracht.
Moeten wij wachten op de volgende GPU-generatie?
Er is altijd een volgende generatie. Koop voor een werkbelastinghorizon van twee tot drie jaar: als hardware die vandaag beschikbaar is, voldoet aan uw huidige en kortetermijnmodellen met ruimte voor groei, kost wachten u vooral de maanden aan waarde die u niet hebt vastgelegd. Nieuwe generaties voegen meestal geheugen en efficiëntie toe in plaats van de mogelijkheden te veranderen.
De kernpunten
Modelgrootte bepaalt uw geheugenbasis. Geheugenbandbreedte bepaalt uw werkelijke snelheid. Benchmarks — lees ze als referentiedata, genormaliseerd op één basislijn — maken de vergelijking tussen twee kandidaten mogelijk. Alles andere is wiskunde op basis van uw eigen workload.
Compare 78 GPUs and 48 servers on one scale
Free, no signup — sortable benchmarks, head-to-head duels and a team that answers real questions.
Open the comparison