Acest articol explică mecanismul din spatele benchmark-urilor AI GPU: ce se măsoară efectiv, de ce TFLOPS-urile de pe o fișă tehnică nu pot prezice performanța AI, cele două faze fizice care decid numărul de tokeni pe secundă, cele patru variabile care influențează rezultatul de mai multe ori, modul în care funcționează suita standard industrială MLPerf și, pe deplin, cum funcționează Indexul Inferenței AI din spatele nostruInstrument de testare pentru 78-GPUse calculează. La final, veți putea verifica orice cifră publicată despre GPU folosind o formulă simplă, un skill care valorează cu adevărat atunci când hardware-ul este atât de costisitor.
Răspunsul scurt
- Benchmark-urile AI GPU măsoară performanța efectivă pe sarcini reale(tokens pe secundă, imagini pe secundă, timp de antrenament), nu puterea de calcul maximă teoretică. Diferența dintre cele două este enormă și sistematică.
- Pentru inferența LLM, lățimea de bandă a memoriei de obicei contează mai mult decât TFLOPS, deoarece generarea fiecărui token necesită citirea întregului model din memorie. Lățimea de bandă împărțită la dimensiunea modelului oferă o limită de viteză dură pe care o puteți calcula singur.
- Orice cifră publicată depinde de patru setări:mărimea lotului, precizia, lungimea contextului și stack-ul software. Compararea a două rezultate care diferă pe oricare dintre ele este ca și cum ai compara mere cu facturi.
- Indicele nostru de inferență AIagregă rezultatele publicate public pe trei sarcini de lucru și scalează totul la RTX 3090 = 100, cu randamentul de instruire raportat separat și cu fiecare ipoteză menționată.
Ce măsoară de fapt un benchmark AI pentru GPU?
Inferență LLMmăsuri ale generării de tokeni: cât de rapid produce un model precum Llama sau DeepSeek outputul, raportat ca tokeni pe secundă, timpul până la primul token și latența între tokeniGenerare imaginimăsoară debitul de difuzie, mostre sau imagini pe secundă pe modele precum SDXL.Viziune și multimodalcuprinde înțelegera imaginilor, OCR și modele de detecție sub sarcină. Benchmark-urile de antrenament formează o a patra familie cu o logică complet diferită: în loc de throughput la un moment dat, ele măsoară timpul până la rezultatul dorit, cât timp are nevoie hardware-ul pentru a antrena un model de referință până la o calitate target. Un GPU care domină o familie poate fi medie în alta, motiv pentru care al nostruinstrument de benchmarkEvaluează toate cele trei familii de inferență în loc să desemneze un campion dintr-un singur test și explică de ce.card potrivit pentru instruireeste o întrebare separată de cardul potrivit pentru servire.
De ce nu prezic TFLOPS performanța AI-ului?
În primul rând, TFLOPS-ul de vârf este o valoare de laborator.Se presupune multiplicări de matrice perfect modelate, atingând fiecare nucleu tensor în fiecare ciclu, ceea ce codul de producție nu realizează niciodată. Măsurătorile de inginerie indică o rată maximă de Transfer de matrice posibilă pentru un H100 de aproximativ 794 TFLOP față de 989 pe fișa tehnică, o pătrime din cifra de câmp înainte ca sarcina de lucru să înceapă. În al doilea rând, TFLOPS-urile de marketing includ adesea sparsitate structurală, o caracteristică de pruning 2:4 care dublează cifrul afișat, dar se aplică numai modelelor pregătite special pentru aceasta, iar majoritatea nu sunt. Un L40S, de exemplu, este cotat la 1.466 TFLOPS FP8 cu sparsitate și 733 fără; numărul onest este cel mai mic. În al treilea rând, și decisiv: cea mai mare parte a muncii AI nu este limitată deloc de calcul. Este limitată de viteza cu care datele pot fi mutate din memorie către nuclee, iar plafonul acesta nu apare nicăieri pe linia TFLOPS.
Prefill versus decriptare: cele două faze fizice din spatele tokenilor pe secundă

Acest decalaj explică cele mai multe surprize din benchmark-uri. De aceea, un RTX 5090 cu 1,79 TB/s de GDDR7 depășește plăcile cu mai mulți TFLOPS, dar cu mai puțină lățime de bandă atunci cândrulare LLM-uri local, și de ce clasamentele cu un singur număr continuă să îi inducă în eroare pe cumpărători ale căror sarcini de lucru se află într-o singură fază.
De asemenea, explică direcția întregii industrii. H200 și B200 conduc generațiile lor prin actualizări de memorie, mai degrabă decât prin putere de calcul brută, deoarececomparativ între trei centre de dateafisează, șiNVIDIA a construit Rubinîn jurul HBM4 la 22 TB/s: aproape triplați bandwidth-ul are o valoare mai mare pentru inferență decât orice cantitate suplimentară de FLOPS.
Fórmula care verifică corectitudinea oricărei afirmații privind tokenii pe secundă

Cele patru variabile care pot modifica orice punct de referință cu 2 până la 10 ori

Antrenamentul face ca efectul de stivă să fie măsurabil printr-un metric elegant:MFU, utilizarea FLOPs a modelului, cota dinamentei de calcul teoretic al unui GPU pe care efectiv îl folosește sesiunea dvs. de antrenament. Răspândirea publicată este surprinzătoare. Un ciclu de antrenament simplu, gata de utilizare, a fost măsurat la 7,7% MFU pe un A100, GPU-ul fiind inactiv mai mult de nouă secunde din zece. Rularea Meta's Llama 65B a atins 49,5% pe 2.048 de A100; Llama 3.1 a raportat între 38 și 43% pe clustere H100; iar o rulare bine optimizată a atins 56% din vârful specificat în fișa tehnică H100. Aceeași silicon, diferență de șase ori, doar software. Când un benchmark de antrenament raportează imagini sau tokeni pe secundă, MFU este verificarea onestității din spatele acestor cifre.
Gata să începi să minezi?
Livrare DDP gratuită în întreaga lume. Hosting profesional de la $0.055/kWh.
Ce este MLPerf și cum funcționează?
Rezultatele MLPerf încă necesită abilități de citire. Înregistrarea de 2,5 milioane de tokeni pe secundă care a deschis acest articol a fost o performanță autentică de v5.1/v6.0 în divizia închisă, și de asemenea a fost o configurație de patru rafturi, 288-GPU; calculele pe chip nu reprezintă în mod explicit un indicator oficial. Rondele recente arată de asemenea cât de dependentă este clasarea de volumul de muncă: H200 aproape că dublează H100 pe un model de detectare, B200 dublează H200 pe generarea de imagini, totuși, pe detectare limitată de calcul cu o concurență modesta, un L40S umil competiționează mult peste clasa sa de preț. Rezultatele sistemului complet, între timp, sunt tot atât despreserver în jurul GPU-urilorși interconectarea la fel ca și cipurile însele, motiv pentru caresisteme la scară racksunt comparate ca unități.
Cum se calculează indicele nostru de inferență AI

Limitele sunt specificate chiar pe instrumentul în sine și contează: un număr agregat nu poate captura fiecare volum de lucru, rezultatele sunt orientative mai degrabă decât garantii, iar stiva dvs., driver-ele și dimensiunea batch-urilor vor influența rezultatul. De aceea, instrumentul asociază indicele cu VRAM-ul brut, TFLOPS și un mod head-to-head, și de ce leagăGhid de alegere a GPU-ului în limbaj simplupentru cititorii care doresc decizia, nu metodologia.
Cum să citiți orice benchmark GPU fără să fiți păcălit

Ce teste comparative nu pot să vă spună
Rezumatul rezultatului final
Întrebări frecvent adresate
Prin măsurarea throughput-ului livrat pe sarcini de lucru definite, mai degrabă decât pe capacitatea teoretică: tokeni pe secundă și timpul până la primul token pentru inferența LLM, imagini sau probe pe secundă pentruGenerare și sarcini vizuale, precum și timpul până la antrenament pentru o calitate țintă. Baremele serioase fixează modelul, precizia, dimensiunea lotului și ținta de calitate, specifică stiva de software și publică rezultatele în runde auditabile (MLPerf) sau indice transparenți, astfel încât comparațiile să rămână valide.
Ceva bun în privința vitezei de tokeni-pe-secundă?
Pentru un singur utilizator, orice peste aproximativ 20 până la 30 de tokeni pe secundă are o viteză de procesare mai mare decât pot urmări majoritatea oamenilor, astfel încât configurațiile locale vizează această valoare ca și plafon. Infrastructura de servire gândește diferit: un H100 atinge limita de circa 209 tokeni/sec pe flux pentru un model FP16 de 8B ( plafonul de lățime de bandă ), dar servește mii de tokeni agregati pe secundă pentru utilizatori în loturi. Ținta potrivită depinde de ceea ce doriți să optimizați: experiența unui singur utilizator sau capacitatea de throughput a unei flote.
Ce reprezintă TFLOPS și de ce nu prezice performanța AI?
TFLOPS reprezintă trillioni de operații în virgulă flotantă pe secundă, un vârf teoretic presupunând condiții perfecte pe care codul de producție nu le atinge niciodată (capacitatea de procesare a matricelor a unui H100 atinge aproximativ 794 TFLOPS față de 989 pe fișa tehnică, iar cifrele de marketing dublează adesea valoarea prin sparsitate). Mai fundamental, generarea de tokeni LLM este limitată de banda de memorie, nu de calcul, astfel încât linia TFLOPS a unui card poate fi aproape irelevantă pentru tokenii pe secundă.
De ce este lățimea de bandă a memoriei atât de importantă pentru inferența LLM
Deoarece modelele de limbaj generează autoregresiv: producerea fiecărui token necesită citirea întregii seturi de greutăți ale modelului, plus cache-ul KV, din memoria GPU. Aceasta face ca faza de decodare să fie limitată de memorie, iar tokenii pe secundă să varieze în funcție de lățimea de bandă împărțită la dimensiunea modelului. De aceea avantajul de 2,8x al inference-ului real al H100 față de A100 se bazează pe lățimea de bandă și suportul FP8, mai degrabă decât pe capacitatea brută de calcul, și de ce upgrade-urile HBM sunt evidențiate în fiecare generație nouă.
Care este diferența dintre prefill și decode?
Prefill este faza care procesează solicitarea dumneavoastră: toate tokenurile de intrare într-o singură trecere paralelă, limitată de puterea de calcul, determinând timpul până la primul token. Decode este faza care scrie răspunsul: un token pe rând, limitată de memorie, determinând numărul de tokenuri pe secundă. O GPU poate fi puternică într-una dintre faze și slabă în cealaltă, motiv pentru care benchmark-urile de inferență cu un singur număr ascund cât arată și cele riguroase raportând ambele metrici.
Ce este MLPerf și cine îl administrează?
MLPerf este suita de benchmark-uri standard din industrie pentru AI, administrată de MLCommons, un consorțiu care include producători de cipuri, cloud-uri și grupuri de cercetare. Vânzătorii depun rezultate pe modele de referință fixe, conform regulilor auditate, în runde cu versiuni (Inference v5.1 și v6.0 în 2026). Divizia Closed blochează modelele pentru compararea curată a hardware-ului, scenariul Server impune limite de latență pentru ca throughput-ul să poată coexista cu ritmul de răspuns, iar benchmark-urile de antrenament măsoară timpul necesar pentru a ajunge la o calitate definită.
MFU în antrenamentul AI reprezintă "Model fréquemment utilisé" sau "Model frecvent utilizat" (în limba română). Acesta se referă la modelele de inteligență artificială care sunt utilizate frecvent sau foarte des în procesul de antrenament pentru diverse sarcini, cum ar fi recunoașterea imaginilor, procesarea limbajului natural sau alte aplicații AI. Aceste modele sunt adesea optimizate pentru performanță și eficiență, fiind partajate sau reutilizate în mai multe proiecte pentru a accelera procesul de dezvoltare și implementare.
Model FLOPs Utilization: ponderea din calculul teoretic al unui GPU pe care o rulare de antrenament o utilizează efectiv, calculată din fluxul de tokenuri realizat comparativ cu FLOPS-urile de vârf. Valorile publicate variază de la 7,7% pentru buclele de antrenament naive până la 49,5% pentru rularea Meta's Llama 65B, cu Llama 3.1 raportând între 38 și 43% pe clusteri H100. Această diferență de șase ori pe silicon identic explică de ce stack-ul software este la fel de un factor de referință ca și hardware-ul.
Dațiunează o GPU mai rapidă prin cuantizare?
Facilitează inferența mai rapid pe aceeași GPU prin reducerea numărului de octeți pe fiecare token care trebuie mutat: FP8 aproape dublează viteza de decodare față de FP16, iar metodele INT4 precum GPTQ și AWQ o pot tripla, deoarece faza de decodare limitată de memorie scalează cu dimensiunea modelului în octeți. Hardware-ul GPU-ului nu s-a schimbat; sarcina de lucru a devenit mai ușoară. Impactul asupra calității depinde de model și de sarcină, motiv pentru care benchmark-urile oneste indică întotdeauna precizia utilizată.
De ce diferite site-uri afișează repere diferite pentru aceeași GPU?
Pentru că rezultatele variate ale celor patru setări pot crea diferențe de ordinul mai multor ori: dimensiunea lotului (viteză pentru un singur utilizator versus debit batch), precizia (FP16 versus FP8 versus INT4), lungimea contextului ( încărcarea cache-ului KV) și stack-ul software (vLLM, TensorRT-LLM, llama.cpp și Ollama au performanțe diferite pe același silicon). Două site-uri oneste care testează configurații diferite vor publica valori diferite. Înainte de a avea încredere într-o comparație, verificați dacă toate cele patru setări se potrivesc.
Cum se calculează indicele de inferență AI MillionMiner?
Patru pași: colectați date de referință publicate despre benchmarking GPU-cloud (verificabile, fără estimări interne); punctați fiecare placă pe trei categorii de sarcini de lucru (inferență LLM de la 8B până la 70B+, generare de imagini prin difuzie și viziune plus OCR sub sarcină); agregați pe o scară unificată indexată la RTX 3090 la 100, astfel încât 200 înseamnă aproximativ de două ori capacitatea de procesare combinată a 3090; și raportați randamentul de antrenament separat, doar dacă există o cifră publicată independent pentru exact acea placă. Asumțiile și limitele sunt menționate în instrumentul în sine.
Ar trebui să acordați încredere testelor de referință ale vânzătorilor pentru GPU?
Acordați-le în calitate de intrări, nu de verdicte. Numerele furnizorului sunt de obicei măsurători reale efectuate în cele mai favorabile condiții: precizie în cel mai bun caz, sparsitate activată, agregate la scară rack, cel mai recent software. Aplicați testul celor cinci întrebări (aceeași încărcare de lucru, precizie, lot și context, pe-chip față de pe-sistem, vârf față de livrat) și verificați încrucișat cu surse independente precum runde MLPerf. Când o afirmație rezistă celor cinci întrebări, este probabil utilă.
Surse și note
Rezultatele și regulile MLPerf de la MLCommons (Inference v5.1 și v6.0, runde 2026); cifra de 2,5M tokens/sec reprezintă trimiterea în divizia închisă a NVIDIA pe 288 de GB Blackwell Ultra GPU-uri, cu diviziunea pe chip neegală fiind o metrică neoficială. cifre MFU din rapoartele de instruire publicate: Llama 65B a Meta (49,5%) și Llama 3.1 (38 până la 43% pe H100), plus măsurători tehnice publicate ale intervalelor de bază naive-stack (7,7%) și debitul matricei H100 realizabil (~794 din 989 TFLOPS). cifrele de lățime de bandă și capacitate din specificațiile NVIDIA. plafonurile de tokens-pe-secundă sunt maxime teoretice pentru lotul 1; sistemele reale livrează 60 până la 85% din acestea. Toate cifrele sunt instantanee din mijlocul anului 2026; rezultatele benchmark variază odată cu versiunile software. Erou: Steve Jurvetson, CC BY 4.0; corp: Wikimedia Commons, CC0. Diagrame: graficele originale MillionMiner, gratuite pentru reutilizare cu atribuție și link către această pagină. Conținut informațional, nu sfaturi de achiziție