Tutorials · 23 câțiva minuti de citit · Jul 30, 2026

Cum se calculează benchmark-urile AI pentru GPU: TFLOPS, tokenuri pe secundă și ceea ce ascund cifrele

MillionMiner Team

Mining Hardware Operators

Cum se calculează benchmark-urile AI pentru GPU: TFLOPS, tokenuri pe secundă și ceea ce ascund cifrele
La începutul anului 2026, NVIDIA a publicat un record de inferență de 2,5 milioane de tokeni pe secundăImpresionant, până când citiți nota de subsol: numărul provine de la 288 GPU Blackwell Ultra care funcționează împreună în patru rack-uri complete, iar împărțirea pe cip, conform propriului cadru MLCommons, nu reprezintă un indicator oficial. Acesta este benchmark-ul GPU într-o singură poveste: numerele sunt reale și tot nu vă vor spune ce credeți, cu excepția cazului în care știți exact cum au fost măsurate.

Acest articol explică mecanismul din spatele benchmark-urilor AI GPU: ce se măsoară efectiv, de ce TFLOPS-urile de pe o fișă tehnică nu pot prezice performanța AI, cele două faze fizice care decid numărul de tokeni pe secundă, cele patru variabile care influențează rezultatul de mai multe ori, modul în care funcționează suita standard industrială MLPerf și, pe deplin, cum funcționează Indexul Inferenței AI din spatele nostruInstrument de testare pentru 78-GPUse calculează. La final, veți putea verifica orice cifră publicată despre GPU folosind o formulă simplă, un skill care valorează cu adevărat atunci când hardware-ul este atât de costisitor.

Răspunsul scurt

  • Benchmark-urile AI GPU măsoară performanța efectivă pe sarcini reale(tokens pe secundă, imagini pe secundă, timp de antrenament), nu puterea de calcul maximă teoretică. Diferența dintre cele două este enormă și sistematică.
  • Pentru inferența LLM, lățimea de bandă a memoriei de obicei contează mai mult decât TFLOPS, deoarece generarea fiecărui token necesită citirea întregului model din memorie. Lățimea de bandă împărțită la dimensiunea modelului oferă o limită de viteză dură pe care o puteți calcula singur.
  • Orice cifră publicată depinde de patru setări:mărimea lotului, precizia, lungimea contextului și stack-ul software. Compararea a două rezultate care diferă pe oricare dintre ele este ca și cum ai compara mere cu facturi.
  • Indicele nostru de inferență AIagregă rezultatele publicate public pe trei sarcini de lucru și scalează totul la RTX 3090 = 100, cu randamentul de instruire raportat separat și cu fiecare ipoteză menționată.


Ce măsoară de fapt un benchmark AI pentru GPU?

Îndepărtați brandul și fiecare benchmark serios de AI măsoară un singur lucru: cât de mult lucru util finalizează un GPU pe unitate de timp pentru o sarcină definită. Sarcinile se împart în trei familii, iar clasamentul unui card se poate schimba complet între ele.

Inferență LLMmăsuri ale generării de tokeni: cât de rapid produce un model precum Llama sau DeepSeek outputul, raportat ca tokeni pe secundă, timpul până la primul token și latența între tokeniGenerare imaginimăsoară debitul de difuzie, mostre sau imagini pe secundă pe modele precum SDXL.Viziune și multimodalcuprinde înțelegera imaginilor, OCR și modele de detecție sub sarcină. Benchmark-urile de antrenament formează o a patra familie cu o logică complet diferită: în loc de throughput la un moment dat, ele măsoară timpul până la rezultatul dorit, cât timp are nevoie hardware-ul pentru a antrena un model de referință până la o calitate target. Un GPU care domină o familie poate fi medie în alta, motiv pentru care al nostruinstrument de benchmarkEvaluează toate cele trei familii de inferență în loc să desemneze un campion dintr-un singur test și explică de ce.card potrivit pentru instruireeste o întrebare separată de cardul potrivit pentru servire.

De ce nu prezic TFLOPS performanța AI-ului?

TFLOPS, trilioane de operații în virgulă flotantă pe secundă, este numărul pe care toți îl citează și cel mai slab predictor individual al ratei reale de procesare AI. Trei motive, în ordinea crescătoare a importanței.

În primul rând, TFLOPS-ul de vârf este o valoare de laborator.Se presupune multiplicări de matrice perfect modelate, atingând fiecare nucleu tensor în fiecare ciclu, ceea ce codul de producție nu realizează niciodată. Măsurătorile de inginerie indică o rată maximă de Transfer de matrice posibilă pentru un H100 de aproximativ 794 TFLOP față de 989 pe fișa tehnică, o pătrime din cifra de câmp înainte ca sarcina de lucru să înceapă. În al doilea rând, TFLOPS-urile de marketing includ adesea sparsitate structurală, o caracteristică de pruning 2:4 care dublează cifrul afișat, dar se aplică numai modelelor pregătite special pentru aceasta, iar majoritatea nu sunt. Un L40S, de exemplu, este cotat la 1.466 TFLOPS FP8 cu sparsitate și 733 fără; numărul onest este cel mai mic. În al treilea rând, și decisiv: cea mai mare parte a muncii AI nu este limitată deloc de calcul. Este limitată de viteza cu care datele pot fi mutate din memorie către nuclee, iar plafonul acesta nu apare nicăieri pe linia TFLOPS.
A close-up of an NVIDIA GPU die: benchmarks exist to measure what this silicon actually delivers on AI workloads, which routinely lands far below the spec-sheet TFLOPS.
Cea mai clară dovadă este o comparație pe care fiecare cumpărător o cunoaște: H100 oferă aproximativ de 2,8 ori throughput-ul de inferență LLM al unui A100. Avantajul său în procesare pe hârtie este de peste 3 ori, avantajul în lățimea de bandă a memoriei este de aproximativ 1,7 ori, iar rezultatul transmis se urmărește mult mai apropiat de numărul de bandă și de motorul Transformer FP8 decât de numărul FLOPS. Această patternă se menține pe întregul stack, și de aceea următoarea secțiune reprezintă cel mai util model mental în benchmarking-ul GPU.

Prefill versus decriptare: cele două faze fizice din spatele tokenilor pe secundă

Fiecare solicitare LLM se desfășoară în două faze cu blocaje opuse, iar fiecare indicator de performanță credibil de inferență le raportează separat.
The two phases of LLM inference: prefill processes the whole prompt in parallel and is compute-bound (measured as time to first token), while decode generates one token at a time and is memory-bandwidth-bound (measured as tokens per second).
Prefil-ul procesează întregul dvs. mesaj într-o singură trecere paralelă. Este limitat de capacitatea de calcul, astfel încât aici contează cu adevărat TFLOPS și determină timpul până la primul token (TTFT), pauza înainte ca răspunsul să înceapă. Un mesaj de 10.000 de tokens durează proporțional mai mult decât unul de 100 de tokens pe aceeași placă. Decodificarea apoi generează răspunsul câte un token pe rând, iar aici fizica devine dură: deoarece modelele de limbaj sunt autoregresive, producerea fiecărui token necesită citirea întregii set de greutăți ale modelului, plus cache-ul de chei-valori în creștere, din memorie. La dimensiuni mici ale loturilor, acest lucru se traduce în doar câteva operații în virgulă mobilă pe byte mutat, plasând decodificarea adânc în teritoriu limitat de memorie. Metrica pe care o determină, tokeni pe secundă, scalează aproape independent de capacitatea de calcul, cu banda de memorie.

Acest decalaj explică cele mai multe surprize din benchmark-uri. De aceea, un RTX 5090 cu 1,79 TB/s de GDDR7 depășește plăcile cu mai mulți TFLOPS, dar cu mai puțină lățime de bandă atunci cândrulare LLM-uri local, și de ce clasamentele cu un singur număr continuă să îi inducă în eroare pe cumpărători ale căror sarcini de lucru se află într-o singură fază.

De asemenea, explică direcția întregii industrii. H200 și B200 conduc generațiile lor prin actualizări de memorie, mai degrabă decât prin putere de calcul brută, deoarececomparativ între trei centre de dateafisează, șiNVIDIA a construit Rubinîn jurul HBM4 la 22 TB/s: aproape triplați bandwidth-ul are o valoare mai mare pentru inferență decât orice cantitate suplimentară de FLOPS.

Fórmula care verifică corectitudinea oricărei afirmații privind tokenii pe secundă

Natura limitată de memorie a decode-ului vă oferă ceva rar în această industrie: o limită de viteză pe care o puteți calcula pe o hârtie șervețel. Pentru un singur flux, token-urile pe secundă nu pot depăși lățimea de bandă a memoriei împărțită la octeții pe care îi ocupă modelul, deoarece fiecare token necesită o citire completă a acelor octeți.
The tokens-per-second ceiling formula with worked examples: an 8B FP16 model (~16 GB) tops out near 209 tok/s on an H100's 3.35 TB/s, quantizing to INT4 raises the ceiling to ~740, and a 140 GB 70B model cannot fit a single 80 GB card at all.
Lucrați cu exemplele. Un model cu 8 miliarde de parametri la FP16 ocupă aproximativ 16 GB, astfel că un H100 la 3,35 TB/s ajunge aproape de 209 tokeni pe secundă pentru un singur utilizator; un A100 la 2,0 TB/s aproape de 125. Quantificați același model la INT4 (aproximativ 4,5 GB) și plafonurile se înmulțesc în mod aproximativ de patru ori, nu pentru că placa devine mai rapidă, ci pentru că fiecare token acum transferă mai puține octeți. Un model de 70B la FP16 necesită aproximativ 140 GB și pur și simplu nu se potrivește pe o placă de 80 GB, motiv pentru care benchmark-urile pentru 70B implică întotdeauna fie cuantizare, fiemai multe GPU-uri, și de ce VRAM apare lângă fiecare scor din tabelele noastre. Sistemele reale, bine optimizate, oferă între 60 și 85% din plafonul teoretic; cifrele publicate care depășesc acest interval indică faptul că se folosește batching, decoding speculativ sau un model mai mic decât cel promis. O formulă, iar slide-urile furnizorilor nu te pot mai surprinde.

Cele patru variabile care pot modifica orice punct de referință cu 2 până la 10 ori

Plăcile grafice identice afișează numere diferite în surse, iar rareori cineva minte. Patru setări influențează fluctuațiile, iar o comparație este valabilă doar atunci când toate cele patru coincid.
The four variables that swing GPU benchmark results: batch size (throughput vs per-user speed), precision and quantization (FP16 to INT4), context length (KV cache growth), and software stack (vLLM, TensorRT-LLM, llama.cpp all differ on identical hardware).
Dimensiune lottradează viteza individuală pentru debitul total: la loturi mici deconectarea este limitată de memorie și servirea mai multor utilizatori este aproape gratuită, în timp ce la loturi mari sarcina devine limitată de calcul și fiecare utilizator încetinește. motoarele de lotare continuă, precum vLLM, trăiesc în acea balanță. Precizia schimbă bytes transferați: FP8 aproape că dublează deconectarea față de FP16, cuantizarea INT4 (GPTQ, AWQ, GGUF) o poate tripla, cu costuri de calitate care depind de sarcină. Lungimea contextului alimenta cache-ul KV, care la peste 32K tokeni poate consuma aceeași VRAM ca și greutățile modelului și încetinește vizibil viteza. Iar stack-ul software este uriașul tăcut: același silicon produce cifre material diferite sub vLLM, TensorRT-LLM, llama.cpp sau Ollama, motoarele din spatele celor mai mulțiconfigurări locale ale LLM.

Antrenamentul face ca efectul de stivă să fie măsurabil printr-un metric elegant:MFU, utilizarea FLOPs a modelului, cota dinamentei de calcul teoretic al unui GPU pe care efectiv îl folosește sesiunea dvs. de antrenament. Răspândirea publicată este surprinzătoare. Un ciclu de antrenament simplu, gata de utilizare, a fost măsurat la 7,7% MFU pe un A100, GPU-ul fiind inactiv mai mult de nouă secunde din zece. Rularea Meta's Llama 65B a atins 49,5% pe 2.048 de A100; Llama 3.1 a raportat între 38 și 43% pe clustere H100; iar o rulare bine optimizată a atins 56% din vârful specificat în fișa tehnică H100. Aceeași silicon, diferență de șase ori, doar software. Când un benchmark de antrenament raportează imagini sau tokeni pe secundă, MFU este verificarea onestității din spatele acestor cifre.

Gata să începi să minezi?

Livrare DDP gratuită în întreaga lume. Hosting profesional de la $0.055/kWh.

Ce este MLPerf și cum funcționează?

MLPerf, gestionat de consorțiul MLCommons, este cea mai apropiată asemănare a hardware-ului AI cu un tabel de scoruri independent, iar alegerile sale de proiectare vă învață cum arată benchmarking-ul riguros. Vânzătorii depun rezultate pe modele de referință fixe sub reguli auditate, în runde versionate (Inference v5.1 și v6.0 sunt edițiile din 2026). Divizia Closed blochează modelul și ținta de calitate pentru ca comparațiile hardware să fie clare; divizia Open permite optimizări. În inferență, rulările se efectuează în scenarii: Offline măsoară debitul maxim cu toate interogările disponibile simultan, în timp ce Server trimite interogări la intervale aleatorii și impune limite de latență pentru răspunsul la primul token și per-token, astfel încât un card doar avansează ceea ce poate servi în timp ce rămâne rapid pentru cei mai încetiniți utilizatori. Benchmark-urile de antrenament măsoară timpul pentru a antrena un model de referință până la o calitate definită, metricul care de fapt corespunde unei facturi în cloud.

Rezultatele MLPerf încă necesită abilități de citire. Înregistrarea de 2,5 milioane de tokeni pe secundă care a deschis acest articol a fost o performanță autentică de v5.1/v6.0 în divizia închisă, și de asemenea a fost o configurație de patru rafturi, 288-GPU; calculele pe chip nu reprezintă în mod explicit un indicator oficial. Rondele recente arată de asemenea cât de dependentă este clasarea de volumul de muncă: H200 aproape că dublează H100 pe un model de detectare, B200 dublează H200 pe generarea de imagini, totuși, pe detectare limitată de calcul cu o concurență modesta, un L40S umil competiționează mult peste clasa sa de preț. Rezultatele sistemului complet, între timp, sunt tot atât despreserver în jurul GPU-urilorși interconectarea la fel ca și cipurile însele, motiv pentru caresisteme la scară racksunt comparate ca unități.

Cum se calculează indicele nostru de inferență AI

NostruInstrument de testare pentru benchmark-uri GPU și server AIcompară 78 GPU-uri și 48 servere pe o scară unică de 100 de puncte, și după tot ceea ce s-a menționat anterior, acum puteți verifica exact cum este construită acea scară.
How the MillionMiner AI Inference Index is built: collect publicly published GPU-cloud benchmark data, score three real workloads (LLM inference, image generation, vision and OCR), index everything to RTX 3090 = 100, and report training throughput separately.
Indicele începe din publicdate publicate rezultate benchmark GPU-cloudorice numere pot fi verify, mai degrabă decât teste interne pe care nimeni nu le poate audita. Fiecare placă este evaluată pe trei familii de sarcini de lucru: inferență LLM de la asistente ușor de 8B la modele de peste 70B, generare de imagini prin difuzie de la pipeline-uri turbo la randări de producție, și viziune plus OCR pentru documente sub încărcare concurentă. Cele trei scoruri se agregă într-un număr unic indexat la RTX 3090 la exact 100 (936 GB/s, 24 GB: o referință suficient de familiară pentru cititori pentru a o simți intuitiv), astfel încât o placă care are un scor de 200 oferă aproximativ de două ori throughput-ul combinat al 3090.Spre throughput-ul de antrenament este menținut intenționat separat, demonstrat ca o figură de GPU unic publicată independent doar acolo unde există un benchmark corespunzător pentru această cartelă, deoarece combinarea antrenamentului cu un indice de inferență ar introduce în mod ilegal comparația tip "mere cu facturi" de care avertizează acest articol.

Limitele sunt specificate chiar pe instrumentul în sine și contează: un număr agregat nu poate captura fiecare volum de lucru, rezultatele sunt orientative mai degrabă decât garantii, iar stiva dvs., driver-ele și dimensiunea batch-urilor vor influența rezultatul. De aceea, instrumentul asociază indicele cu VRAM-ul brut, TFLOPS și un mod head-to-head, și de ce leagăGhid de alegere a GPU-ului în limbaj simplupentru cititorii care doresc decizia, nu metodologia.

Cum să citiți orice benchmark GPU fără să fiți păcălit

 The five-question test for any GPU benchmark: same workload, same precision, same batch and context, per-chip or per-system, and peak versus delivered numbers.
Totul în acest articol se reduce la cinci întrebări.Aceeași sarcină de lucru?Inferența, generarea de imagini și clasamentele de antrenament au loc diferit. Aceeași precizie? FP8 versus FP16 singure pot dubla scorul. Aceeași lot și context? Performanța pe lot-32 nu este aceeași cu cea pe lot-1. Pe chip sau pe sistem? Înregistrările principale sunt agregate ale rack-ului.Vârf sau livrat?Chiar și vârful specificației unui H100 in datasheet este in atingere în practică; aveați încredere în performanța măsurată. Rulați orice diapozitiv de la un vendor, pagina de prețuri cloud sau da, propria noastră tabelă prin acele cinci, iar comparările înșelătoare se vor evidenția singure. Majoritatea eșuează cel puțin în două cazuri.

Ce teste comparative nu pot să vă spună

Trei limite oneste, pentru că un articol despre metodologie care își ascunde propria metodologie ar fi absurd. În primul rând, benchmark-urile măsoară sarcini de lucru de referință, iar modelul dumneavoastră, prompturile și tiparul de trafic nu sunt sarcini de lucru de referință; singurul benchmark care prezice complet capacitatea de procesare este sarcina de lucru pe hardware închiriat pentru o după-amiază. În al doilea rând, cifrele sunt învechite: versiunile driver-elor și actualizările motorului mută în mod rutinier rezultatele de inferență cu procente de două cifre între runduri, așa că orice este mai vechi de câteva trimestre ar trebui considerat istorie. În al treilea rând, capacitatea de procesare nu este economie. O placă care câștigă tokeni pe secundă poate pierde costul pe token odată ce prețul, energia și utilizarea intră în ecuație, ceea ce ține de domeniul dematematică de hostingși planificarea la scară de facilități acoperite în cadrul nostruPilon pentru centrul de date AI, și motivul pentru careA100 vs H100decizia depinde de costul pe lucrare finalizată, nu de un singur punct de referință. Punctele de referință vă spun ce poate face hardware-ul. Cât ar trebui să vă coste să îl realizați este o a doua calculație, și ambele merită valori reale.

Rezumatul rezultatului final

Reperele GPU AI sunt calculate prin măsurarea muncii livrate pe sarcini definite: tokenuri pe secundă și latența primului token pentru inferența LLM, mostre pe secundă pentru generarea de imagini, timpul de antrenament pentru antrenare, agregate conform regulilor specificate, precum scenariile MLPerf sau indexul nostru RTX 3090 = 100. Numerele sunt de încredere exact în măsura în care metodologia este vizibilă, motiv pentru care publicăm și noi propriile noastre. Amintiți-vă fizica, prefill-ul este calcul, decode-ul este bandă; amintiți-vă formula şervețelului, banda peste bytes-ii modelului; verificați cele patru variabile de swing înainte de a compara orice; și apoi lăsați...instrument de referințăselectați hardware-ul dumneavoastră și...Magazin GPUPuneți-l în valoare. Dacă îl măsurați onest, numerele încetează să fie marketing și încep să fie inginerie, iar ingineria este partea pe care o puteți cumpăra efectiv.

Întrebări frecvent adresate

Cum sunt calculate benchmark-urile AI pentru GPU?
Prin măsurarea throughput-ului livrat pe sarcini de lucru definite, mai degrabă decât pe capacitatea teoretică: tokeni pe secundă și timpul până la primul token pentru inferența LLM, imagini sau probe pe secundă pentruGenerare și sarcini vizuale, precum și timpul până la antrenament pentru o calitate țintă. Baremele serioase fixează modelul, precizia, dimensiunea lotului și ținta de calitate, specifică stiva de software și publică rezultatele în runde auditabile (MLPerf) sau indice transparenți, astfel încât comparațiile să rămână valide.

Ceva bun în privința vitezei de tokeni-pe-secundă?
Pentru un singur utilizator, orice peste aproximativ 20 până la 30 de tokeni pe secundă are o viteză de procesare mai mare decât pot urmări majoritatea oamenilor, astfel încât configurațiile locale vizează această valoare ca și plafon. Infrastructura de servire gândește diferit: un H100 atinge limita de circa 209 tokeni/sec pe flux pentru un model FP16 de 8B ( plafonul de lățime de bandă ), dar servește mii de tokeni agregati pe secundă pentru utilizatori în loturi. Ținta potrivită depinde de ceea ce doriți să optimizați: experiența unui singur utilizator sau capacitatea de throughput a unei flote.

Ce reprezintă TFLOPS și de ce nu prezice performanța AI?
TFLOPS reprezintă trillioni de operații în virgulă flotantă pe secundă, un vârf teoretic presupunând condiții perfecte pe care codul de producție nu le atinge niciodată (capacitatea de procesare a matricelor a unui H100 atinge aproximativ 794 TFLOPS față de 989 pe fișa tehnică, iar cifrele de marketing dublează adesea valoarea prin sparsitate). Mai fundamental, generarea de tokeni LLM este limitată de banda de memorie, nu de calcul, astfel încât linia TFLOPS a unui card poate fi aproape irelevantă pentru tokenii pe secundă.

De ce este lățimea de bandă a memoriei atât de importantă pentru inferența LLM
Deoarece modelele de limbaj generează autoregresiv: producerea fiecărui token necesită citirea întregii seturi de greutăți ale modelului, plus cache-ul KV, din memoria GPU. Aceasta face ca faza de decodare să fie limitată de memorie, iar tokenii pe secundă să varieze în funcție de lățimea de bandă împărțită la dimensiunea modelului. De aceea avantajul de 2,8x al inference-ului real al H100 față de A100 se bazează pe lățimea de bandă și suportul FP8, mai degrabă decât pe capacitatea brută de calcul, și de ce upgrade-urile HBM sunt evidențiate în fiecare generație nouă.

Care este diferența dintre prefill și decode?
Prefill este faza care procesează solicitarea dumneavoastră: toate tokenurile de intrare într-o singură trecere paralelă, limitată de puterea de calcul, determinând timpul până la primul token. Decode este faza care scrie răspunsul: un token pe rând, limitată de memorie, determinând numărul de tokenuri pe secundă. O GPU poate fi puternică într-una dintre faze și slabă în cealaltă, motiv pentru care benchmark-urile de inferență cu un singur număr ascund cât arată și cele riguroase raportând ambele metrici.

Ce este MLPerf și cine îl administrează?
MLPerf este suita de benchmark-uri standard din industrie pentru AI, administrată de MLCommons, un consorțiu care include producători de cipuri, cloud-uri și grupuri de cercetare. Vânzătorii depun rezultate pe modele de referință fixe, conform regulilor auditate, în runde cu versiuni (Inference v5.1 și v6.0 în 2026). Divizia Closed blochează modelele pentru compararea curată a hardware-ului, scenariul Server impune limite de latență pentru ca throughput-ul să poată coexista cu ritmul de răspuns, iar benchmark-urile de antrenament măsoară timpul necesar pentru a ajunge la o calitate definită.

MFU în antrenamentul AI reprezintă "Model fréquemment utilisé" sau "Model frecvent utilizat" (în limba română). Acesta se referă la modelele de inteligență artificială care sunt utilizate frecvent sau foarte des în procesul de antrenament pentru diverse sarcini, cum ar fi recunoașterea imaginilor, procesarea limbajului natural sau alte aplicații AI. Aceste modele sunt adesea optimizate pentru performanță și eficiență, fiind partajate sau reutilizate în mai multe proiecte pentru a accelera procesul de dezvoltare și implementare.
Model FLOPs Utilization: ponderea din calculul teoretic al unui GPU pe care o rulare de antrenament o utilizează efectiv, calculată din fluxul de tokenuri realizat comparativ cu FLOPS-urile de vârf. Valorile publicate variază de la 7,7% pentru buclele de antrenament naive până la 49,5% pentru rularea Meta's Llama 65B, cu Llama 3.1 raportând între 38 și 43% pe clusteri H100. Această diferență de șase ori pe silicon identic explică de ce stack-ul software este la fel de un factor de referință ca și hardware-ul.

Dațiunează o GPU mai rapidă prin cuantizare?
Facilitează inferența mai rapid pe aceeași GPU prin reducerea numărului de octeți pe fiecare token care trebuie mutat: FP8 aproape dublează viteza de decodare față de FP16, iar metodele INT4 precum GPTQ și AWQ o pot tripla, deoarece faza de decodare limitată de memorie scalează cu dimensiunea modelului în octeți. Hardware-ul GPU-ului nu s-a schimbat; sarcina de lucru a devenit mai ușoară. Impactul asupra calității depinde de model și de sarcină, motiv pentru care benchmark-urile oneste indică întotdeauna precizia utilizată.

De ce diferite site-uri afișează repere diferite pentru aceeași GPU?
Pentru că rezultatele variate ale celor patru setări pot crea diferențe de ordinul mai multor ori: dimensiunea lotului (viteză pentru un singur utilizator versus debit batch), precizia (FP16 versus FP8 versus INT4), lungimea contextului ( încărcarea cache-ului KV) și stack-ul software (vLLM, TensorRT-LLM, llama.cpp și Ollama au performanțe diferite pe același silicon). Două site-uri oneste care testează configurații diferite vor publica valori diferite. Înainte de a avea încredere într-o comparație, verificați dacă toate cele patru setări se potrivesc.

Cum se calculează indicele de inferență AI MillionMiner?
Patru pași: colectați date de referință publicate despre benchmarking GPU-cloud (verificabile, fără estimări interne); punctați fiecare placă pe trei categorii de sarcini de lucru (inferență LLM de la 8B până la 70B+, generare de imagini prin difuzie și viziune plus OCR sub sarcină); agregați pe o scară unificată indexată la RTX 3090 la 100, astfel încât 200 înseamnă aproximativ de două ori capacitatea de procesare combinată a 3090; și raportați randamentul de antrenament separat, doar dacă există o cifră publicată independent pentru exact acea placă. Asumțiile și limitele sunt menționate în instrumentul în sine.

Ar trebui să acordați încredere testelor de referință ale vânzătorilor pentru GPU?
Acordați-le în calitate de intrări, nu de verdicte. Numerele furnizorului sunt de obicei măsurători reale efectuate în cele mai favorabile condiții: precizie în cel mai bun caz, sparsitate activată, agregate la scară rack, cel mai recent software. Aplicați testul celor cinci întrebări (aceeași încărcare de lucru, precizie, lot și context, pe-chip față de pe-sistem, vârf față de livrat) și verificați încrucișat cu surse independente precum runde MLPerf. Când o afirmație rezistă celor cinci întrebări, este probabil utilă.

Surse și note
Rezultatele și regulile MLPerf de la MLCommons (Inference v5.1 și v6.0, runde 2026); cifra de 2,5M tokens/sec reprezintă trimiterea în divizia închisă a NVIDIA pe 288 de GB Blackwell Ultra GPU-uri, cu diviziunea pe chip neegală fiind o metrică neoficială. cifre MFU din rapoartele de instruire publicate: Llama 65B a Meta (49,5%) și Llama 3.1 (38 până la 43% pe H100), plus măsurători tehnice publicate ale intervalelor de bază naive-stack (7,7%) și debitul matricei H100 realizabil (~794 din 989 TFLOPS). cifrele de lățime de bandă și capacitate din specificațiile NVIDIA. plafonurile de tokens-pe-secundă sunt maxime teoretice pentru lotul 1; sistemele reale livrează 60 până la 85% din acestea. Toate cifrele sunt instantanee din mijlocul anului 2026; rezultatele benchmark variază odată cu versiunile software. Erou: Steve Jurvetson, CC BY 4.0; corp: Wikimedia Commons, CC0. Diagrame: graficele originale MillionMiner, gratuite pentru reutilizare cu atribuție și link către această pagină. Conținut informațional, nu sfaturi de achiziție

Gata să începi să minezi?

Livrare DDP gratuită în întreaga lume. Hosting profesional de la $0.055/kWh.

MillionMiner Team

Scris de

MillionMiner Team

Mining Hardware Operators

The MillionMiner editorial team is made up of professional miners who collectively operate over 30,000 ASICs and ship hardware to clients worldwide every day.

Comentarii 0

Vă rog autentificare să lași un comentariu

Șterge Comentariul?

Această acțiune nu poate fi anulată.