आपकी कंपनी में किसी ने तय कर लिया है कि अभी अपने हार्डवेयर पर AI चलाने का समय है। हो सकता है कि आप अपनी आंतरिक दस्तावेज़ों को जानने वाला एक निजी चैटबॉट चाहते हैं, उत्पाद टीम के लिए एक इमेज पाइपलाइन, या फिर एक मॉडल जो बड़े पैमाने पर इनवॉइस पढ़ सके। और अब आप GPU की तुलना कर रहे हैं — TFLOPS, VRAM और इंटरकनेक्ट ऐक्रोनिम्स से भरे स्पेक शीट्स को देखते हुए, जबकि हर विक्रेता सबसे तेज होने का दावा करता है।
यह मार्गदर्शिका ठीक उसी क्षण के लिए लिखी गई है। यह सरल भाषा में समझाती है कि GPU बेंचमार्क वास्तव में क्या मापते हैं, किस आंकड़े का AI कार्य के लिए महत्व है और किन को आप सुरक्षित रूप से अनदेखा कर सकते हैं, और यह कैसे पता करें कि आपकी उपयोग केस को वास्तव में कितनी हार्डवेयर की आवश्यकता है। अंत में आप किसी भी GPU स्पेसिफिकेशन शीट को पढ़ सकते हैं, अपने आप दो कार्डों की तुलना कर सकते हैं, और जान सकते हैं कि पाँच या छह आंकड़े के बजट से पहले किन सवालों को पूछना जरूरी है।
एक GPU बेंचमार्क वास्तव में आप को क्या बताता है
एक मानदंड एक दोहराए जाने योग्य परीक्षण है: वही कार्य, वही शर्तों के तहत, विभिन्न हार्डवेयर पर। क्योंकि कार्य नहीं बदलता, परिणामों की तुलना निष्पक्ष रूप से की जा सकती है — कार्ड A इस कार्यभार को इतनी तेजी से पूरा किया, कार्ड B ने इसे इतनी जल्दी पूरा किया। बस यही एक मानदंड है, और यह खरीदार के पास सबसे उपयोगी उपकरण है।
यह महत्वपूर्ण है क्योंकि केवल स्पेक शीट आपके प्रश्न का उत्तर नहीं दे सकती। निर्माता सैद्धांतिक अधिकतम प्रदर्शन प्रकाशित करते हैं — जो गणना एक चिप निरंतर प्रयोगशाला की स्थिति में कर सकता है। वास्तविक AI कार्य अधिक जटिल होता है: डेटा को मेमोरी में इन और आउट करना पड़ता है, सॉफ्टवेयर ओवरहेड जोड़ता है, और विभिन्न कार्य कार्ड के विभिन्न भागों को तनाव देते हैं। दो GPU समान पेपर स्पेक्स के साथ भी, वे वास्तविक भाषा मॉडल चलाने के बाद बहुत अलग व्यवहार कर सकते हैं।
यही कारण है कि कार्यभार मापदंड आंकड़े पढ़ने लायक हैं। एक अमूर्त स्कोर के बजाय, ये मापते हैं कि AI हार्डवेयर वास्तव में पूरे दिन कौन-कौन से काम करता है: भाषा मॉडल के साथ टेक्स्ट उत्पन्न करना, डिस्फ़्यूज़न मॉडल के साथ छवियां बनाना, और छवियों को पढ़ना या विश्लेषण करना। यदि आपका योजनाित उपयोग मामला कार्यभार से मेल खाता है, तो मापदंड आपको कुछ वास्तविक बताता है।
एक ईमानदार सीमा, शुरू में ही: बेंचमार्क सामान्य बिंदु हैं, आश्वासन नहीं। परिणाम ड्राइवर संस्करणों, सॉफ्टवेयर फ्रेमवर्क, बैच साइज़ और मॉडल सेटिंग्स के साथ बदलते हैं। एक गंभीर तुलना — जिसमें हमारी भी शामिल है — सार्वजनिक रूप से प्रकाशित बेंचमार्क डेटा से बनी होती है और हमेशा यही कहेगी। इस मार्गदर्शिका में हर संख्या, और किसी भी तुलना पृष्ठ पर, एक मार्गदर्शन के रूप में लें, न कि एक वादा किए गए परिणाम के रूप में।

Reading a benchmark chart: one baseline, proportional bars, and a healthy dose of context.
जब आप AI हार्डवेयर की तुलना करते हैं, तो 13 महत्वपूर्ण शर्तें
आपको सही GPU खरीदने के लिए अभियांत्रिकी की डिग्री की आवश्यकता नहीं है। आपको तेरह टर्म्स की आवश्यकता होती है, जिन्हें यहां इस क्रम में क्रमबद्ध किया गया है जैसा कि वे आपके वास्तविक खरीद निर्णय में मिलेंगे।
मॉडल और इसकी आवश्यकताएँ

Inference runs the model. Training teaches it — and typically needs two to four times the memory.
आप जो गति महसूस कर सकते हैं
छिपा हुआ बाधा
स्केलिंग और लागत
इनमें से प्रत्येक शब्दहमारे प्रकाशित स्तंभ या लेबल के रूप में मौजूद है।
GPU तुलना तालिका, इसलिए आप उन्हें अमूर्त परिभाषाओं के बजाय असली कार्डों से संलग्न देख सकते हैं।
आपको वास्तव में कितनी GPU की आवश्यकता है?
मॉडल का आकार आधार तय करता है। एक सामान्य रूप से प्रकाशित अनुमानित गणना: पूर्ण FP16 सटीकता पर, एक मॉडल को लगभग 2 GB VRAM प्रति बिलियन पैरामीटर की आवश्यकता होती है। क्वांटाइजेशन उस आवश्यकता को कम करता है — INT8 को लगभग आधा और INT4 को लगभग चौथाई चाहिए। वज़नों की आवश्यकताओं के अलावा, कैशेस और एक्टिवेशन के लिए लगभग 15 से 20 प्रतिशत अतिरिक्त योजना बनाएं, और यदि आप लंबी संदर्भ विंडोज़ चाहते हैं तो और भी अधिक।
इस तालिका पर दो व्यावहारिक नोट्स। पहले, ये वजन और सामान्य ओवरहेड के अनुमानों हैं — एक लंबी संदर्भ विंडो या बड़ी बैच अधिक जोड़ती है। दूसरे, प्रशिक्षण सभी कुछ बदल देता है: मॉडल को सिखाना या फाइन-ट्यून करना आमतौर पर इसे चलाने की तुलना में दो से चार गुना अधिक मेमोरी की आवश्यकता होती है क्योंकि ग्रेडिएंट्स और ऑप्टाइज़र की स्थिति_weights के साथ VRAM में रहती है।
गति उसी तरह से एक समान तर्क का अनुसरण करती है। अनुमानों के लिए, मेमोरी बैंडविड्थ आमतौर पर नियंत्रित करता है कि टोकन कितनी जल्दी प्रकट होते हैं, इसी कारण डेटा-सेंटर कार्ड्स जिनमें HBM मेमोरी होती है, बड़े मॉडल्स पर अपनी TFLOPS की तुलना में अधिक तेजी से महसूस होते हैं।

The memory ladder: what common model sizes need at full precision versus quantized to INT4.
यदि आप गणना से बचना चाहें, तो हमने प्रत्येक कार्ड को चार व्यावहारिक वर्गों में विभाजित किया है — प्रोटोटाइपिंग के लिए प्रवेश हार्डवेयर से लेकर 70B से अधिक उत्पादन सेवा प्रदान करने वाले फ्लैगशिप कार्ड तक — में
तुलनात्मक पृष्ठ पर कार्यभार स्तर.
यह पता लगाने के लिए कि कौन सा GPU बेहतर है: चार प्रश्नों की जांच सूची
जब आपकी सूचि में दो कार्ड होते हैं, चार सवाल लगभग हर तुलना का निर्णय कर लेते हैं।
एक और तकनीक है जो तुलना को बहुत आसान बनाती है: सूचकांक। चार स्पेक शीट्स का प्रबंधन करने के बजाय, प्रत्येक कार्ड को एक हीाकर पर रखें। हमारी तुलना पृष्ठ प्रत्येक GPU को LLM inference, छवि सृजन और दृष्टि कार्यभार के आधार पर अंकित करती है, फिर उसे RTX 3090 के मुकाबले 100 अंकों की आधार रेखा के रूप में सूचीबद्ध करती है — 200 का स्कोर अर्थ है कि उस प्रसिद्ध कार्ड का औसत थ्रूपुट लगभग दोगुना है। अचानक ही यह सवाल कि कौन बेहतर है, एक नजर में जवाब मिल जाता है।

One scale for every card: when the RTX 3090 is 100, a 403 speaks for itself.
मुफ्त में तुलना करने का तरीका: GPU बेंचमार्क टूल के अंदर
पूर्ण स्पष्टता: यहाँ वर्णित उपकरण हमारा है। यह नि:शुल्क है, यह किसी साइनअप के बिना काम करता है, और यह इसलिए मौजूद है क्योंकि हमने ग्राहकों के लिए बार-बार समान तुलना प्रश्नों का उत्तर हाथ से दिया। यहाँ प्रत्येक भाग क्या करता है — जिसमें ऐसा क्या नहीं कर सकता, भी शामिल है।
78-GPU तालिका
हर वर्तमान कार्ड को एक sortable तालिका में रखें: VRAM, AI Inference सूचकांक जो एक अनुपातवादी बार के साथ है, सैद्धांतिक FP16 TFLOPS, प्रकाशित प्रशिक्षण थ्रूपुट जहां यह मौजूद है, और प्रत्येक कार्ड के सर्वोत्तम उपयोग के बारे में एक सरल भाषा में नोट। VRAM वर्ग के अनुसार फ़िल्टर करें, नाम से खोजें, और किसी भी कॉलम को क्रमबद्ध करें। a
उच्चतम तीनों का मंचयह उसके ऊपर बैठता है जो अधीर है।
यह ईमानदारीपूर्वक सीमा है: GPU तालिका जानबूझकर कीमतें नहीं दिखाती। AI हार्डवेयर के बाजार मूल्य साप्ताहिक रूप से बदलते हैं, और पुराना मूल्य कोई नहीं होने से बेहतर है — कीमतें कोटेशन में होती हैं, स्थैतिक तालिका में नहीं।
प्रतियोगिता के बीच मुकाबला
कोई भी दो कार्ड चुनें और
आर्टीनाविराम, अनुमान सूचकांक, FP16 गणना और प्रशिक्षण थ्रूपुट को आईनों की तरह दिखने वाली पट्टियों के रूप में रखें, इसके साथ ही एक सादा अंग्रेज़ी में एक वाक्य में लिखा हुआ निर्णय भी जोड़ें। यह दो shortlisted कार्ड के बीच आंतरिक बहस को सुलझाने का सबसे तेज़ तरीका है।
इसके सीमा: निर्णय प्रकाशित सूचकांक को दर्शाता है, आपके सटीक सॉफ्टवेयर स्टैक को नहीं। एक कार्ड जो सूचकांक जीतता है, वह आपके विशिष्ट फ्रेमवर्क या मॉडल संस्करण पर हार भी सकता है — इसलिए निर्णय मार्जिन का नाम लेता है न कि एक लैब रिपोर्ट बनने का दिखावा करता है।

The arena in three steps: pick two cards, compare the bars, read the verdict.
48 पूर्ण एआई सर्वर
जब एक कार्ड पर्याप्त नहीं होता, तुलना का मानक बदल जाता है: एक मल्टी-GPU सर्वर को उसके संयुक्त मेमोरी और संयुक्त गणना के आधार पर आंका जाता है।
सर्वर अनुभागसूची में 48 पूर्ण प्रणालियाँ हैं — कॉम्पैक्ट वर्कस्टेशन से लेकर 8-GPU रैक मशीनें — जिनमें कुल VRAM और कुल FP16 गणना समान स्केल पर की गई है जैसे कि एकल कार्ड्स, ताकि पूरे पृष्ठ में संख्या तुलनीय बनी रहे।
स्तर, कार्यप्रणाली और बारीक बातें
The
कार्यभार स्तरहार्डवेयर श्रेणियों का सरल उपयोग मामलों में अनुवाद करें — Flagship 70B प्लस मल्टी-टेनेंट सेवा के लिए, High-End 30B से 70B उत्पादन कार्य के लिए, Mid-Range 8B से 30B श्रेणी के लिए, Entry प्रोटोटाइपिंग और सीखने के लिए। कार्यप्रणाली को खुलकर प्रकाशित किया गया है: केवल सार्वजनिक रूप से उपलब्ध बेंचमार्क डेटा, तीन वास्तविक कार्यभार परिवार, हर चीज़ को RTX 3090 पर 100 पर सूचकांकित किया गया है। और पृष्ठ अपने खुद के अस्वीकरण को पुन: प्रस्तुत करता है, जिसे हमने यहां दोहराया है: दिशा निर्देश के लिए संदर्भ डेटा, प्रदर्शन का आश्वासन नहीं।
16 प्रश्नों वाला FAQकवर करता है विवरण।
पहली बार खरीदारों द्वारा की जाने वाली पांच गलतियां
शॉर्टलिस्ट से कोटेशन तक: क्या तैयारी करें और आगे क्या होगा
किसी बिंदु पर स्प्रेडशीट चरण समाप्त हो जाता है और आप एक सप्लायर से बात करते हैं। यदि आप पाँच तथ्य प्रस्तुत करते हैं तो बातचीत संक्षिप्त और प्रभावी होती है:
उन उत्तरों के साथ, यहाँ यह हमारे साथ कैसे काम करता है, इसे स्पष्ट रूप से कहा गया है: आप प्रश्न को भेजते हैं
सामान्य तुलना पृष्ठ पर फॉर्मया WhatsApp या Telegram के माध्यम से, और एक वास्तविक इंजीनियर — न कि बॉट — जवाब देता है, आमतौर पर लगभग दो घंटे के अंदर। पृष्ठ पर 78 GPU और 48 सर्वर वही हैं जो हम सार्वजनिक रूप से सूचीबद्ध करते हैं; हम उससे कहीं अधिक स्रोत कर सकते हैं, B2B और मात्रा कीमतें प्रदान कर सकते हैं, विश्वसनीय रूप से शिप कर सकते हैं, या हमारे होस्टिंग सुविधाओं में आपके हार्डवेयर को चलित कर सकते हैं। और स्वयं को सही तरीके से प्रस्तुत करने के लिए: MillionMiner एक रीसिलर और होस्टिंग प्रोवाइडर है, निर्माता नहीं — इसी कारण से कोई भी सिफारिश किसी एक ब्रांड से जुड़ी नहीं होती।
Get a free hardware recommendation
Tell us your model, your users and your timeline — an engineer replies with a concrete suggestion, usually within two hours.
Ask your questionFree, no obligation, no signup.
बार बार पूछे जाने वाले प्रश्न
क्या हमें एआई सर्वर खरीदने के लिए इन-हाउस हार्डवेयर विशेषज्ञता की आवश्यकता है?
नहीं। यदि आप ऊपर दिए गए पाँच तैयारी प्रश्नों का उत्तर दे सकते हैं — मॉडल, उपयोगकर्ता, विलंबता, अनुमान या प्रशिक्षण, स्थान — तो एक सक्षम प्रदाता उन्हें हार्डवेयर में अनुवाद कर सकता है। इस मार्गदर्शिका में शब्दावली मौजूद है ताकि आप उनके तर्क की जांच कर सकें, न कि इसे करने के लिए आपका काम।
क्या हमें GPU खरीदने चाहिए या उन्हें क्लाउड में किराए पर लेना चाहिए?
एक व्यापक रूप से प्रकाशित पैटर्न: निरंतर उच्च उपयोगिता पर चलने वाले कार्यभार अपने स्वामित्व वाले हार्डवेयर के लिए आश्चर्यजनक रूप से जल्दी भुगतान करते हैं, जबकि झटकेदार या प्रयोगात्मक कार्यभार किराए पर लेना बेहतर होता है। बहुत से व्यवसाय मध्य में आते हैं — हार्डवेयर का स्वामित्व प्राप्त करना और इसे होस्ट करना, जो कि प्रत्याशित लागत के साथ-साथ सुविधा कार्य से मुक्त होता है। फैसला करने से पहले अपनी वास्तविक उपयोगिता पर आंकड़े चलाएँ।
क्या एक क्वांटीकृत मॉडल में स्पष्ट गुणवत्ता की कमी होती है?
प्रकाशित मूल्यांकन लगातार FP8 को अधिकांश कार्यों के लिए पूर्ण सटीकता से लगभग indistinguishable दिखाते हैं, और INT4 को एक छोटी, कार्य-निर्भर व्यापार विकल्प के रूप में। समझदारी वाला तरीका है कि आप अपने विशिष्ट उपयोग मामले का परीक्षण करें उस मात्रा स्तर पर जिस पर आप चलाने की योजना बना रहे हैं — इससे पहले कि आप हार्डवेयर का आकार तय करें।
आपको कोटेशन का अनुरोध करने से पहले कौनसी जानकारी तैयार करनी चाहिए?
मॉडल और इसकी आकार, अपेक्षित सह-अस्तित्व में उपयोगकर्ताओं या अनुरोध मात्रा, आपकी विलंबता की अपेक्षा, क्या आप प्रशिक्षण के साथ-साथ इंफेरेंस भी चाहते हैं, और हार्डवेयर कहाँ स्थित होना चाहिए। पाँच उत्तर — यही पूरा गृह कार्य है।
क्या हमें अगली GPU पीढ़ी का इंतजार करना चाहिए?
हमेशा एक अगली पीढ़ी होती है। दो से तीन वर्षों के कार्यभार पूर्वानुमान के लिए खरीदारी करें: यदि आज उपलब्ध हार्डवेयर आपके वर्तमान और निकट भविष्य के मॉडलों की सेवा करता है और उसमें अतिरिक्त स्थान है, तो प्रतीक्षा करने में वह केवल उन महीनों के मूल्य को खोने जैसी है जो आपने कब्जा नहीं किया। नई पीढ़ियाँ आमतौर पर मेमोरी और दक्षता बढ़ाने की ओर प्रवृत्त होती हैं बजाय कि वर्तमान क्षमताओं को बदलने के।
निष्कर्ष
मॉडल आकार आपकी स्मृति मंजिल निर्धारित करता है। मेमोरी बैंडविड्थ आपकी वास्तविक गति तय करता है। बेंचमार्क — एक संदर्भ डेटा के रूप में पढ़ें, जो एक आधाररेखा से सूचकांकित है — किसी भी दो उम्मीदवारों के बीच तुलना स्थापित करता है। बाकी सब आपकी अपनी कार्यभार पर गणित है।
Compare 78 GPUs and 48 servers on one scale
Free, no signup — sortable benchmarks, head-to-head duels and a team that answers real questions.
Open the comparison