NVIDIA

Nvidia H100 SXM (80GB) وحدة معالجة الرسومات الذكاء الاصطناعي والحوسبة عالية الأداء

طراز: H100 SXM

اطلب عرض سعر لعقدة GPU الخاصة بك

أخبرنا بمتطلبات النشر الخاصة بك. يرد أخصائي الأجهزة الذكية لدينا خلال 24 ساعة عبر البريد الإلكتروني أو واتساب أو الاتصال.

لماذا تُباع وحدات GPU عن طريق الاستشارة

عناقيد الـGPU لأعباء عمل الـAI وHPC مهيأة لتلبية متطلباتك الدقيقة — من حيث الكمية، وطوبولوجيا الاتصال، واستهلاك الطاقة، والتبريد، كل ذلك يؤثر على السعر النهائي. قدم النموذج أدناه وسيقوم اختصاصيينا بالرد خلال 24 ساعة بعرض أسعار كامل ومفصل مصمم خصيصًا لنشر تطبيقاتك.

كيف تعمل طلبية GPU الخاصة بك

1

إرسال النموذج

أخبرنا بحالتك الاستخدامية والكمية

2

احصل على عرض السعر الخاص بك

الأسعار الكاملة خلال 24 ساعة

3

مراجعة مع متخصص

ناقش التكوين، الاتصال البيني، التبريد

4

نشر

المعدات تم شحنها وجاهزة للتشغيل

حقيقي

الأجهزة المختبرة

عالميًا

الشحن العالمي

الدعم

خبراء التعدين

NVIDIA H100 SXM5 GPU بذاكرة Tensor Core سعة 80GB. بنية Hopper (GH100، TSMC 4 نانومتر، 80 مليار ترانزستور). 16,896 نواة CUDA، 528 نواة Tensor من الجيل الرابع مع محرك Transformer FP8، و132 نواة RT. ذاكرة HBM3 بسعة 80GB على ناقل بحجم 5,120-بت بسرعة عرض النطاق 3,350 جيجابايت/ثانية. قدرة حسابية 67 TFLOPS للـ FP32، 989 TFLOPS للـ TF32 (بفضل التفرقة)، و3,958 TFLOPS للـ FP8 (بفضل التفرقة). TDP قابل للتكوين حتى 700W. شكل mezzanine من نوع SXM5 لللوحات الأساسية HGX. NVLink 4.0 بسرعة 900 جيجابايت/ثانية لكل GPU مع NVSwitch الذي يربط حتى 8 وحدات معالجة رسومات في عقدة واحدة. ميزة MIG لبيئات تحتوي على حتى 7 حالات معزولة بسعة 10GB لكل منها. المعيار لتدريب نماذج الذكاء الاصطناعي على نطاق واسع عبر مراكز البيانات ذات السحابة الفائقة والمؤسسات في جميع أنحاء العالم.

المواصفات الكاملة

نموذج H100 SXM

اطلب عرض استضافة TX Miner لبيتكوين

عرض مجاني، الرد خلال 24 ساعة. بدون مكالمات مبيعات.

4.4
نجم نجم نجم نجم نجم

4.7 / 5 على Trustpilot

مراجعات العملاء الموثوقة

تم تسليم أكثر من 30,000 جهاز تعدين

تم الشحن في جميع أنحاء العالم منذ عام 2020

أكثر من 1,200 عميلًا عالميًا

موثوق به في أكثر من 50 دولة

معرّف الجهة المصدرة (ISO) صنع في ألمانيا تراست بيليت
تقييم جوجل

احصل على عرض سعر لـ Nvidia H100 SXM (80GB) وحدة معالجة الرسومات الذكاء الاصطناعي والحوسبة عالية الأداء

التسعير، وقت التنفيذ، وخيارات الاستضافة. نصيحة شخصية من فريق المبيعات لدينا.

الرد خلال 24 ساعة عبر البريد الإلكتروني، واتساب، أو اتصال.

تفاصيل المنتج

بطاقة GPU من نوع NVIDIA H100 SXM5 80GB Tensor Core: المواصفات الكاملة لـ Hopper، بنية NVSwitch، ونشر تدريب الذكاء الاصطناعي للمؤسسات

يوجد نوع H100 SXM لأن التدريب على الذكاء الاصطناعي الموزع يعاني من مشكلة عرض النطاق الترددي التي لا يمكن لـ PCIe حلها. يتطلب تدريب نموذج يحتوي على 70 مليار معلمة عبر عدة وحدات معالجة الرسومات تبادل تحديثات التدرج مع كل وحدة رسومات بعد كل تمريرة أمامية وتمريرة رجعية. عند استخدام PCIe Gen 5 بسرعة 128 جيجابايت/ثانية، تصبح تلك التبادلات للتدرج عنق زجاجة قبل أن تنفد قدرة الحوسبة لدى وحدات المعالجة الرسومية. NVLink 4.0 بسرعة 900 جيجابايت/ثانية لكل وحدة رسومات (7 أضعاف PCIe) و NVSwitch الذي يربط جميع وحدات المعالجة الرسومية الثمانية في عقدة بسرعة كاملة، يقضي على ذلك العنق الزجاجة. لذلك، تعتمد جميع عمليات نشر تدريب الذكاء الاصطناعي الجدية على SXM، وليس PCIe. المواصفات الكاملة لرقاقة GH100. 80 مليار ترانزستور بتقنية TSMC 4nm. 16,896 نواة CUDA عبر 132 وحدة SM (تمكين كامل للرقاقة على SXM مقابل 114 وحدة SM على PCIe). 528 نواة Tensor من الجيل الرابع تدعم FP64، TF32، FP16، BF16، FP8، و INT8 مع محرك Transformer. 132 نواة RT من الجيل الثالث. 80 جيجابايت HBM3 على ناقل عرض 5,120-bit بسرعة 3,350 جيجابايت/ثانية. ذاكرة مخبأة L2 بسعة 50 ميجابايت. يوفر شكل SXM5 حوالي 30 بالمائة زيادة في TFLOPS مقارنةً بنسخة PCIe (67 مقابل 51 TFLOPS FP32) بسبب تردد التشغيل الأعلى الممكن بواسطة ميزانية الطاقة 700W والبنية الحرارية لـ HGX. قوة الحوسبة بكل مستوى دقة. FP64: 34 TFLOPS (67 TFLOPS بدقة Tensor). FP32: 67 TFLOPS. Tensor TF32: 989 TFLOPS مع التخصيص نادرى الاستخدام. Tensor FP16/BF16: 1,979 TFLOPS مع التخصيص نادرى الاستخدام. Tensor FP8: 3,958 TFLOPS مع التخصيص نادرى الاستخدام. Tensor INT8: 3,958 TOPS مع التخصيص نادرى الاستخدام. القيمة الخاصة بـ FP8 مهمة جدًا لتدريب التحويلات: 3,958 TFLOPS مع إدارة الدقة التلقائية عبر محرك Transformer، مما يجعل H100 SXM يوفر حوالي أربع مرات سرعة التدريب لنماذج GPT بالمقارنة مع A100 SXM. هيكل NVLink و NVSwitch. كل وحدة H100 SXM تتصل بنسيج NVSwitch عبر 18 رابط NVLink 4.0 بسرعة 900 جيجابايت/ثانية ذات اتجاهين. يوفر NVSwitch اتصالًا من جميع إلى جميع: يمكن لأي وحدة رسومات التواصل مع أي وحدة أخرى ضمن نفس العقدة بسرعة كاملة 900 جيجابايت/ثانية دون تمرير البيانات عبر وحدة المعالجة المركزية أو ناقل PCIe. تقدم عقدة HGX H100 المكونة من 8 وحدات رسومات 7.2 تيرابايت/ثانية من عرض النطاق الترددي الإجمالي عبر NVLink لجميع الوحدات. للدعم عبر عدة عقد، يمد نسيج InfiniBand من نوع NVIDIA Quantum-2 NDR بسرعة 400 جيجابايت/ثانية لكل منفذ الشبكة، النسيج ليشمل أكثر من عقدة واحدة. مقارنة DGX H100 مع HGX H100. DGX H100 هو نظام جاهز من NVIDIA يتضمن 8 وحدات رسومات SXM بسعر يتراوح بين 250,000 و400,000 دولار، ويشمل المعالجات، والذاكرة، والتخزين، والشبكة، وطبقة البرامج. بينما هو منصة مدمجة من نوع HGX H100، وهو وحدة لوحة أساسية لوحدات خوادم OEM (مثل Supermicro، Dell، HPE، Lenovo) التي تدمجها في منصاتهم الخاصة. كلاهما يستخدم نفس تكوين 8 وحدات H100 SXM مع NVSwitch. يوفر مسار HGX مرونة أكبر فيما يخص خيارات المعالج المركزي، والتخزين، والشبكة. إطار اتخاذ القرار بين SXM و NVL و PCIe. SXM (هذا المنتج): أعلى أداء لكل وحدة، توسع NVSwitch من 8 وحدات رسومات، TDP 700W، يتطلب لوحة HGX، مُحسن للتدريب الموزع. NVL (H100 NVL 94GB، قائمة مميزة لـ MillionMiner): بطاقات PCIe مزدوجة، ذاكرة موحدة 94GB، مناسبة للخوادم القياسية، مُحسنة للاستدلال على نماذج كبيرة. PCIe (H100 قياسية 80GB PCIe): بطاقة واحدة بقدرة 350W، فتحات خادم قياسية، تكلفة أقل، محدودية باثنين من روابط NVLink، مناسبة للاستدلال الفردي وتعديل النماذج بدقة منخفضة. اختر SXM عندما يكون التدفق العالي للتدريب وكفاءة التوسع متعدد الوحدات الرسومية من الأولويات. اختر NVL أو PCIe عند الحاجة إلى استدلال أو تبسيط البنية التحتية. إنشاء مثيلات معزولة حتى 7 على H100 SXM بدقة 10GB لكل منها باستخدام تقنية MIG. أكثر أنماط الإنتاج الشائعة عبر Spheron: 7x 1g.10gb لاستدلال متعدد المستخدمين لنماذج صغيرة، أو 2x 3g.40gb لخادمين لنماذج 13 مليار معلمة في آن واحد. تظهر كل مثيل MIG كجهاز GPU منفصل لنظام التشغيل مع عزل مُطبق على مستوى الأجهزة. الحوسبة الموثوقة عبر بيئة التنفيذ الموثوقة (TEE) توفر حماية للبيانات وأوزان النماذج أثناء المعالجة. وهو ميزة أمان على مستوى الأجهزة لضمان الامتثال في تطبيقات الذكاء الاصطناعي الحساسة، مثل الرعاية الصحية (HIPAA)، والمالية (SOC 2)، والحكومية (FedRAMP) حيث لا يمكن كشف البيانات لمشغل البنية التحتية. قدرة TDP قابلة للتكوين حتى 700W. تتطلب تبريد سائل أو تصميم هيكل خادم ذو تدفق عالي للهواء. التبريد الجوي العادي غير كافٍ للعمل المستمر عند 700W. يستخدم نظام NVIDIA DGX H100 التبريد السائل المباشر. كما تقدم تكوينات HGX H100 من Supermicro و Lenovo خيارات تبريد هوائي وسائل حسب الميزانية الحرارية.

NVIDIA H100 SXM5 80GB: المعيار التدريبي متعدد وحدات المعالجة الرسومية بسرعة 900 جيجابايت/ثانية NVLink و3.350 جيجابايت/ثانية HBM3

يعد الـ H100 SXM وحدة معالجة الرسوميات التي يُقارن بها كل مُسرع ذكاء اصطناعي آخر. عندما تنشر NVIDIA و Google و Meta و Microsoft و OpenAI معايير تدريب، فهي تُجري الاختبارات على مجموعات h100 SXM. وعندما يقتبس مزودو السحابة سعة الحوسبة الذكية، يقيمونها بمقاييس h100 SXM. هذا هو hardware المرجعي للجيل الحالي من الذكاء الاصطناعي. ما يميز الـ SXM عن نسخة PCIe هو الاتصال والطاقة. يوفر NVLink 4.0 عرض نطاق ترددي ثنائي الاتجاه يبلغ 900 جيجابايت/ثانية لكل GPU، ويُوصل حتى 8 وحدات معالجة رسومات H100 SXM عبر NVSwitch في عقدة DGX أو HGX واحدة. هذه الـ 900 جيجابايت/ثانية أسرع بـ 7 مرات من PCIe من الجيل 5 (128 جيجابايت/ثانية) وتُمكن من التدرج تقريبًا بشكل خطي على أعباء العمل التدريبية المُوزعة حيث تكون مزامنة التدرج بين الـ GPU هي عنق الزجاجة. يبلغ الحد الأقصى لنسخة PCIe من الـ H100 زوجًا من NVLink بين GPU. بينما يُمكن للـ SXM التدرج إلى عقد من 8 وحدات معالجة رسومات وما يتجاوزها عبر تجمعات InfiniBand متعددة العقد. يعمل كامل شريحة GH100 بسرعة حتى 700 واط (يمكن ضبطها)، ويُوفر 16896 نواة CUDA و 528 نواة tensor من الجيل الرابع مع محرك Transformer FP8. تغذي هذه النوى ذاكرة 80GB HBM3 بسرعة 3,350 جيجابايت/ثانية دون تعرضها لنقص الذاكرة أثناء تدريب الدفعات الكبيرة. يُدير محرك Transformer تلقائيًا الدقة المختلطة FP8/FP16 لكل طبقة شبكة عصبونية، ويُقدِم أداء تدريب مُضاعف بأربع مرات مقارنة بـ A100 على هياكل Transformer بدون تغييرات في الشفرة. يُتيح MIG إنشاء حتى 7 حالات عزلية بسعة 10GB لكل واحدة للاستنتاج متعدد المستخدمين. يحمي الحوسبة السرية (TEE) البيانات والنماذج أثناء المعالجة لضمان الامتثال في النُهج التي تتطلب سرية في الرعاية الصحية والمالية والحكومة. يتطلب شكل الـ SXM5 لوحة أساسية HGX (من شركة NVIDIA، مثل منصة HGX H100 أو DGX H100). ولا يُركب في فتحات PCIe القياسية. إنها بنية مخصصة للمؤسسات التي تلتزم بالتدريب المُتعدد لـ GPU على نطاق واسع.

هل تحتاج إلى مساعدة في الاختيار؟

يمكن لخبرائنا في التعدين مساعدتك في العثور على المُعدِّن المثالي لنظامك وميزانيتك.

NVIDIA H100 SXM5 80GB HBM3 وحدة معالجة رسومات بمركز tensor

بطاقة الرسوميات التي حددت عصر تدريب الذكاء الاصطناعي. شريحة GH100 Hopper الكاملة مع 16,896 نوى CUDA، و528 نوى Tensor من الجيل الرابع، ومحرك Transformer FP8، وذاكرة HBM3 بسعة 80 جيجابايت بسرعة ح bandwith تصل إلى 3,350 جيجابايت/ثانية. شكل mezzanine من نوع SXM5 لللوحات الأساسية HGX. NVLink 4.0 بسرعة 900 جيجابايت/ثانية لكل بطاقة مع نسيج NVSwitch يربط حتى 8 بطاقات في كل عقدة. 67 تريليون عملية فلوريس بالثانية FP32، و3,958 تريليون عملية فلوريس بالثانية FP8 مع التفرقة. قدرة استهلاك حتى 700 واط TDP. خدمة MIG لسبع حالات معزولة. صممت خصيصًا للتدريب الموزع على الذكاء الاصطناعي حيث تحدد عرض النطاق بين البطاقات مدى كفاءة التوسع.

نقل بسرعة 900 جيجابايت/ثانية NVLink 4.0 مع NVSwitch

8 وحدات معالجة رسومات بسرعة ناقلية كاملة في عقدة واحدة. 7,2 تيرابايت/ثانية إجمالي. تدرج تقريبي خطي في التدريب الموزع. يتعذر على اتصال PCIe أن يواكب.

3.958 تريليون عملية في الثانية محرك Transformer FP8

نوى Tensor من الجيل الرابع مع دقة FP8/FP16 تلقائية لكل طبقة. معدل تدريب أسرع بأربعة أضعاف على A100 على هياكل الم-transformer.

80 جيجابايت HBM3 بسرعة نقل بيانات 3,350 جيجابايت/ثانية

عرض نطاق ذاكرة أسرع بنسبة 68 في المئة من A100. يوفر 16,896 نواة CUDA دون انقطاع في أحمال العمل التدريبية ذات الدُفعات الكبيرة.

الأَسْئِلَةُ الْمُتَكَرِّرَةُ (FAQ)

الأسئلة الشائعة

SXM: كامل دارة GH100 تحتوي على 16.896 نواة CUDA، قدره 700 وات TDP، عرض نطاق HBM3 قدره 3.350 جيجابايت/ثانية، NVLink 4.0 بسرعة 900 جيجابت/ثانية مع NVSwitch الذي يربط حتى 8 وحدات معالجة رسومات. يتطلب لوحة أساسية HGX. PCIe: دارة جزئية معطلة تحتوي على 14.592 نواة CUDA، قدره 350 وات TDP، عرض نطاق 2.000 جيجابايت/ثانية، NVLink محدود إلى أزواج GPU ثنائية عبر جسر. يناسب الخوادم القياسية. SXM مخصص للتدريب الموزع على نطاق واسع. PCIe مخصص للاستدلال والأعباء العمل بوحدة معالجة رسومات واحدة في البنية التحتية الحالية.

لوحة أساسية NVIDIA HGX H100 أو نظام DGX H100. لا يتم تثبيت وحدة SXM5 في فتحات PCIe القياسية. فهي تتصل عبر واجهة mezzanine SXM5 على اللوحة الأساسية HGX. يتطلب استهلاك طاقة بقيمة 700 واط لكل وحدة GPU (5,600 واط لـ 8 وحدات GPU) تبريد سائل أو حافظة عالية التهوية من نوع المؤسسات. تتوفر منصات HGX من Supermicro و Dell و HPE و Lenovo.

يوفر NVSwitch اتصالًا بين جميع وحدات المعالجة الرسومية داخل العقدة. تتصل كل وحدة H100 SXM عبر 18 وصلة NVLink 4.0 بسرعة 900 جيجابايت/ثانية ذات الاتجاهين. تتواصل أي وحدة معالجة رسومية مع أي وحدة أخرى بسرعة نقل كاملة بدون المرور عبر وحدة المعالجة المركزية أو PCIe. توفر عقدة تحتوي على 8 وحدات معالجة رسومية عرض نطاق ترددي إجمالي NVLink يبلغ 7.2 تيرابايت/ثانية. هذا ما يمكن من التوسع شبه الخطي في التدريب الموزع حيث يكون مزامنة التدرجات بين وحدات المعالجة الرسومية هو الاختناقات.

التدريب على نطاق واسع لنماذج المحولات: نماذج GPT-الدرجة الكبيرة (70 مليار إلى أكثر من 175 مليار معلمة)، محولات الرؤية، النماذج متعددة الوسائط، ونماذج الانتشار. يتحمل عقدة HGX ذات الثماني وحدات GPU وذاكرة مشتركة بحجم 640 جيجابايت تكاليف تدريب نماذج بـ70 مليار مع تقارب البيانات و175 مليار وما فوق باستخدام تقارب النموذج. يُستخدم جهاز H100 SXM واحد للاستدلال على نماذج 70 مليار عند التكميم FP8 أو نماذج 30 مليار عند FP16.

H100 SXM: 67 تيرافلوبس FP32، 3،958 تيرافلوبس FP8، 80 جيجابايت HBM3 بسرعة 3،350 جيجابايت/ثانية، NVLink 4.0 بسرعة 900 جيجابايت/ثانية، 700 واط. A100 SXM: 19,5 تيرافلوبس FP32، بدون دعم FP8، 80 جيجابايت HBM2e بسرعة 2،039 جيجابايت/ثانية، NVLink 3.0 بسرعة 600 جيجابايت/ثانية، 400 واط. يُقدم الـ H100 تقريبًا تدريبًا أسرع بمعدل 3 إلى 4 مرات على نماذج التحويل من التأثير المشترك لنطاق التردد العالي، ودقة FP8، وسرعة NVLink.

إدارة تلقائية للمعالجة المختلطة على مستوى الأجهزة. يختار محرك Transformer ديناميكياً دقة FP8 أو FP16 لكل طبقة من الشبكة العصبية أثناء التدريب والتنبؤ، مما يعظم الإنتاجية مع المحافظة على دقة النموذج. هذه ميزة أجهزة فريدة من نوعها لحواسيب Hopper (H100) والهياكل الأحدث التي لا تتطلب تغييرات في الشفرة من قبل المطور.

تُنشئ وحدة معالجة الرسومات متعددة الحالات حتى 7 حالات معزولة من حيث الأجهزة عند 10 جيجابايت لكل منها. تُخصص لكل حالة أنوية CUDA وأنوية Tensor وذاكرة التخزين المؤقت L2 وHBM مع ضمان جودة الخدمة. أنماط الإنتاج الشائعة: 7 × 1 جيجابايت.10 جيجابايت للاستنتاج متعدد المستأجرين لنماذج صغيرة، أو 2 × 3 جيجابايت.40 جيجابايت لخادمين لنماذج بقدرة 13 مليار في آنٍ واحد. تظهر كل حالة كوحدة معالجة رسومات منفصلة لنظام التشغيل.

بيئة تنفيذ موثوقة (TEE) تعتمد على العتاد تحمي البيانات وأوزان النموذج أثناء معالجة وحدة معالجة الرسومات. لا يمكن لمشغل البنية التحتية الوصول إلى البيانات التي يتم حسابها. ضروري لنشرات الذكاء الاصطناعي الحساسة للامتثال في الرعاية الصحية (HIPAA)، والمالية (SOC 2)، والحكومة (FedRAMP) حيث يتم فرض خصوصية البيانات أثناء المعالجة.

نفس بنية Hopper. تقوم ترقية H200 SXM إلى ذاكرة بسعة 141 جيجابايت من نوع HBM3e بسرعة 4.800 جيجابايت/ثانية (مقابل 80 جيجابايت من نوع HBM3 بسرعة 3.350 جيجابايت/ثانية على H100). نفس عدد نوى CUDA ونطاق TFLOPS الحسابي. يعتبر H200 ترقية في الذاكرة وعرض النطاق الترددي للعمل مع الأحمال التي تسمح لها سعة أو عرض النطاق الترددي للذاكرة HBM المحدود على H100، خصوصًا استنتاج وتدريب النماذج الأكبر مع دفعات أكبر.

بطاقات الرسومات NVIDIA H100 تخضع لقيود التصدير الأمريكية على الأجهزة المتقدمة للذكاء الاصطناعي. غير متوفرة في الصين، هونغ كونغ وماكاو. قامت NVIDIA بإنشاء H800 (نسخة محدودة النطاق الترددي) لتلك الأسواق. يرجى التأكد من أهلية التصدير مع MillionMiner لموقع التسليم قبل الطلب.