NVIDIA
דגם: H200 NVL
NVIDIA H200 NVL 141GB GPU עם ליבת Tensory. ארכיטקטורת Hopper עם הזיכרון הראשון בעולם HBM3e: 141GB במהירות רוחב פס של 4,800 GB/שנייה, עלייה של 76 אחוז ב-VRAM ועלייה של 43 אחוז ברוחב הפס לעומת H100 SXM. אותה חישוב Hopper… כמו ה-H100: 16,896 ליבות CUDA, 528 ליבות Tensor רב-דור עם מנוע טרנספורמר FP8, 67 TFLOPS FP32, 3,958 TFLOPS FP8. פורמט PCIe התומך עד 4 GPU באמצעות גשרים NVLink. TDP עד 600W הניתן לתכנות. קירור אוויר פסיבי למשלוח ברירת מחדל לשרתים סטנדרטיים. MIG ל-7 מופעים ב-16.5GB כל אחד. שדרוג החלפה מ-Infrastructure של A100 ו-H100 PCIe.
בחר זמינות
כמות
$46,899.00
קנייה של 10 או יותר? קבל תמחור מותאם בהזמנה גדולה
Pay withהמחירים והזמינות משתנים בהתאם לשוק. אנו מאשרים את שניהם מולך לפני שההזמנה שלך הופכת למחייבת. בדיקת מחיר וזמינות
אחסון
חומרה שנבדקה
בכל העולם
משלוח עולמי
תמיכה
מומחי כרייה
NVIDIA H200 NVL 141GB GPU עם ליבת Tensory. ארכיטקטורת Hopper עם הזיכרון הראשון בעולם HBM3e: 141GB במהירות רוחב פס של 4,800 GB/שנייה, עלייה של 76 אחוז ב-VRAM ועלייה של 43 אחוז ברוחב הפס לעומת H100 SXM. אותה חישוב Hopper… כמו ה-H100: 16,896 ליבות CUDA, 528 ליבות Tensor רב-דור עם מנוע טרנספורמר FP8, 67 TFLOPS FP32, 3,958 TFLOPS FP8. פורמט PCIe התומך עד 4 GPU באמצעות גשרים NVLink. TDP עד 600W הניתן לתכנות. קירור אוויר פסיבי למשלוח ברירת מחדל לשרתים סטנדרטיים. MIG ל-7 מופעים ב-16.5GB כל אחד. שדרוג החלפה מ-Infrastructure של A100 ו-H100 PCIe.
Pick a workload to check the H200 NVL with 141 GB.
Llama 3.1 8B
A common local assistant model at 4-bit quantisation.
Tell us the workload and we will size a multi-GPU server for it.
Stacking that many cards is rarely the right answer. Ask us to size a server instead
VRAM figures are estimates for single-user inference and include headroom for context and system overhead. Throughput depends on model, settings and driver stack.
מחיר, זמן אספקה ואפשרויות אירוח. ייעוץ אישי מצוות המכירות שלנו.
מחיר, זמן אספקה ואפשרויות אירוח. ייעוץ אישי מצוות המכירות שלנו.
ה-H200 איננו אדריכלות חדשה. זה אותו Die של Hopper GH100 הפועל באותם ליבות CUDA, אותם ליבות Tensor ואותו מנוע Transformer כמו ה-H100. מה ששינה NVIDIA הוא תת-מערכת הזיכרון: HBM3 הוחלף ב-HBM3e, הקיבולת גדלה מ-80GB ל-141GB, רוחב הפס גדל מ-3,350 GB/s ל-4,800 GB/s. כל שאר הפרמטרים נותרו זהים. זה עדכון זיכרון ממוקד לעומסי עבודה שבהם ה-80GB של ה-H100 הפכו למוגבלה. ההשפעה המעשית מתחלקת לשלושה תחומים המתאימים להחלטות פריסה באיזורי הריצה. inference של מודלי שפה גדולים בדיוק מלא. מודל עם 70 מיליארד פרמטרים ב-FP16 עם עומס תיבת KV דורש כ-140GB עד 160GB של זיכרון GPU בהתאם לגודל באץ' לאורך הרצף. ה-H100 ב-80GB לא יכול להתאים זאת בלי קוונטיזציה ל-FP8 או INT8, דבר שמפחית את הדיוק של המודל. ה-H200 NVL ב-141GB… מתאים את 70B ב-FP16 על GPU יחיד, שמירת הדיוק מלא. עבור יישומים שבהם אובדן הדיוק בקוונטיזציה בלתי מקובל (בינה מלאכותית רפואית, ניתוח מסמכים משפטיים, מודלים כלכליים), זוהי ההבדל בין "אפשרי" ל-״מוכן לייצור״. סקיילינג של inference עם הקשר ארוך. מודלי Transformer מחלקים זיכרון עוקץ KV בהתאם לאורך חלון ההקשר. מודל שמשרת חלונות הקשר של 128K טוקנים על ה-H100 עלול למצות את ה-80GB לפני סיום הרצף. ה-H200 עם 141GB מרחיב את החלון המקסימלי שניתן לטפל בו על ידי GPU ב-76 אחוז לפני שדרוש העמסה מחוץ לזיכרון. עבור תהליכי RAG, עיבוד מסמכים, וסוכנויות שיחה עם היסטוריות שיחה ארוכות, זה מתרגם ישירות להארכת ההקשרים בלי מורכבות תשתית. צפיפות קשוחה במכילים מרובים באמצעות מחיצות MIG גדולות יותר. כל מופע MIG על ה-H200 מקבל 16.5GB לעומת 10GB על ה-H100. מעלייה של 65 אחוז בהקצה לכל מופע מאפשרת לכל מחיצה לשרת מודלי inference גדולים יותר. בעוד שחתיכות MIG של ה-H100 ב-10GB מטפלות ב-3B עד 7B מודלים, חתיכות ה-H200 ב-16.5GB מטפלות ב-7B עד 13B מודלים לכל מחיצה. שבע מופעי מודל של 7B בו זמנית על GPU יחיד של H200 הם תצורת inference רב-שכבתית שניתן להריץ בפועל. פרטי המארז PCIe של ה-NVL. עד 4 GPU מחוברים באמצעות גשרים NVLink בשרתי יחיד. תואם לקירור באוויר ב-עד 600W TDP שניתן להגדיר (לעומת 700W ב-SXM של ה-H200 שדורש קירור נוזלי). ממשק PCIe Gen 5 x16. מגן חום פסיבי שדורש זרימת אוויר מהארון השרת. מתאים להפעלה באותן פלטפורמות שרת עם כרטיסי A100 PCIe או H100 PCIe, מה שהופך אותו לשדרוג פשוט. Lenovo, Supermicro, Dell ו-HPE מתעדים תאימות ל-H200 NVL בקווי השרתים הקיימים שלהם. הרוחב הפס משמעותי למהירות יצירת הטוקנים. ייצור טוקנים ב-inference של מודלי שפה גדולים בפענוח אוטורגרסיבי מוגבל על ידי רוחב הפס: כל טוקן חדש דורש קריאת המשקלים של המודל כולו מ-HBM. ב-4,800 GB/s לעומת 3,350 GB/s של ה-H100, ה-H200 מייצר טוקנים בערך ב-43 אחוז יותר מהר בעומסי עבודה מוגבלים ברוחב פס. בדיקות של RunPod מאשרות שזה מתרגם להגדלי תפוקה בזמן אמת של inference ב-1.5 עד 1.9 יותר על מודלים של שפה גדולים. ההחלטה בין NVL ל-SXM של ה-H200 משקף את קווי הייצור של ה-H100. SXM: TDP של 700W, קירור נוזלי, לוח בסיס HGX, רשת NVSwitch שמחברת 8 GPU במהירות של 900 GB/s כל אחת, מותאם לאימון מפוצל. NVL: עד 600W, קירור באוויר, שרתי PCIe סטנדרטיים, עד 4-GPU NVLink, מותאם ל-inference ולהתקנות גמישות. SXM לאשכולות אימון. NVL לשרתים של inference ושדרוג תשתית קיימת. כל אותם כללי יצוא כמו ה-H100, כפופים למגבלות ארה"ב על חומרה מתקדמת לבינה מלאכותית.
H200 NVL עונה על שאלה ספציפית שה-H100 השאיר פתוחה: מה קורה כאשר זיכרון VRAM של 80GB אינו מספיק אך אינכם מעוניינים לעבור למחיר Blackwell? 141GB של HBM3e במהירות רוחב של 4,800 GB/s על אותו die של Hopper GH100 שמפעיל את ה-H100. באותם 16,896 ליבות CUDA. באותם 528 ליבות Tensor דור רביעי. באותו מנוע Transformer FP8 במהירות של 3,958 TFLOPS. באותם MIG, באותה חישוב שמור, באותם ערכות תוכנה CUDA. השינוי היחיד הוא בזיכרון: פי 76 יותר קיבולת (141GB לעומת 80GB) על אורך חיבור HBM3e מהיר יותר שמספק 43 אחוז יותר רוחב פס (4,800 לעומת 3,350 GB/s). שדרוג הזיכרון… הזה משפיע בשלושה אופנים מעשיים. ראשית, מודלים של 70 מיליארד פרמטרים ב-FP16 מתאימים על GPU אחד ללא קווניטיזציה. ה-H100 עם 80GB דורש קווניטיזציה ל-FP8 או INT8 עבור מודלים של 70 מיליארד, מה שמ sacrifice דיוק מסוים. ה-H200 NVL עם 141GB רץ אותם בדיוק FP16 מלא. שנית, ביצוע מסקנות במצב ארוך עם מטמוני KV גדולים מתאפשר יותר לפני שמגיעים לגבולות הזיכרון. חלונות הקשר שמתמלאים ב-80GB על ה-H100 יש להם 76 אחוז יותר מקום פנוי על ה-H200. שלישית, מופעי MIG קופצים מ-10GB ל-16.5GB כל אחד, מה שהופך כל מחיצה מבודדת לשימושית עבור מודלי מסקנה גדולים יותר בפריסות מרובות שוכרים. הסימון NVL מציין פורמט PCIe עם תמיכה בגשר NVLink ל-4 GPU בכל שרת. תואם לקירור אוויר עד ל-600W TDP. מתאים לפלטפורמות שרת סטנדרטיות הרצות כיום כרטיסי A100 או H100 PCIe. אין צורך בלוח בסיס HGX. זהו נתיב השדרוג עבור מפעילים שרוצים את קיבולת הזיכרון של H200 מבלי להחליף את תשתית השרת שלהם.
המומחים שלנו במכרות יכולים לעזור לכם למצוא את ה- miner המושלם עבור ההגדרות והתקציב שלכם.
ה-GPU הראשון עם זיכרון HBM3e. 141GB במהירות רוחב פס של 4,800 GB/שעה: 76 אחוז יותר VRAM וזיכרון ב-43 אחוז מהר יותר מאשר ה-H100 SXM. חישוב Hopper באותה רמה (16,896 ליבות CUDA, 3,958 TFLOPS FP8 Transformer Engine). פורמט PCIe עם סקלינג של עד 4-GPU NVLink. החלפה פשוטה לחריצי PCIe של H100 ו-A100. MIG עבור 7 מקרים ב-16.5GB כל אחד. קירור אוויר פסיבי בעוצמה של עד 600W, עם TDP שניתן להגדרה. מיוצר ל-intelligence inference של LLM כאשר גודל המודל וקאש KV דורשים יותר מ-80GB לכל GPU.
ה-GPU הראשון עם זיכרון HBM3e. רוחב פס של 4,800 GB/s. ריצת דגמים בגודל 70 מיליארד עם דיוק FP16 מלא על GPU בודד ללא כיווץ.
אותם 16,896 ליבות CUDA ו־3,958 TFLOPS מנוע Transformer FP8 כמו H100. אותו ערימת תוכנה. רק הזיכרון השתנה.
מתאים לתשתית השרתים הקיימת. עד 4 גראפיות באמצעות גשרים NVLink. תואם לקירור אוויר. אין צורך בלוח בסיס HGX.
אותו דגם Hopper GH100 ודומה בחישוב (16,896 ליבות CUDA, 3,958 TFLOPS FP8). ה-H200 משדרג את הזיכרון מ-80GB HBM3 במהירות 3,350 GB/שעה ל-141GB HBM3e במהירות 4,800 GB/שעה. זהו יותר ב-76 אחוז זיכרון VRAM ויותר ב-43 אחוז רוחב פס. כל שאר הפרטים (Tensor Cores, Transformer Engine, MIG, CUDA stack) זהים.
שלושה השפעות מעשיות. דגמי 70B מתאימים ב-FP16 מלא ללא כימות (H100 דורש FP8/INT8 עבור 70B). אורך ההקשר הגדול יותר בהסקה מתרחב ב-76 אחוזים עוד לפני ההגעה לגבולות הזיכרון. מופעי MIG קופצים מ-10GB ל-16.5GB כל אחד, תומכים בדגמים גדולים יותר לכל חלקה בפריסות מרובת שוכרים.
הדור הבא של זיכרון רוחב פס גבוה לאחר HBM3. רוחב פס ויכולת גבוהים יותר לכל ערימה. ה-H200 הוא ה-GPU הראשון שמשתמש ב-HBM3e, המספק 4,800 ג"ב/שעה לעומת 3,350 ג"ב/שעה ב-HBM3 (H100). שיפור הרוחב פס מואץ ישירות את יצירת ה-token של LLM, שמתבטא בקנה מידה ליניארי עם רוחב הפס של הזיכרון בפענוח אוטורגרסיבי.
כן. עיצוב PCIe Gen 5 x16 עם קירור פסיבי. מתאים לאותן פלטפורמות שרתים הפועלות עם כרטיסי H100 PCIe או A100 PCIe. Lenovo, Supermicro, Dell ו-HPE מפרטים תאימות על קווי השרתים הקיימים. זוהי דרך שדרוג פשוטה מ-H100 ל-H200 בקיבולת זיכרון מבלי להחליף את השרת.
עד 4 GPUs מחוברים באמצעות גשרים NVLink בשרת אחד. לעומת ה-H200 SXM שמאפשרת הרחבה ל-8 GPUs בכל נווד דרך NVSwitch על לוחות בסיס HGX. הנתיב NVL מציע תשתית פשוטה יותר על חשבון פחות GPUs בכל נווד.
NVL: גודל פורמט PCIe, עד TDP של 600W, מתאים לקריר באוויר, עד 4 GPUs באמצעות גשרים NVLink, מתאים לשרתים סטנדרטיים. SXM: גודל פורמט mezzanine, עד TDP של 700W, דורש קירור נוזלים ו-HGX לוח בסיס, עד 8 GPUs באמצעות NVSwitch ב-900 GB/s כל אחד, תעבורת נתונים גבוהה ב-18 אחוזים לערך. NVL למסקנות וגמישות בתשתית. SXM לביצועי אימון מרביים.
H200 NVL: 141GB HBM3e ב-4,800 GB/שנייה, Transformer Engine FP8, 7 מופעי MIG ב-16.5GB, ארכיטקטורת Hopper. RTX PRO 6000: 96GB GDDR7 ב-1,792 GB/שנייה, ללא Transformer Engine, ארכיטקטורת Blackwell, 125 TFLOPS FP32. ה-H200 NVL מנצח על קיבולת הזיכרון (47 אחוז יותר), רוחב פס HBM (כ-2.7 פי) ואופטימיזציית ניחוש Transformer Engine. ה-RTX PRO 6000 מנצח על חישוב FP32 ועלות רכישה.
עד 7 מופעי חומרה מבודדים ב-16.5GB כל אחד (לעומת 10GB ב-H100). הזיכרון הגדול לכל מופע תומך במודלים של 7B עד 13B לכל חלקה של MIG. שבע מופעי אינפורנס במקביל של 7B על GPU יחיד הם תצורה מעשית מרובת שוכרים.
מדדי Benchmark של RunPod מצביעים על שיפור בשל 1,5 עד 1,9 בפעילות העיבוד לתחנו הגדולים של מודלי שפה, בעיקר עקב עלייה של 43 אחוז בגלישה (4,800 לעומת 3,350 ג'יגה-בתים/שנייה). יצירת טוקנים בפענוח אוטוראגרסי מתרחבת כמעט באופן לינארי עם רוחב הפס של הזיכרון.
אותכם אתרי הייצוא של ארה"ב כמו ה-H100. לא זמין בסין, הונג קונג ומקאו. NVIDIA יצרה וריאנטים מוגבלים بشריכת רוחב פס לשווקים מוגבלים. אשר את זכאות הייצוא עם MillionMiner עבור יעד המשלוח שלכם.