NVIDIA
דגם: H200 SXM
NVIDIA H200 NVL 141GB Tensor Core GPU. ארכיטקטורת Hopper עם הזיכרון HBM3e הראשון בעולם: 141GB עם רוחב פס של 4,800 GB/שנייה, תוספת של 76 אחוז ל-VRAM ותוספת של 43 אחוז לרוחב הפס בהשוואה ל-H100 SXM. באותו חישוב Hopper כמו… ה-H100: 16,896 ליבות CUDA, 528 ליבות Tensor דור רביעי עם FP8 Transformer Engine, 67 TFLOPS FP32, 3,958 TFLOPS FP8. פורמט PCIe התומך עד 4 GPU באמצעות גשרים NVLink. TDP עד 600W ניתנת להגדרה. קירור אוויר פסיבי למארז שרת סטנדרטי. MIG ל-7 תומכות ב-16.5GB כל אחת. שדרוג מהיר לתשתית PCIe של A100 ו-H100.
בחר זמינות
כמות
$36,500.00
קנייה של 10 או יותר? קבל תמחור מותאם בהזמנה גדולה
Pay withהמחירים והזמינות משתנים בהתאם לשוק. אנו מאשרים את שניהם מולך לפני שההזמנה שלך הופכת למחייבת. בדיקת מחיר וזמינות
אחסון
חומרה שנבדקה
בכל העולם
משלוח עולמי
תמיכה
מומחי כרייה
NVIDIA H200 NVL 141GB Tensor Core GPU. ארכיטקטורת Hopper עם הזיכרון HBM3e הראשון בעולם: 141GB עם רוחב פס של 4,800 GB/שנייה, תוספת של 76 אחוז ל-VRAM ותוספת של 43 אחוז לרוחב הפס בהשוואה ל-H100 SXM. באותו חישוב Hopper כמו… ה-H100: 16,896 ליבות CUDA, 528 ליבות Tensor דור רביעי עם FP8 Transformer Engine, 67 TFLOPS FP32, 3,958 TFLOPS FP8. פורמט PCIe התומך עד 4 GPU באמצעות גשרים NVLink. TDP עד 600W ניתנת להגדרה. קירור אוויר פסיבי למארז שרת סטנדרטי. MIG ל-7 תומכות ב-16.5GB כל אחת. שדרוג מהיר לתשתית PCIe של A100 ו-H100.
Pick a workload to check the H200 SXM with 141 GB.
Llama 3.1 8B
A common local assistant model at 4-bit quantisation.
Tell us the workload and we will size a multi-GPU server for it.
Stacking that many cards is rarely the right answer. Ask us to size a server instead
VRAM figures are estimates for single-user inference and include headroom for context and system overhead. Throughput depends on model, settings and driver stack.
מחיר, זמן אספקה ואפשרויות אירוח. ייעוץ אישי מצוות המכירות שלנו.
מחיר, זמן אספקה ואפשרויות אירוח. ייעוץ אישי מצוות המכירות שלנו.
ה-H200 איננו אדריכלות חדשה. זוהי אותה Die של Hopper GH100 הפועלת באותם ליבות CUDA, אותן ליבות Tensor, ואת אותו מנוע Transformer כמו ה-H100. what NVIDIA שינתה הוא מערכת הזיכרון: HBM3 הוחלפה ב-HBM3e, הקיבולת הוגדלה מ-80GB ל-141GB, רוחב הפס הוגדל מ-3,350 GB/s ל-4,800 GB/s. כל שאר המפרטים נותרו זהים. זה שדרוג ממוקד בזיכרון לעיבודים שבהם ה-80GB של ה-H100 הפכו למחסום. ההשפעה המעשית מתחלקת לשלוש קטגוריות שמתאימות להחלטות פריסת שדה אמיתיות. חיזוי LLM בדיוק מלא. מודל בעל 70B פרמטרים ב-FP16 עם עומס מטמון KV דורש כ-140GB עד 160GB של זיכרון GPU, תלוי בגודל הביט או אורך הרצף. ה-H100 ב-80GB אינו מסוגל להכיל זאת מבלי לבצע קוונטיזציה ל-FP8 או INT8, מה שמפחית את הדיוק של המודל. ה-H200 NVL ב-141GB מתאים… ל-70B ב-FP16 על GPU בודד, שומר על דיוק מלא. עבור יישומים שבהם אובדן הדיוק בקוונטיזציה אינו מקובל (בינה מלאכותית רפואית, ניתוח מסמכים משפטיים, מודלים פיננסיים), זה ההבדל בין "אפשרי" ל"מה-ready לייצור". סקלת חיזוי בהקשר ארוך. מודלי Transformer מקצים זיכרון מטמון KV יחסית לאורך חלון ההקשר. מודל שמשרת חלונות טוקנים של 128K ב-H100 עלול להתרוקן מ-80GB לפני שהרצף מסתיים. ה-141GB של ה-H200 מרחיב את החלון המקסימלי של ההקשר שמחשב בודד יכול לטפל בו ב-76 אחוז לפני שבכלל נעשה צורך בהעברת זיכרון חיצונית. עבור צינורות RAG, עיבוד מסמכים וסוכני שיחה עם היסטוריית שיחות ארוכה, זה מתרגם ישירות להארכת ההקשרים ללא מורכבויות תשתית. צפיפות רב-שכבתית באמצעות חלוקות MIG גדולות יותר. כל מופע MIG על ה-H200 מקבל 16.5GB לעומת 10GB על ה-H100. העלייה של 65 אחוזים לכל מופע פירושה שכל מחיצה יכולה לשרת מודלי חיזוי גדולים יותר. באינפורמציה של ה-H100, מקטעי MIG של 10GB מטפלים ב-3B עד 7B מודלים, בעוד שבקטעי ה-H200 של 16.5GB ניתן לטפל ב-7B עד 13B מודלים לכל מחיצה. שבע מופעי מודל של 7B על GPU אחד של ה-H200 הוא תצורת חיזוי רב-שכבתית מעשית. פרטי הפורמט PCIe של NVL. עד 4 GPU מחוברים באמצעות גשרי NVLink בשרת אחד. תואם לקירור באוויר עד ל-600W TDP ניתנת להגדרה (לעומת 700W ב-SXM של ה-H200 הדורש קירור נוזלי). ממשק PCIe Gen 5 x16. מאוורר פסיבי שדורש זרימת אוויר במארז השרת. מתאים לאלו הפלטפורמות שרצות כרטיסי A100 PCIe או H100 PCIe, מה שהופך אותו לשדרוג בהחלפה ישירה. לנובו, Supermicro, Dell ו-HPE מציינות את תאימות H200 NVL בקווי השרתים הקיימים. רוחב הפס חשוב למהירות יצירת הטוקנים. חיזוי טוקנים ב-LLM באמצעות Decoding אוטורגרסיבי מוגבל בזיכרון-רוחב פס: כל טוקן חדש דורש קריאת משקלות המודל כולן מ-HBM. ב-4,800 GB/s לעומת 3,350 GB/s של ה-H100, ה-H200 מייצרת טוקנים בכ-43 אחוזים יותר מהיר על עומסי עבודה מוגבלים ברוחב הפס. בדיקות של RunPod מאשרות שהדבר מתרגם לעלייה בתפוקת החיזוי הממשית של 1.5 עד 1.9 פעמים במודלי שפה גדולים. ההחלטה בין H200 NVL ל-H200 SXM משקפת את סדרת ה-H100. SXM: TDP של 700W, קירור בלייזר, לוח בסיס HGX, רשת NVSwitch שמחברת 8 GPU במהירות 900 GB/s כל אחת, המתאימה לאימון מבוזר. NVL: עד 600W, קירור באוויר, שרתי PCIe סטנדרטיים, עד 4-GPU NVLink, מותאם לאינפורמציה ולפריסות גמישות. SXM לאשכולות אימון. NVL לשרתים עם חיזוי ושדרוג תשתיתי קיים. אותם מגבלות ייצוא כמו ה-H100. כפוף להגבלות ארה"ב על חומרה מתקדמת ל-AI.
ה-H200 NVL עונה על שאלה ספציפית שה-H100 השאיר פתוחה: מה קורה כש-80GB זיכרון VRAM אינם מספיקים אך אינכם רוצים לעבור לתמחור Blackwell? 141GB של HBM3e בנפח רוחב פס של 4,800 GB/s על אותו die של Hopper GH100 שמפעיל את ה-H100. אותו 16,896 ליבות CUDA. אותו 528 ליבות Tensor דור רביעי. אותו מנוע Transformer FP8 ב-3,958 TFLOPS. אותו MIG, אותו חישוב סודי, ואותו סטק של תכנת CUDA. השינוי היחיד הוא בזיכרון: 76 אחוזים יותר capacity (141GB לעומת 80GB) על bus של HBM3e מהיר יותר שמספק 43 אחוזים יותר רוחב פס (4,800 לעומת 3,350 GB/s). שדרוג הזיכרון הזה משפיע… בשלושה היבטים מעשיים. ראשית, מודלים עם 70 מיליארד היפרפרמטרים ב-FP16 מתאימים על GPU יחיד בלי קווניטיזציה. ה-H100 ב-80GB דורש קווניטיזציה ב-FP8 או INT8 ל-70B מודלים, דבר שמפחית קצת מהדיוק. ה-H200 NVL ב-141GB מפעיל אותם בדיוק מלא ב-FP16. שנית, אינפרנס עם הקשר ארוך עם מטמונים גדולים של KV מתרחב עוד יותר לפני שמגיעים להגבלת הזיכרון. חלונות הקשר שמאזנים 80GB ב-H100 מקבלים 76 אחוז יותר מקום פנוי ב-H200. שלישית, מימושי MIG קופצים מ-10GB ל-16.5GB כל אחד, מה שהופך כל מחיצה מבודדת לשימושית עבור מודלים גדולים יותר במערכות פרישה מרובה. סיווג NVL משמעותו פורמט PCIe עם תמיכה בגשר NVLink ל-עד 4 GPU בשרת אחד. ניתן לקירור באוויר עד ל-600W TDP. תואם לפלטפורמות שרת סטנדרטיות הפועלות כרגע עם כרטיסי PCIe של A100 או H100. אין צורך בלוח אם HGX בסיסי. זו הדרך לשדרג עבור מפעילים שרוצים קיבולת זיכרון H200 מבלי להחליף את תשתית השרת שלהם.
המומחים שלנו במכרות יכולים לעזור לכם למצוא את ה- miner המושלם עבור ההגדרות והתקציב שלכם.
ה-GPU הראשון עם זיכרון HBM3e. 141GB במהירות כניסה של 4,800 GB/SBandwidth: 76 אחוז יותר VRAM ו-43 אחוז יותר מהירות זיכרון מאשר H100 SXM. אותו חישוב Hopper (16,896 ליבות CUDA, 3,958 TFLOPS FP8 Transformer Engine). פורמט PCIe עם קנה מידה של עד 4-GPU NVLink. תחליף Plug-in slots ל-H100 ו-A100 PCIe. MIG ל-7 מופעים ב-16.5GB כל אחד. קרור אוויר פסיבי עד 600W עם TDP שניתן להגדיר. מיועד ל-inference של LLM כשגודל המודל ותוכן מטמון KV דורשים יותר מ-80GB לכל GPU.
ה-GPU הראשון עם זיכרון HBM3e. רוחב פס של 4.800 GB/s. הריצו מודלים של 70B בדיוק מלא ב-FP16 על GPU בודד without כיווץ.
מעבדי CUDA זהים ב-16,896 ליבות ו-3,958 TFLOPS במנוע Transformer FP8 כ-H100. תוכנת התוכנה זהה. רק הזיכרון שונה.
מתאים לתשתית השרת הקיימת. עד 4 כרטיסי GPU באמצעות גשרים NVLink. תואם לקירור באוויר. אין צורך בלוח בסיס HGX.
זיכרון משולב של 1,128GB (1.1TB) מסוג HBM3e. רוחב פס משולב של 38,400 GB/s. מעל 32 פטהFLOPS חישוב FP8. רוחב פס NVLink של 7,200 GB/s על פני רשת ה-NVSwitch. הספק המערכת הכולל של DGX H200 כ-8,500W.
SXM: 700W TDP, דורש לוח בסיס HGX וקירור נוזלים, NVSwitch מחבר 8 GPU במהירות של 900 GB/s לכל אחד, פי שכונה של כ-18 אחוזים, מותאם לאימון מבוזר. NVL: 600W TDP, קירור באוויר, שרתים סטנדרטיים PCIe, עד 4 GPU באמצעות גשרים NVLink ללא NVSwitch, מותאם להסקה. שניהם משתפים את אותו זיכרון HBM3e בנפח 141GB במהירות 4,800 GB/s ואותו חישוב Hopper.
אותו שבב GH100, אותם ליבות CUDA, אותם ליבות Tensor, אותן ביצועי TFLOPS חישוב. ה-H200 משדרג את הזיכרון מ-80GB HBM3 במהירות של 3,350 GB/s ל-141GB HBM3e במהירות של 4,800 GB/s. לכל צומת: 1,1TB לעומת 640GB, 38,400 GB/s לעומת 26,800 GB/s. הבדיקות של NVIDIA מראות כי ביצועי ההגעה ל-Llama2 70B כמעט הוכפלו בהשוואה ל-H100 באותה תצורת באטש.
מודלי שפה של Frontier LLMs (70B עד 175B+ פרמטרים) במהלך האימון עם פרלליזם טנסורי. ארכיטקטורות של תערובות מומחים (Mixtral, DeepSeek V3) שבהן ניתוב המומחים נהנה מרוחב הפס של NVSwitch. חיזוי בהקשר ארוך שבו מטמון KV מחריף את גבול הזיכרון של H100 בנפח 80GB. כל עומס עבודה שבו קיבולת הזיכרון או רוחב הפס של ה-H100 היו המגבלה.
לוח בסיס HGX H200 של NVIDIA או מערכת DGX H200. צריכת חשמל מרבית של 700W לכל GPU (5,600W ל-8 GPUs) דורשת קירור נוזלים ברוב התצורות. פלטפורמות HGX זמינות מ-Supermicro, Dell, HPE ולנובו. DGX H200 הוא מערכת 8-GPU מוכנה של NVIDIA. מתקני מרכז נתונים עם תשתית תואמת של חשמל, קירור ורשת.
NVSwitch יוצרת קישוריות GPU מלאה בכל-לא-כל NAS לתוך. כל GPU מתקשר עם כל GPU אחר במהירות 900 GB/s ללא מעורבות של CPU או PCIe. סינכרון הגרדיאנט במהלך אימון מבוזר הושלם במיקרושניות, שמירה على זמני עומס נמוכים מ-10 אחוזים מזמן החישוב. בלי NVSwitch, יעילות האימון מתדרדרת משמעותית ב-4+ GPU מכיוון ש-PCIe ב-128 GB/s אינו יכול לעמוד בדרישות החלפת הגרדיאנט.
ה-B200 עובר לארכיטקטורת Blackwell עם ביצועי TFLOPS חישוביים גבוהים יותר, דור חדש של Tensor Core ושיפורי ארכיטקטורה. ה-H200 SXM מציע בגרות מוכחת של מערכת Hopper עם יציבות דרייברים מבוססת, תמיכת ערמת תוכנה, ועוד תיעוד הפצה לשנים. לפריסה מיידית על חומרה מוכחת, ה-H200 SXM היא האפשרות החזקה ביותר. לביצועים מהדור הבא, Blackwell היא הפלטפורמה לעתיד.
עד 7 מופעי חומרה מבודדים בכל אחד בגודל של 16.5GB (בהשוואה ל-10GB ב-H100 SXM). הזיכרון הגדול ב-65 אחוז לכל מופע תומך בשירות דגמים של 7 מיליארד עד 13 מיליארד באמצעות פרוסת MIG. כל מופע מקבל ליבות CUDA ייעודיות, ליבות Tensor, מטמון L2 ו-HBM עם בידוד שמוצה על ידי החומרה.
כן. סביבה מבוססת חומרה לביצוע מהימן (TEE) מגן על הנתונים ועל משקלות המודל במהלך עיבוד ב-GPU. נחוץ לפריסות בינה מלאכותית הרגישות לעמידה בדרישות בתחום הבריאות (HIPAA), הפיננסים (SOC 2), והממשל (FedRAMP) שבהן פרטיות הנתונים במהלך העיבוד חובה.
אותם כללי יצוא של ארה"ב כמו ל-H100. לא זמין בסין, הונג קונג ומקאו. NVIDIA יצרה וריאנטים מוגבלים בנפח עבור שווקים מוגבלים. אשר את זכאות הייצוא עם MillionMiner עבור יעד המסירה שלכם.