NVIDIA Mellanox 920-9B210-00FN-0D0 در عمل: ساخت یک پارچه با تأخیر کم NDR برای خوشه‌های هوش مصنوعی با تریلیون پارامتر

August 26, 2026

آخرین اخبار شرکت NVIDIA Mellanox 920-9B210-00FN-0D0 در عمل: ساخت یک پارچه با تأخیر کم NDR برای خوشه‌های هوش مصنوعی با تریلیون پارامتر

NVIDIA Mellanox 920-9B210-00FN-0D0 در عمل: ساخت یک پارچه کم تاخیر NDR برای خوشه های AI تریلیون پارامتر

پیش زمینه و چالش: زمانی که HDR با مدل های تریلیون پارامتر مطابقت دارد

یک سازمان تحقیقاتی AI پیشرو به تازگی کلستر آموزش مدل زبان بزرگ خود را از 1,024 به 4,096 GPU NVIDIA H100 افزایش داد، با هدف فشرده سازی جدول زمانی آموزش برای 1.8 تریلیون پارامتر مدل MoE (مخلوط کارشناسان) از ماه تا کمتر از دو هفتهبا این حال ، در طول اعتباربخشی اولیه ، تیم در مرحله ارتباطات همه به همه در پارچه HDR 200Gb / s موجود خود ازدحام شدید مشاهده کرد ،که باعث می شود استفاده از GPU از 85 درصد انتظار شده به 52 درصد کاهش یابد.

تجزیه و تحلیل شبکه نشان داد که عملیات همه به همه، که در معماری های MOE وجود دارد،در حال اشباع پیوندهای HDR و ایجاد مکانیسم های کنترل ازدحام بودند که تاخیر را بیشتر تقویت می کردندسازمان به بافتي نياز داشت که بتونستتاخیر کمتر از یک میکرو ثانیه در هزاران نقطه پایان در حالی که اجازه می دهد تا پهنای باند برای جذب انفجار ترافیک بدون سقوط عملکرداین دقیقاً چالش است کهNVIDIA Mellanox 920-9B210-00FN-0D0طراحی شده بود تا به این موضوع پاسخ دهد.

راه حل و استقرار: یک پارچه NDR 400Gb / s برای هوش مصنوعی Exascale

این سازمان920-9B210-00FN-0D0 InfiniBand سوئیچ OPN(رقم سفارش بخش) به عنوان پایه ای از یک پارچه جدید دو لایه برگ ستون فقرات. در لایه برگ، هر قفسه دو920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDRسوئیچ هایی که 128 پورت 400 گیگابایت در ثانیه اتصال به 64 سرور H100 دو پورت را از طریق کابل های نوری فعال OSFP به OSFP در هر ریک فراهم می کنند. در لایه ستون فقرات،16 سوئیچ اضافی 920-9B210-00FN-0D0 به هم متصل تمام سوئیچ های برگ، ایجاد یک درخت چربی غیر مسدود کننده با پهنای باند bisection کامل از 51.2 Tb / s در هر لایه ستون فقرات.

چیزی که این راه حل را به ویژه قانع کننده کرد، تکنولوژی SHARPv3 (پروتکل جمع آوری و کاهش سلسله مراتب مقیاس پذیر) یکپارچه سوئیچ بود.ارتباط همه به همه به طور مستقیم به پارچه سوئیچ منتقل شد، با سوئیچ هایی که کاهش داده ها و توزیع مجدد داده ها را در شبکه انجام می دهند. این نیاز به گذرگاه های متعدد میزبان را از بین می برد.به طور چشمگیری کاهش هزینه های ارتباطی که از راه اندازی HDR قبلی رنج می برد.

بر اساسصفحه اطلاعات 920-9B210-00FN-0D0، سوئیچ کمترین تاخیر قطع 100ns را ارائه می دهد، که در طول مرحله اثبات مفهوم تایید شد. تیم مهندسی همچنین تایید کرد که920-9B210-00FN-0D0 سازگاراین اکوسیستم شامل تمام اپتیک ها و کابل های OSFP بود که قبلاً واجد شرایط بودند و تاخیر در تهیه را از بین می بردند.مشخصات 920-9B210-00FN-0D0-از جمله منابع برق دوگانه اضافی و فن های قابل تعویض گرم-به تیم اعتماد به نفس در دستیابی به هدف 99.999٪ در خوشه تولید را داد.

نتایج و سود قابل اندازه گیری: از تنگنایی به فعال کننده

پس از اینکه ساختار کامل NDR مستقر شد و کار آموزش وزارت خارجه مجدداً آغاز شد، سازمان پیشرفت های تحولآمیز را در ابعاد متعدد اندازه گیری کرد:

  • بازیابی استفاده از GPU:استفاده متوسط از GPU از 52٪ به 89٪ افزایش یافت و حداکثر استفاده در مراحل محاسباتی 94٪ به دلیل حذف توقف های ناشی از شبکه بود.
  • کاهش تاخیر همه به همه:زمان مورد نیاز برای یک مبادله کامل همه به همه در سراسر 4,096 GPU از 180ms به کمتر از 45ms کاهش یافت، 75٪ بهبود که به طور مستقیم به تکرار آموزش سریعتر ترجمه می شود.
  • زمان تکمیل کار:جدول زمانی آموزش پیش بینی شده برای مدل 1.8T MoE از 14 روز به فقط 9 روز کاهش یافته است - سرعت 36٪ که به طور قابل توجهی هزینه های زمان به بازار و محاسبات ابری را کاهش می دهد.
  • بهره وری عملیاتی:با 64 پورت در هر سوئیچ، تعداد سوئیچ های ستون فقرات مورد نیاز در مقایسه با طراحی HDR 40 پورت 37٪ کاهش یافت، کابل کشی را ساده تر کرد و مصرف برق در هر قفسه را 28٪ کاهش داد.

از منظر کل هزینه مالکیت، تیم مالی سازمان اشاره کرد که در حالی که920-9B210-00FN-0D0 قیمتاین مزیت اقتصادی باعث می شود که هزینه شبکه در هر GPU به دلیل ارتفاع رادیکس و کاهش تعداد لایه های سوئیچ کاهش یابد.با افزايش چشمگيري عملکرد، باعث شد که ارتقاء NDR یک پیروزی تجاری روشن باشد.920-9B210-00FN-0D0 راه حل OPN InfiniBand switchهمچنین به طور یکپارچه با استقرار موجود NVIDIA UFM خود ادغام شده است، که قابلیت دید متمرکز و هشدار خودکار را فراهم می کند که هزینه های عملیاتی را 40٪ کاهش می دهد.

خلاصه و چشم انداز: بنیاد NDR برای نسل بعدی هوش مصنوعی

درNVIDIA Mellanox 920-9B210-00FN-0D0ثابت شد که راه حل تحولآمیز این سازمان تحقیقاتی هوش مصنوعی برای باز کردن پتانسیل کامل خوشه H100 ۴۰۹۶-GPU آن است.و SHARPv3 در شبکه محاسبات، این تغییر به آنها این امکان را می دهد که از 1,024 تا 4,096 GPU بدون به خطر انداختن عملکرد یا قابلیت مدیریت، یک کار که با زیرساخت های HDR قبلی آنها غیرممکن بود، مقیاس بندی کنند.

به جلو نگاه می کند، سازمان برنامه ریزی برای گسترش به 8192 GPU در 18 ماه آینده، استفاده از920-9B210-00FN-0D0 برای فروشبرای سازمان هایی که در حال ارزیابی سرمایه گذاری های نسل بعدی خود در شبکه های هوش مصنوعی و HPC هستند،920-9B210-00FN-0D0 ارائه می دهد یک ثابت، راه حل آماده تولید است که وعده بهینه سازی اتصال RDMA با تاخیر کم را در exascale ارائه می دهد.