NVIDIA Mellanox 920-9B110-00FH-0D0 مرجع فنی: اتصال بین المللی کم تاخیر بهینه شده برای RDMA / HPC / AI
August 25, 2026
NVIDIA Mellanox 920-9B110-00FH-0D0 مرجع فنی: اتصال متقابل کم تاخیر بهینه شده برای خوشه های RDMA / HPC / AI در 200Gb / s HDR
1. پیش زمینه پروژه و تجزیه و تحلیل نیازهای
همانطور که خوشه های HPC و AI همچنان در حال مقیاس بندی هستند، بار کاری آموزش توزیع شده و شبیه سازی علمی نیاز به پهنای باند، تاخیر و مقیاس پذیری شبکه به طور فزاینده ای سختگیرانه است. not every cluster requires 400Gb/s NDR infrastructure—a significant number of production environments are already standardized on 200Gb/s HDR and seek performance improvements within a controlled budgetالزامات معمول عبارتند از:
- تاخیر کم تعیین کننده:ارتباطات جمعی MPI باید تاخیر کمتر از یک مایکرو ثانیه از بندر به بندر را حفظ کند و از تأخیر دم جلوگیری کند تا بر همگرایی آموزش تأثیر بگذارد.
- پارچه بدون ضرر:بسته های صفر در معرض ازدحام قرار می گیرند تا اطمینان حاصل شود که RDMA کارآمد است و از سقوط عملکرد جلوگیری می کند.
- محاسبات درون شبکه:تخلیه عملیات جمعی مانند All-Reduce به بافت شبکه برای آزاد کردن منابع CPU / GPU میزبان.
- مقیاس پذیری صاف:پشتیبانی از گسترش غیر مسدود کننده از صدها تا هزاران گره، با سازگاری برای کابل های HDR موجود و گیرنده های نوری.
برای پاسخگویی به این الزامات، این راه حلNVIDIA Mellanox 920-9B110-00FH-0D0به عنوان بلوک اصلی ساختمان ٪ یک سوئیچ HDR InfiniBand 200Gb / s که عملکرد، تراکم و هزینه را برای استقرار در مقیاس متوسط تا بزرگ متعادل می کند.
2طراحی معماری شبکه کلی
راه حل پیشنهادی از یک توپولوژی دو لایه برگ استفاده می کند، که یک پارچه مقیاس پذیر و غیر مسدود کننده با تاخیر قابل پیش بینی و کابل کشی ساده را فراهم می کند.هر قفسه محاسباتی مجهز به یک920-9B110-00FH-0D0 InfiniBand سوئیچ OPN(رقم بخش سفارش) ، ارائه 40 پورت از 200Gb / s HDR اتصال به سرورهای GPU از طریق OSFP به OSFP مستقیم اتصال مس (DAC) یا فعال کابل نوری (AOC). در لایه ستون فقرات،یک لایه دوم از سوئیچ های MQM8790-HS2F920-9B110-00FH-0D0 MQM8790-HS2F 200Gb/s HDRتمام سوئیچ های برگ را به هم متصل می کند و یک پارچه درخت چربی با پهنای باند کامل ایجاد می کند.
برای خوشه های بزرگتر بیش از 1500 گره، یک معماری بسته سه طبقه می تواند اجرا شود،با 920-9B110-00FH-0D0 به عنوان هر دو برگ و ستون فقرات برای حفظ عملکرد ثابت در تمام سطوحجدول زیر پارامترهای مقیاس بندی کلیدی برای یک پارچه HDR دو لایه ای که در اطراف این سوئیچ ساخته شده است را خلاصه می کند:
| اجزا | مشخصات | ارزش |
|---|---|---|
| سوئیچ برگ | 920-9B110-00FH-0D0 | 1 عدد در هر قفسه |
| کلید های ستون فقرات | 920-9B110-00FH-0D0 | N/2 (N = تعداد سوئیچ های برگ) |
| حداکثر نقاط پایانی | سرورهای GPU | تا 1600 (رادیکس 40 بندر) |
| پهنای باند دوقطبی | کاملاً غیر مسدود کننده | 8.0 Tb/s در هر لایه ستون فقرات |
3نقش و ویژگی های اصلی NVIDIA Mellanox 920-9B110-00FH-0D0
در این معماری،NVIDIA Mellanox 920-9B110-00FH-0D0به عنوان عنصر اساسی برای تغییر عملکرد عمل می کند و چندین قابلیت حیاتی را فراهم می کند:
- 40 پورت از 200Gb/s HDR:هر پورت OSFP از 200Gb / s دو طرفه با اصلاح خطای جلو (FEC) برای اتصال قابل اعتماد گسترده پشتیبانی می کند.
- SHARPv2 یکپارچه (پروتکل جمع آوری و کاهش سلسله مراتب مقیاس پذیر):عملیات ارتباطات جمعی را کاهش می دهد و تاخیر MPI All-Reduce را تا 30٪ در بارهای کار HPC معمولی کاهش می دهد.
- مسیر سازگاری و کنترل ازدحام:به طور پویا مسیر ترافیک را تغییر می دهد تا از نقاط گرم اجتناب کند و عملکرد قابل پیش بینی را تحت الگوهای ترافیک متضاد تضمین کند.
- تله متري پیشرفته:شمارنده های هر جریان و هر بندر، همراه با نظارت بر اشغال بافر، دید عمیق در سلامت پارچه را فراهم می کنند.
بر اساسصفحه اطلاعات 920-9B110-00FH-0D0، سوئیچ کمترین تاخیر قطع 200ns را ارائه می دهد و از ظرفیت سوئیچ کلی تا 8.0 Tb / s پشتیبانی می کند.مشخصات 920-9B110-00FH-0D0همچنین منابع برق دوگانه اضافی و ماژول های فن قابل تعویض گرم را برجسته می کنند، که 99.999٪ در دسترس بودن برای بار های کاری مهم را تضمین می کند.
4توصیه های توسعه و مقیاس پذیری
برای سازمان هایی که قصد دارند920-9B110-00FH-0D0 راه حل OPN InfiniBand switch، دستورالعمل های زیر برای استفاده توصیه می شود:
- استراتژی کابل کشی:استفاده از کابل های OSFP به OSFP DAC برای اتصالات درون ریک (تا 3m) و AOC یا گیرنده های نوری برای پیوندهای بین ریک و ستون فقرات (تا 100m).920-9B110-00FH-0D0 سازگاربر اساس ماتریس سازگاری NVIDIA.
- تخليه:منابع برق دوگانه را به PDU های جداگانه متصل کنید. حداقل از دو سوئیچ ستون فقرات در هر برگ استفاده کنید تا نقاط واحد شکست را از بین ببرید.
- مدیریت نرم افزار:اطمینان حاصل کنید که تمام سوئیچ ها نسخه های مشابه نرم افزار NVIDIA را اجرا می کنند. از ویژگی ارتقاء نرم افزار خودکار UFM برای بروزرسانی بدون وقفه استفاده کنید.
- مسیر مقیاس پذیری:برای خوشه های فراتر از 1600 گره، انتقال به یک توپولوژی بسته سه مرحله ای یا استفاده از Dragonfly+ با مسیریابی سازگار.920-9B110-00FH-0D0 پشتیبانی از تا 64 سوئیچ در یک پارچه واحد تحت یک مدیر زیر شبکه واحد.
در هنگام محاسبه کل هزینه مالکیت، تعداد کاهش یافته سطوح سوئیچ و کابل کشی ساده در مقایسه با جایگزین های کم رادیکس را در نظر بگیرید.920-9B110-00FH-0D0 قیمتدر این روش، هزینه هر پورت به طور قابل توجهی کمتر از NDR است، و این یک انتخاب بهینه برای استقرار HDR با توجه به هزینه است.
5. عملیات، نظارت و رفع مشکل
مدیریت موثر یک پارچه HDR نیاز به یک چارچوب نظارت و عیب یابی جامع دارد.NVIDIA Mellanox 920-9B110-00FH-0D0از پارچه ای که:
- تجسم توپولوژی:کشف خودکار و نمایش گرافیکی تمام سوئیچ ها، لینک ها و نقاط پایانی.
- داشبوردهای عملکرد:نمایش در زمان واقعی از بهره برداری از بندر، نرخ خطا و شاخص های ازدحام.
- هشدار فعال:آلارم های مبتنی بر آستانه برای تخریب لینک، ناهنجاری های دمایی و شکست های برق.
- جداسازی نقص:جریان های کاری برای رفع مشکلات هدایت شده که کابل های معیوب، ترانسسیورها یا پورت های سوئیچ را شناسایی می کنند.
برای رفع مشکلات پیشرفته، از ابزارهای تشخیصی داخلی سوئیچ استفاده کنید، از جمله تست های حلقه و تجزیه و تحلیل BER (تعداد خطا بیت) ،برای تایید یکپارچگی پیوند قبل از استفاده از بار کاری تولیدمشکلات متداول در پیاده سازی های اولیه شامل مسیریابی نامناسب ناشی از سرعت های نابرابر پیوند یا انواع کابل نامناسب است.فعال کردن مسیریابی سازگار و تأیید اینکه همه لینک ها با سرعت 200Gb / s کار می کنند (با فعال کردن FEC) اکثر ناهنجاری های عملکرد را حل می کند.920-9B110-00FH-0D0 InfiniBand سوئیچ OPNهمچنین از پیکربندی های مدیریت زیر شبکه های اضافی پشتیبانی می کند، اطمینان حاصل می کند که پیکربندی مجدد پارچه بدون مداخله دستی در صورت شکست گره مدیریت رخ می دهد.
6خلاصه و ارزیابی ارزش
در920-9B110-00FH-0D0ارائه یک پیشنهاد ارزش قانع کننده برای سازمان های ساخت یا گسترش HDR مبتنی بر HPC و AI خوشه. آن را فراهم می کند 40 پورت از 200Gb / s HDR با زیر 200ns تاخیر، SHARPv2 offload،و مدیریت سطح سازمانی همه در یک بستر 1U مقرون به صرفهنکات مهم ارزش شامل:
- عملکرد:تا ۳۵ درصد کاهش زمان تکمیل کار برای بار های کاری فشرده ارتباطی از طریق SHARPv2 offloading و adaptive routing.
- بهره وری هزینه:TCO پایین تر در مقایسه با جایگزین های NDR، با هزینه های هر پورت بهینه شده برای پیاده سازی در مقیاس HDR.
- ساده سازی عملیاتی:ادغام عمیق با UFM برای مدیریت یکپارچه، نظارت فعال و تغییر خودکار.
- حفاظت از سرمایه گذاری:سازگاری کامل با کابل های HDR موجود، نوری و مجموعه نرم افزار، امکان ارتقاء مرحله ای بدون اختلال در تولید.
برای سازمان هایی که ارزیابی920-9B110-00FH-0D0 برای فروشاز طریق شرکای کانال NVIDIA، ما توصیه می کنیم بررسی جزئیاتصفحه اطلاعات 920-9B110-00FH-0D0و درگیر با یک معمار راه حل گواهی شده برای تأیید طراحی برای حجم کار خاص و مقیاس خود را نیاز دارد.NVIDIA Mellanox 920-9B110-00FH-0D0امروز آماده تولید است، و یک پایه متوازن و با عملکرد بالا برای نسل بعدی نوآوری HPC و هوش مصنوعی ارائه می دهد.

