سوئیچ InfiniBand ملانوکس (NVIDIA Mellanox) 920-9B210-00FN-0D0 در عمل
July 15, 2026
سوئیچ InfiniBand Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 در عمل | بهینه سازی اتصال کم تاخیر برای خوشه های RDMA/HPC/AI
پیشینه و چالش ها: وقتی مقیاس خوشه ای با تنگناهای اتصال روبرو می شود
بخش تحقیقات هوش مصنوعی یک شرکت اینترنتی پیشرو خود را در یک دوراهی آشنا یافت. ناوگان رو به رشد آنها از سرورهای GPU - که دارای چندین رک هستند و به طور فزاینده ای برای آموزش مدل های زبان بزرگ استفاده می شوند - از زمان تکمیل کار غیرقابل پیش بینی رنج می بردند. ساختار مبتنی بر اترنت موجود، در حالی که برای بارهای کاری همه منظوره کافی است، نمیتواند الگوهای ترافیکی همگامسازی شده و انفجاری آموزش توزیعشده را مدیریت کند. عملیات کاهش همه جانبه به طور منظم به دلیل ریزش بسته ها و ازدحام غرق شده متوقف می شود و چرخه های آموزشی از روزها به هفته ها پیش می رود. تیم زیرساخت به یک تغییر اساسی در نحوه مدیریت شبکه باطن آنها با ترافیک RDMA نیاز داشت و آنها بدون بازنگری کل معماری مرکز داده خود به آن نیاز داشتند.
طراحی راه حل: استقرار سوئیچ 920-9B210-00FN-0D0 InfiniBand OPN
پس از ارزیابی گزینههای اتصال چندگانه، تیم انتخاب کردملانوکس (NVIDIA Mellanox) 920-9B210-00FN-0D0به عنوان سنگ بنای پارچه باطنی جدید آنها. این استقرار حول یک توپولوژی دو لایه برگی-اسپین متمرکز بود که هر سوئیچ برگ تا 40 گره GPU را از طریق پیوندهای 400 گیگابیت بر ثانیه متصل می کرد. را920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDRنوع به طور خاص برای معماری غیر مسدود کننده و قابلیت های محاسباتی SHARPv3 یکپارچه در شبکه انتخاب شد. این به تیم اجازه داد تا عملیات ارتباط جمعی را مستقیماً روی پارچه سوئیچ بارگذاری کند، سربار CPU را کاهش دهد و چرخههای GPU را برای محاسبات واقعی آزاد کند.
از نظر استقرار فیزیکی، سوئیچها با جریان هوای جلو به عقب نصب شدند تا با پیکربندی راهرو گرم/سرد موجود مطابقت داشته باشند. تیم از اهرم استفاده کردبرگه داده 920-9B210-00FN-0D0برای تأیید نیازهای برق و خنک کننده، اطمینان از ادغام یکپارچه در واحدهای توزیع برق موجود خود. کابل کشی با استفاده از فرستنده گیرنده QSFP-DD، با920-9B210-00FN-0D0 سازگار استاپتیک در کل بودجه پیوند، از جمله اتصالات ستون به برگ تا 100 متر اعتبارسنجی شده است.
رویکرد استقرار: یکپارچه سازی گام به گام
- فاز 1 - اعتبار سنجی آزمایشگاهی:یک بستر آزمایشی در مقیاس کوچک با 8 گره GPU و دو سوئیچ برای معیار تأخیر و توان استفاده شد. راNVIDIA Mellanox 920-9B210-00FN-0D0تأخیر سوئیچ زیر 600ns را نشان داد که 60 درصد نسبت به نسل قبلی HDR بهبود یافته است.
- فاز 2 - عرضه مرحلهای:این تیم با استفاده از مدیر پارچه واحد NVIDIA برای نظارت بر سلامت پیوند و معیارهای تراکم در زمان واقعی، یک غلاف آموزشی را در یک زمان انتقال داد. این امر باعث به حداقل رساندن اختلال در بارهای کاری تولید در حال انجام شد.
- فاز 3 - ادغام در مقیاس کامل:همه 18 سوئیچ در سه رک مستقر شدند و یک ستون کاملاً غیر مسدود کننده با 400 گیگابیت بر ثانیه آپلینک ایجاد کردند. مسیریابی تطبیقی برای تعادل پویا ترافیک و جلوگیری از اشتراک بیش از حد در زمان اوج ارسال شغل فعال شد.
در طول استقرار، تیم مهندسی به جامع مراجعه کردندمشخصات 920-9B210-00FN-0D0برای تنظیم دقیق تنظیمات بافر و پارامترهای کنترل تراکم. تله متری پیشرفته سوئیچ، دید دانه ای را در تعداد خطاهای هر پورت و استفاده از پیوند فراهم می کند، که امکان نگهداری فعال و برنامه ریزی ظرفیت را فراهم می کند.
نتایج قابل اندازه گیری و مزایای عملیاتی
در عرض دو هفته پس از استقرار در مقیاس کامل، پیشرفت ها ملموس بود. زمان تکمیل تمام کاهش برای یک کار آموزش استاندارد 1024 GPU از 12.3 ثانیه به 7.8 ثانیه کاهش یافت که نشان دهنده کاهش 37 درصدی در هزینه های ارتباطی است. زمان تکمیل کار برای یک مدل معمولی به سبک GPT تقریباً 30٪ بهبود یافته است و به تیم تحقیقاتی اجازه می دهد سریعتر تکرار کنند و آزمایش های بیشتری را در هفته انجام دهند. موتور SHARPv3 داخلی به طور متوسط 18٪ از عملیات جمعی را تخلیه می کند، که مستقیماً به استفاده بالاتر از GPU و مصرف انرژی کمتر در هر دوره آموزشی ترجمه می شود.
از نظر عملیاتی، تیم فناوری اطلاعات خرابی های شغلی مرتبط با شبکه کمتر و زمان قابل توجهی کمتری را برای تشخیص مشکلات سطح لینک صرف کرده است. راراه حل OPN سوئیچ 920-9B210-00FN-0D0 InfiniBandثابت شد که به طور قابل توجهی پایدار است، با صفر قطعی برنامه ریزی نشده در طول دوره مشاهده سه ماهه. رابط مدیریت یکپارچه منحنی یادگیری را برای تیم عملیات شبکه کاهش داد، تیمی که اکنون می تواند کل پارچه را از طریق یک شیشه واحد مدیریت کند.
ملاحظات هزینه و تدارکات
در حالی که اولیه920-9B210-00FN-0D0 قیمتبا قرار دادن سوئیچ در انتهای پریمیوم بازار، هزینه کل تجزیه و تحلیل مالکیت داستان متفاوتی را بیان کرد. با کاهش زمان تکمیل کار و بهبود استفاده از GPU، سازمان به کاهش 22 درصدی هزینههای نمونه ابری برای ظرفیت محاسباتی معادل دست یافت. علاوه بر این،920-9B210-00FN-0D0 برای فروشاز طریق شرکای چند کانالی امکان مناقصه رقابتی فراهم شد و تعهد پشتیبانی بلندمدت NVIDIA Mellanox باعث اطمینان در سرمایه گذاری شد.
خلاصه و چشم انداز: طرحی برای زیرساخت های هوش مصنوعی نسل بعدی
استقرارملانوکس (NVIDIA Mellanox) 920-9B210-00FN-0D0در این مرکز تحقیقاتی هوش مصنوعی در مقیاس بزرگ به عنوان یک معماری مرجع قانعکننده برای سازمانهایی که با چالشهای مرتبط مشابه مواجه هستند، عمل میکند. ترکیبی از سرعتهای 400 گیگابیت بر ثانیه NDR، تأخیر زیر میکروثانیه، و قابلیتهای محاسباتی درون شبکه، به نقاط درد اصلی خوشههای HPC و AI مبتنی بر RDMA میپردازد. معماران شبکه از انعطاف پذیری آن قدردانی خواهند کرد920-9B210-00FN-0D0 سوئیچ InfiniBand OPNدر توپولوژی های مختلف، در حالی که مدیران فناوری اطلاعات می توانند بر ابزارهای مدیریت قوی و جامع تکیه کنندبرگه داده 920-9B210-00FN-0D0برای برنامه ریزی ظرفیت
با نگاهی به آینده، این سازمان در حال برنامهریزی برای توسعه پارچه برای پشتیبانی از خوشههای گرافیکی بزرگتر، از جمله ادغام DPUهای BlueField-3 برای تخلیه اضافی ذخیرهسازی و ایزولهسازی امنیتی است. را920-9B210-00FN-0D0 سازگار استاکوسیستم تضمین میکند که ارتقاهای آینده - چه به NICهای جدیدتر یا فناوریهای نوری - به طور یکپارچه پشتیبانی میشوند. برای هر شرکتی که بارهای کاری هوش مصنوعی یا HPC در مقیاس بزرگ را به کار می گیرد، این سوئیچ نه تنها یک ارتقاء تدریجی بلکه یک توانمندساز اساسی عملکرد در مقیاس را نشان می دهد.

