NVIDIA Mellanox MQM8790-HS2F سوئیچ InfiniBand در عمل: بهینهسازی اتصال با تأخیر کم برای خوشههای RDMA/HPC/AI
August 21, 2026
سوئیچ InfiniBand انویدیا ملانوکس MQM8790-HS2F در عمل: بهینهسازی اتصال با تأخیر کم برای خوشههای RDMA/HPC/AI
در قلمرو آموزش مدلهای هوش مصنوعی در مقیاس بزرگ و محاسبات با کارایی بالا (HPC)، تأخیر شبکه اغلب به گلوگاه حیاتی تبدیل میشود که مقیاسپذیری و کارایی خوشه را محدود میکند. یک مرکز ابر محاسباتی در سطح ملی اخیراً ارتقاء عمدهای در زیرساخت خود را تکمیل کرده است، و از یک شبکه InfiniBand EDR با سرعت 100 گیگابیت بر ثانیه به راهحلی HDR با سرعت 200 گیگابیت بر ثانیه که حول محور سوئیچ InfiniBand NVIDIA Mellanox MQM8790-HS2F ساخته شده است، منتقل شده است. این مطالعه موردی چالشهایی را که با آنها روبرو شدند، استراتژی استقرار و دستاوردهای عملکرد قابل اندازهگیری را که از طریق این اتصال نسل بعدی به دست آمده است، بررسی میکند.
پیشزمینه و چالشها: زمانی که تأخیر به سقف عملکرد تبدیل میشود
مرکز ابر محاسباتی یک خوشه ناهمگن متشکل از بیش از 2000 گره GPU را اداره میکند که از ترکیبی متنوع از بارهای کاری شامل شبیهسازی آب و هوا، تحقیقات ژنومیک و آموزش مدلهای زبان بزرگ پشتیبانی میکند. با شبکه EDR قبلی 100 گیگابیت بر ثانیه، تیم عملیات مشاهده کرد که عملیات ارتباط جمعی - مانند all-reduce و all-gather - سهم فزایندهای از زمان کل اجرای شغل را با افزایش تعداد گرهها به خود اختصاص میدهند. در برخی از مشاغل آموزشی توزیع شده، سربار مربوط به شبکه تقریباً 40٪ از زمان اجرای سرتاسری را به خود اختصاص میداد و به شدت بهرهوری GPU را محدود میکرد و چرخههای همگرایی مدل را طولانی میکرد.
چالشهای اضافی شامل موارد زیر بود:
- نقاط داغ ازدحام: الگوهای ترافیک در آموزش هوش مصنوعی اغلب ناگهانی و غیرقابل پیشبینی هستند و منجر به مسدود شدن سر خط و جهشهای تأخیر دم میشوند که زمانبندی شغل را مختل میکند.
- شتابدهی ناکافی در شبکه: شبکه قدیمی از قابلیتهای تخلیه جمعی پیشرفته پشتیبانی نمیکرد و مجبور میشد تمام عملیات کاهش را از طریق CPU میزبان و سلسله مراتب حافظه عبور دهد.
- پیچیدگی مدیریت: عیبیابی مشکلات عملکرد نیازمند تجزیه و تحلیل دستی ابزارهای نظارتی متعدد بود و تشخیص علل ریشهای در استقرارهای در مقیاس بزرگ را دشوار میکرد.
پس از ارزیابی چندین گزینه اتصال، مرکز MQM8790-HS2F را به عنوان پایه شبکه جدید خود انتخاب کرد. طبق برگه داده MQM8790-HS2F، این سوئیچ 40 پورت توان عملیاتی غیر مسدود کننده HDR 200 گیگابیت بر ثانیه، تأخیر برش کمتر از 130 نانوثانیه و پشتیبانی از تخلیه جمعی SHARP v3.0 را ارائه میدهد - قابلیتهایی که مستقیماً به نقاط درد اصلی آنها پرداختند.
راه حل و استقرار: ساخت یک شبکه با تأخیر کم برای هوش مصنوعی/HPC
استقرار از یک توپولوژی دو لایه fat-tree استفاده کرد، با 24 سوئیچ MQM8790-HS2F 200Gb/s HDR 40-port QSFP56 که به عنوان گرههای برگ و 8 واحد به عنوان سوئیچهای ستون فقرات مستقر شدند. این پیکربندی 2:1 اضافه بار را در سراسر خوشه فراهم کرد - کافی برای بار کاری فعلی آنها در حالی که فضای کافی برای توسعه آینده را نیز فراهم میکرد.
| لایه استقرار | تعداد سوئیچها | پورتهای استفاده شده | اتصال |
|---|---|---|---|
| برگ (در هر رک) | 24 | 32 پورت هر کدام | سرورهای ToR + اتصالات ستون فقرات |
| ستون فقرات | 8 | 36 پورت هر کدام | شبکه کامل به تمام سوئیچهای برگ |
هر سوئیچ برگ از طریق آداپتورهای کانال میزبان NVIDIA ConnectX-6 HDR به گرههای محاسباتی متصل میشود. اکوسیستم اپتیک و کابلکشی سازگار با MQM8790-HS2F به تیم اجازه داد تا از کابلهای QSFP56 موجود استفاده مجدد کند، استقرار را تسریع کرده و هزینههای خرید را کاهش دهد. کل نصب فیزیکی در عرض دو هفته تکمیل شد و صفحه کنترل از مدیر یکپارچه شبکه NVIDIA (UFM) برای کشف خودکار توپولوژی و تأمین استفاده کرد.
پشتیبانی سوئیچ از مسیریابی تطبیقی و کنترل ازدحام برای مدیریت ترافیک ناگهانی مشخصه بارهای کاری هوش مصنوعی حیاتی بود. با توزیع مجدد پویا جریانها در مسیرهای موجود، سوئیچ InfiniBand MQM8790-HS2F تشکیل نقاط داغ را به حداقل رساند و عملکرد ثابت را حتی در دورههای اوج زمانبندی شغل حفظ کرد.
نتایج و دستاوردها: بهبودهای قابل اندازهگیری در توان عملیاتی شغل و بهرهوری GPU
پس از سه ماه عملیات تولیدی، مرکز ابر محاسباتی بهبودهای قابل توجهی در عملکرد در چندین بعد گزارش داد:
- کاهش تأخیر: میانگین تأخیر پینگ-پونگ MPI از 680 نانوثانیه در شبکه EDR قبلی به کمتر از 130 نانوثانیه با NVIDIA Mellanox MQM8790-HS2F کاهش یافت که نشاندهنده بهبود 5 برابری در کارایی تبادل پیام است.
- افزایش سرعت عملیات جمعی: تأخیر all-reduce برای مشاغل 1024 گرهای 62٪ کاهش یافت، به لطف تخلیه SHARP v3.0 که عملیات کاهش را مستقیماً در داخل شبکه سوئیچ انجام میدهد.
- بهرهوری GPU: اثر ترکیبی تأخیر کمتر و پهنای باند بالاتر، میانگین بهرهوری GPU را از 72٪ به 91٪ افزایش داد که منجر به کاهش 26٪ در زمان رسیدن به راه حل برای اجرای آموزش مدلهای زبان بزرگ شد.
- کارایی زمانبندی شغل: کاهش واریانس تأخیر دم به زمانبند SLURM اجازه داد تا مشاغل بیشتری را بر روی همان مجموعه گرهها بدون تداخل عملکرد قرار دهد و توان عملیاتی کلی خوشه را تقریباً 18٪ افزایش داد.
هنگامی که تیم بعداً قیمت MQM8790-HS2F را در مقایسه با سوئیچهای جایگزین از فروشندگان دیگر ارزیابی کرد، متوجه شد که کل هزینه به ازای هر گیگابیت بر ثانیه ارائه شده بسیار رقابتی است - به خصوص هنگام در نظر گرفتن سربار مدیریت کاهش یافته و توانایی سوئیچ برای پشتیبانی از سرعتهای لینک HDR و HDR100، که از سرمایهگذاریها در محیطهای با سرعت مختلط محافظت میکند.
از دیدگاه عملیاتی، پلتفرم یکپارچه UFM یک نمای واحد برای نظارت بر سلامت شبکه، الگوهای ترافیک و خطاهای سطح لینک فراهم کرد. این دید به تیم اجازه داد تا به طور فعال کابلهای در حال تخریب را شناسایی کرده و آنها را در طول نگهداری برنامهریزی شده جایگزین کنند و از خرابیهای برنامهریزی نشده جلوگیری کنند.
خلاصه و چشمانداز: طرحی برای شبکههای نسل بعدی با تأخیر کم
این مطالعه موردی نشان میدهد که راهحل سوئیچ InfiniBand MQM8790-HS2F چیزی بیش از یک ارتقاء سرعت ساده است - این یک جزء تحولآفرین برای سازمانهایی است که به دنبال آزادسازی پتانسیل کامل عملکرد زیرساختهای هوش مصنوعی و HPC خود هستند. این سوئیچ با ترکیب تراکم پورت بالا، تأخیر فوقالعاده کم و قابلیتهای محاسباتی در شبکه، مستقیماً به گلوگاههای ارتباطی که به طور تاریخی مقیاسپذیری خوشه را محدود کردهاند، میپردازد.
با نگاه به آینده، مرکز ابر محاسباتی قصد دارد شبکه خود را در سال مالی آینده به 2400 گره گسترش دهد و از همان معماری MQM8790-HS2F با سوئیچهای ستون فقرات اضافی استفاده کند. این تیم همچنین در حال بررسی پشتیبانی سوئیچ از الگوریتمهای کاهش بهبود یافته SHARP v3.0 است که نوید تسریع بیشتر بارهای کاری نوظهور مانند شبکههای عصبی گراف و یادگیری تقویتی را میدهد.
برای مدیران IT، معماران شبکه و مهندسان که گزینههای اتصال را برای ساخت خوشههای خود ارزیابی میکنند، NVIDIA Mellanox MQM8790-HS2F مسیری اثبات شده و تأیید شده در عمل را برای دستیابی به تأخیر زیر میکروثانیه، حداکثر بهرهوری GPU و مدیریت ساده شبکه ارائه میدهد. مشخصات MQM8790-HS2F دقیق و طرحهای مرجع از پورتال مستندات فنی NVIDIA در دسترس هستند و این سوئیچ در حال حاضر به طور گسترده در دسترس است - برای یافتن یک شریک منطقهای به دنبال MQM8790-HS2F برای فروش باشید.

