NVIDIA Mellanox MQM8790-HS2F سوئیچ InfiniBand در عمل: بهینه‌سازی اتصال با تأخیر کم برای خوشه‌های RDMA/HPC/AI

August 21, 2026

آخرین اخبار شرکت NVIDIA Mellanox MQM8790-HS2F سوئیچ InfiniBand در عمل: بهینه‌سازی اتصال با تأخیر کم برای خوشه‌های RDMA/HPC/AI

سوئیچ InfiniBand انویدیا ملانوکس MQM8790-HS2F در عمل: بهینه‌سازی اتصال با تأخیر کم برای خوشه‌های RDMA/HPC/AI

در قلمرو آموزش مدل‌های هوش مصنوعی در مقیاس بزرگ و محاسبات با کارایی بالا (HPC)، تأخیر شبکه اغلب به گلوگاه حیاتی تبدیل می‌شود که مقیاس‌پذیری و کارایی خوشه را محدود می‌کند. یک مرکز ابر محاسباتی در سطح ملی اخیراً ارتقاء عمده‌ای در زیرساخت خود را تکمیل کرده است، و از یک شبکه InfiniBand EDR با سرعت 100 گیگابیت بر ثانیه به راه‌حلی HDR با سرعت 200 گیگابیت بر ثانیه که حول محور سوئیچ InfiniBand NVIDIA Mellanox MQM8790-HS2F ساخته شده است، منتقل شده است. این مطالعه موردی چالش‌هایی را که با آن‌ها روبرو شدند، استراتژی استقرار و دستاوردهای عملکرد قابل اندازه‌گیری را که از طریق این اتصال نسل بعدی به دست آمده است، بررسی می‌کند.

پیش‌زمینه و چالش‌ها: زمانی که تأخیر به سقف عملکرد تبدیل می‌شود

مرکز ابر محاسباتی یک خوشه ناهمگن متشکل از بیش از 2000 گره GPU را اداره می‌کند که از ترکیبی متنوع از بارهای کاری شامل شبیه‌سازی آب و هوا، تحقیقات ژنومیک و آموزش مدل‌های زبان بزرگ پشتیبانی می‌کند. با شبکه EDR قبلی 100 گیگابیت بر ثانیه، تیم عملیات مشاهده کرد که عملیات ارتباط جمعی - مانند all-reduce و all-gather - سهم فزاینده‌ای از زمان کل اجرای شغل را با افزایش تعداد گره‌ها به خود اختصاص می‌دهند. در برخی از مشاغل آموزشی توزیع شده، سربار مربوط به شبکه تقریباً 40٪ از زمان اجرای سرتاسری را به خود اختصاص می‌داد و به شدت بهره‌وری GPU را محدود می‌کرد و چرخه‌های همگرایی مدل را طولانی می‌کرد.

چالش‌های اضافی شامل موارد زیر بود:

  • نقاط داغ ازدحام: الگوهای ترافیک در آموزش هوش مصنوعی اغلب ناگهانی و غیرقابل پیش‌بینی هستند و منجر به مسدود شدن سر خط و جهش‌های تأخیر دم می‌شوند که زمان‌بندی شغل را مختل می‌کند.
  • شتاب‌دهی ناکافی در شبکه: شبکه قدیمی از قابلیت‌های تخلیه جمعی پیشرفته پشتیبانی نمی‌کرد و مجبور می‌شد تمام عملیات کاهش را از طریق CPU میزبان و سلسله مراتب حافظه عبور دهد.
  • پیچیدگی مدیریت: عیب‌یابی مشکلات عملکرد نیازمند تجزیه و تحلیل دستی ابزارهای نظارتی متعدد بود و تشخیص علل ریشه‌ای در استقرارهای در مقیاس بزرگ را دشوار می‌کرد.

پس از ارزیابی چندین گزینه اتصال، مرکز MQM8790-HS2F را به عنوان پایه شبکه جدید خود انتخاب کرد. طبق برگه داده MQM8790-HS2F، این سوئیچ 40 پورت توان عملیاتی غیر مسدود کننده HDR 200 گیگابیت بر ثانیه، تأخیر برش کمتر از 130 نانوثانیه و پشتیبانی از تخلیه جمعی SHARP v3.0 را ارائه می‌دهد - قابلیت‌هایی که مستقیماً به نقاط درد اصلی آن‌ها پرداختند.

راه حل و استقرار: ساخت یک شبکه با تأخیر کم برای هوش مصنوعی/HPC

استقرار از یک توپولوژی دو لایه fat-tree استفاده کرد، با 24 سوئیچ MQM8790-HS2F 200Gb/s HDR 40-port QSFP56 که به عنوان گره‌های برگ و 8 واحد به عنوان سوئیچ‌های ستون فقرات مستقر شدند. این پیکربندی 2:1 اضافه بار را در سراسر خوشه فراهم کرد - کافی برای بار کاری فعلی آن‌ها در حالی که فضای کافی برای توسعه آینده را نیز فراهم می‌کرد.

لایه استقرار تعداد سوئیچ‌ها پورت‌های استفاده شده اتصال
برگ (در هر رک) 24 32 پورت هر کدام سرورهای ToR + اتصالات ستون فقرات
ستون فقرات 8 36 پورت هر کدام شبکه کامل به تمام سوئیچ‌های برگ

هر سوئیچ برگ از طریق آداپتورهای کانال میزبان NVIDIA ConnectX-6 HDR به گره‌های محاسباتی متصل می‌شود. اکوسیستم اپتیک و کابل‌کشی سازگار با MQM8790-HS2F به تیم اجازه داد تا از کابل‌های QSFP56 موجود استفاده مجدد کند، استقرار را تسریع کرده و هزینه‌های خرید را کاهش دهد. کل نصب فیزیکی در عرض دو هفته تکمیل شد و صفحه کنترل از مدیر یکپارچه شبکه NVIDIA (UFM) برای کشف خودکار توپولوژی و تأمین استفاده کرد.

پشتیبانی سوئیچ از مسیریابی تطبیقی و کنترل ازدحام برای مدیریت ترافیک ناگهانی مشخصه بارهای کاری هوش مصنوعی حیاتی بود. با توزیع مجدد پویا جریان‌ها در مسیرهای موجود، سوئیچ InfiniBand MQM8790-HS2F تشکیل نقاط داغ را به حداقل رساند و عملکرد ثابت را حتی در دوره‌های اوج زمان‌بندی شغل حفظ کرد.

نتایج و دستاوردها: بهبودهای قابل اندازه‌گیری در توان عملیاتی شغل و بهره‌وری GPU

پس از سه ماه عملیات تولیدی، مرکز ابر محاسباتی بهبودهای قابل توجهی در عملکرد در چندین بعد گزارش داد:

  • کاهش تأخیر: میانگین تأخیر پینگ-پونگ MPI از 680 نانوثانیه در شبکه EDR قبلی به کمتر از 130 نانوثانیه با NVIDIA Mellanox MQM8790-HS2F کاهش یافت که نشان‌دهنده بهبود 5 برابری در کارایی تبادل پیام است.
  • افزایش سرعت عملیات جمعی: تأخیر all-reduce برای مشاغل 1024 گره‌ای 62٪ کاهش یافت، به لطف تخلیه SHARP v3.0 که عملیات کاهش را مستقیماً در داخل شبکه سوئیچ انجام می‌دهد.
  • بهره‌وری GPU: اثر ترکیبی تأخیر کمتر و پهنای باند بالاتر، میانگین بهره‌وری GPU را از 72٪ به 91٪ افزایش داد که منجر به کاهش 26٪ در زمان رسیدن به راه حل برای اجرای آموزش مدل‌های زبان بزرگ شد.
  • کارایی زمان‌بندی شغل: کاهش واریانس تأخیر دم به زمان‌بند SLURM اجازه داد تا مشاغل بیشتری را بر روی همان مجموعه گره‌ها بدون تداخل عملکرد قرار دهد و توان عملیاتی کلی خوشه را تقریباً 18٪ افزایش داد.

هنگامی که تیم بعداً قیمت MQM8790-HS2F را در مقایسه با سوئیچ‌های جایگزین از فروشندگان دیگر ارزیابی کرد، متوجه شد که کل هزینه به ازای هر گیگابیت بر ثانیه ارائه شده بسیار رقابتی است - به خصوص هنگام در نظر گرفتن سربار مدیریت کاهش یافته و توانایی سوئیچ برای پشتیبانی از سرعت‌های لینک HDR و HDR100، که از سرمایه‌گذاری‌ها در محیط‌های با سرعت مختلط محافظت می‌کند.

از دیدگاه عملیاتی، پلتفرم یکپارچه UFM یک نمای واحد برای نظارت بر سلامت شبکه، الگوهای ترافیک و خطاهای سطح لینک فراهم کرد. این دید به تیم اجازه داد تا به طور فعال کابل‌های در حال تخریب را شناسایی کرده و آن‌ها را در طول نگهداری برنامه‌ریزی شده جایگزین کنند و از خرابی‌های برنامه‌ریزی نشده جلوگیری کنند.

خلاصه و چشم‌انداز: طرحی برای شبکه‌های نسل بعدی با تأخیر کم

این مطالعه موردی نشان می‌دهد که راه‌حل سوئیچ InfiniBand MQM8790-HS2F چیزی بیش از یک ارتقاء سرعت ساده است - این یک جزء تحول‌آفرین برای سازمان‌هایی است که به دنبال آزادسازی پتانسیل کامل عملکرد زیرساخت‌های هوش مصنوعی و HPC خود هستند. این سوئیچ با ترکیب تراکم پورت بالا، تأخیر فوق‌العاده کم و قابلیت‌های محاسباتی در شبکه، مستقیماً به گلوگاه‌های ارتباطی که به طور تاریخی مقیاس‌پذیری خوشه را محدود کرده‌اند، می‌پردازد.

با نگاه به آینده، مرکز ابر محاسباتی قصد دارد شبکه خود را در سال مالی آینده به 2400 گره گسترش دهد و از همان معماری MQM8790-HS2F با سوئیچ‌های ستون فقرات اضافی استفاده کند. این تیم همچنین در حال بررسی پشتیبانی سوئیچ از الگوریتم‌های کاهش بهبود یافته SHARP v3.0 است که نوید تسریع بیشتر بارهای کاری نوظهور مانند شبکه‌های عصبی گراف و یادگیری تقویتی را می‌دهد.

برای مدیران IT، معماران شبکه و مهندسان که گزینه‌های اتصال را برای ساخت خوشه‌های خود ارزیابی می‌کنند، NVIDIA Mellanox MQM8790-HS2F مسیری اثبات شده و تأیید شده در عمل را برای دستیابی به تأخیر زیر میکروثانیه، حداکثر بهره‌وری GPU و مدیریت ساده شبکه ارائه می‌دهد. مشخصات MQM8790-HS2F دقیق و طرح‌های مرجع از پورتال مستندات فنی NVIDIA در دسترس هستند و این سوئیچ در حال حاضر به طور گسترده در دسترس است - برای یافتن یک شریک منطقه‌ای به دنبال MQM8790-HS2F برای فروش باشید.