سوئیچ InfiniBand ملانوکس (NVIDIA Mellanox) MQM9790-NS2F در حال کار – بهینهسازی اتصال با تأخیر کم برای RDMA/HPC
July 13, 2026
سوئیچ InfiniBand ملانوکس (NVIDIA Mellanox) MQM9790-NS2F در حال کار – بهینهسازی اتصال با تأخیر کم برای خوشههای RDMA/HPC/AI
از آنجایی که خوشه های آموزشی هوش مصنوعی از هزاران تا ده ها هزار GPU مقیاس می شوند، تأخیر شبکه و کنترل ازدحام به عوامل تعیین کننده در استفاده موثر محاسباتی تبدیل می شوند. یک سازمان جهانی پیشرو در تحقیقات هوش مصنوعی اخیراً این را مستقر کرده استملانوکس (NVIDIA Mellanox) MQM9790-NS2Fسوئیچ را برای پشتیبانی از امکانات ابررایانه نسل بعدی خود، پشتیبانی از مدلهای زبانی در مقیاس بزرگ، شبیهسازیهای دینامیک مولکولی، و یادگیری عمیق توزیع شده تغییر دهید. این مقاله به بررسی استقرار در دنیای واقعی میپردازد و جزئیات این را توضیح میدهد که چگونه این سوئیچ InfiniBand، حملونقل RDMA، ارتباطات HPC و پارچههای آموزشی موازی دادههای هوش مصنوعی را تغییر میدهد.
پیشینه و چالش ها: از سازش اترنت تا اتصال بدون اتلاف ضروری
این سازمان در ابتدا به یک پارچه اترنت 100 گیگابایتی با RoCEv2 متکی بود. با این حال، از آنجایی که گرههای GPU آنها به بیش از 1200 سرور (هر کدام با 8 × NVIDIA H100 GPU) افزایش یافتند، با بنبستهای مداوم PFC، تنظیم پیچیده ECN و افت گاه به گاه بستهها مواجه شدند که باعث توقف آموزش میشد. این مسائل میانگین زمان تکمیل کار را بیش از 35 درصد افزایش داد و تلاش مهندسی قابل توجهی را در عیب یابی شبکه مصرف کرد. زیرساخت موجود دیگر نمیتواند تأخیر قطعی در سطح میکروثانیه و توان عملیاتی بدون تراکم مورد نیاز برای عملیاتهای جمعی گسترده و همه به همه را ارائه دهد.
راه حل و استقرار:سوئیچ InfiniBand MQM9790-NS2Fبه عنوان ستون فقرات پارچه
پس از ارزیابی چندین گزینه، تیم انتخاب کردNVIDIA Mellanox MQM9790-NS2Fبهعنوان بلوک اصلی برای یک معماری دولایهای جدید از برگها. هر قفسه برگ مجهز به دو عدد استMQM9790-NS2F 400Gb/s NDR 64 پورت OSFPسوئیچ ها، ارائه 64 پورت OSFP در هر واحد و ظرفیت کل سوئیچینگ 25.6 ترابایت بر ثانیه. سرعت NDR 400 گیگابیت بر ثانیه در هر پورت، همراه با سوئیچینگ برش و مسیریابی تطبیقی، تأخیر پورت به پورت زیر 600 ns را امکان پذیر می کند - یک نیاز حیاتی برای بار کاری فشرده GPU آنها. استقرار اهرمی ازراه حل سوئیچ MQM9790-NS2F InfiniBandبا سیستم عامل NVIDIA Quantum-2 یکپارچه شده است و از یکپارچگی اطمینان می دهدسازگار با MQM9790-NS2Fعملکرد با آداپتورهای ConnectX‑7 و DPU های BlueField‑3 موجود.
انتخاب های کلیدی استقرار شامل:
- توپولوژی:درخت چربی غیر مسدود کننده با فرستندههای نوری 64 پورت OSFP تا 400G، پهنای باند کامل را برای تمام گرههای GPU فعال میکند.
- مدیریت:NVIDIA UFM (Unified Fabric Manager) برای تله متری بلادرنگ، تشخیص تراکم، و مسیریابی مجدد مسیر فعال.
- تخلیه جمعی:SHARPv3 برای تسریع عملیات کاهش همه جانبه، بارگیری ارتباطات از CPUهای میزبان فعال است.
برای اطمینان از یک انتقال روان، تیم با آن مشورت کردبرگه داده MQM9790-NS2Fومشخصات MQM9790-NS2Fبرای تایید نیازهای برق و کابل کشی ضریب فرم 1U و منابع تغذیه اضافی به خوبی در چگالی رک موجود خود قرار میگیرند و پورتهای OSFP هم از کابلهای DAC و هم از ماژولهای نوری پشتیبانی میکنند و انعطافپذیری را برای گسترش آینده ارائه میدهند.
نتایج و مزایا اندازهگیری شده - سود قابل سنجش در عملکرد و کارایی
پس از استقرار و بهینه سازی کامل، سازمان پیشرفت های قابل توجهی را در ابعاد مختلف ثبت کرد:
| متریک | قبل (RoCEv2) | بعد از (MQM9790-NS2F) |
|---|---|---|
| متوسط تأخیر همه جانبه (1 گیگابایت) | ~ 18 میکروثانیه | < 8 میکروثانیه |
| تأخیر دم (99.9% ile) | > 150 میکروثانیه | < 15 میکروثانیه |
| استفاده موثر از GPU | ~72٪ | ~ 91٪ |
| زمان تکمیل کار (متوسط) | خط مبنا | ‑28٪ (1.4× سریعتر) |
فراتر از اعداد خام، تیم وقفه های مربوط به تراکم تقریباً صفر را گزارش کرد که عملیات شبکه را تا حد زیادی ساده کرد. تله متری داخلی و مسیریابی تطبیقیNVIDIA Mellanox MQM9790-NS2Fتعادل بار خودکار را در تمام 64 پورت OSFP مجاز می کند، و تنظیمات دستی ECN را حذف می کند. علاوه بر این،سوئیچ MQM9790-NS2F InfiniBandعملکرد قطعی را حتی با استفاده از پیوند 95٪ ارائه می دهد - شاهکاری که با راه اندازی اترنت قبلی آنها غیرممکن است.
این سازمان همچنین خاطرنشان کرد کهقیمت MQM9790-NS2Fهنگامی که در طول چرخه عمر 5 ساله مستهلک شد، با کاهش مصرف برق در هر پورت (≈1.5 وات در هر پورت 400G) و هزینه کابل کشی کمتر به دلیل تراکم پورت بیشتر جبران شد. با در دسترس بودن عمومی که اکنون بالغ شده است، آنها آن را تأیید کردندMQM9790-NS2F برای فروشاز طریق کانال های مجاز، تدارکات را ساده کرده اند، وبرگه داده MQM9790-NS2Fتمام جزئیات نصب و انطباق لازم را ارائه کرد.
خلاصه و چشم انداز – طرحی برای زیرساخت های هوش مصنوعی نسل بعدی
تصویب ازملانوکس (NVIDIA Mellanox) MQM9790-NS2Fدر این خوشه HPC/AI در مقیاس بزرگ نشان میدهد که پارچه InfiniBand ساخته شده دیگر یک لوکس نیست، بلکه یک ضرورت برای سازمانهایی است که مرزهای هوش مصنوعی و محاسبات علمی را پیش میبرند. با ارائه تأخیر ثابت زیر میکروثانیه، انتقال RDMA بدون تلفات، و شتاب محاسبات درون شبکه،MQM9790-NS2F 400Gb/s NDR 64 پورت OSFPسوئیچ به مراکز داده قدرت می دهد تا به مقیاس پذیری تقریباً خطی تا ده ها هزار GPU دست یابند.
به دنبال آینده، تیم قصد دارد پارچه را با موارد اضافی گسترش دهدسوئیچ MQM9790-NS2F InfiniBandواحدهایی برای پشتیبانی از بارهای کاری کلاس exascale آتی، از جمله مدلسازی آب و هوا و ژنومیک. راسازگار با MQM9790-NS2Fاکوسیستم با نسل های آینده NVIDIA حفاظت از سرمایه گذاری را تضمین می کند. برای معماران و مدیران فناوری اطلاعات که بهروزرسانیهای مشابه را ارزیابی میکنند، این مورد واقعی تأیید میکند کهراه حل سوئیچ MQM9790-NS2F InfiniBandیک مسیر ثابت و مقرون به صرفه برای شبکهسازی خوشهای با کارایی بالا و تأخیر کم ارائه میکند - یک عامل حیاتی برای دهه آینده نوآوری هوش مصنوعی.

