سوئیچ InfiniBand ملانوکس (NVIDIA Mellanox) MQM9790-NS2F در حال کار – بهینه‌سازی اتصال با تأخیر کم برای RDMA/HPC

July 13, 2026

آخرین اخبار شرکت سوئیچ InfiniBand ملانوکس (NVIDIA Mellanox) MQM9790-NS2F در حال کار – بهینه‌سازی اتصال با تأخیر کم برای RDMA/HPC

سوئیچ InfiniBand ملانوکس (NVIDIA Mellanox) MQM9790-NS2F در حال کار – بهینه‌سازی اتصال با تأخیر کم برای خوشه‌های RDMA/HPC/AI

از آنجایی که خوشه های آموزشی هوش مصنوعی از هزاران تا ده ها هزار GPU مقیاس می شوند، تأخیر شبکه و کنترل ازدحام به عوامل تعیین کننده در استفاده موثر محاسباتی تبدیل می شوند. یک سازمان جهانی پیشرو در تحقیقات هوش مصنوعی اخیراً این را مستقر کرده استملانوکس (NVIDIA Mellanox) MQM9790-NS2Fسوئیچ را برای پشتیبانی از امکانات ابررایانه نسل بعدی خود، پشتیبانی از مدل‌های زبانی در مقیاس بزرگ، شبیه‌سازی‌های دینامیک مولکولی، و یادگیری عمیق توزیع شده تغییر دهید. این مقاله به بررسی استقرار در دنیای واقعی می‌پردازد و جزئیات این را توضیح می‌دهد که چگونه این سوئیچ InfiniBand، حمل‌ونقل RDMA، ارتباطات HPC و پارچه‌های آموزشی موازی داده‌های هوش مصنوعی را تغییر می‌دهد.

پیشینه و چالش ها: از سازش اترنت تا اتصال بدون اتلاف ضروری

این سازمان در ابتدا به یک پارچه اترنت 100 گیگابایتی با RoCEv2 متکی بود. با این حال، از آنجایی که گره‌های GPU آنها به بیش از 1200 سرور (هر کدام با 8 × NVIDIA H100 GPU) افزایش یافتند، با بن‌بست‌های مداوم PFC، تنظیم پیچیده ECN و افت گاه به گاه بسته‌ها مواجه شدند که باعث توقف آموزش می‌شد. این مسائل میانگین زمان تکمیل کار را بیش از 35 درصد افزایش داد و تلاش مهندسی قابل توجهی را در عیب یابی شبکه مصرف کرد. زیرساخت موجود دیگر نمی‌تواند تأخیر قطعی در سطح میکروثانیه و توان عملیاتی بدون تراکم مورد نیاز برای عملیات‌های جمعی گسترده و همه به همه را ارائه دهد.

راه حل و استقرار:سوئیچ InfiniBand MQM9790-NS2Fبه عنوان ستون فقرات پارچه

پس از ارزیابی چندین گزینه، تیم انتخاب کردNVIDIA Mellanox MQM9790-NS2Fبه‌عنوان بلوک اصلی برای یک معماری دولایه‌ای جدید از برگ‌ها. هر قفسه برگ مجهز به دو عدد استMQM9790-NS2F 400Gb/s NDR 64 پورت OSFPسوئیچ ها، ارائه 64 پورت OSFP در هر واحد و ظرفیت کل سوئیچینگ 25.6 ترابایت بر ثانیه. سرعت NDR 400 گیگابیت بر ثانیه در هر پورت، همراه با سوئیچینگ برش و مسیریابی تطبیقی، تأخیر پورت به پورت زیر 600 ns را امکان پذیر می کند - یک نیاز حیاتی برای بار کاری فشرده GPU آنها. استقرار اهرمی ازراه حل سوئیچ MQM9790-NS2F InfiniBandبا سیستم عامل NVIDIA Quantum-2 یکپارچه شده است و از یکپارچگی اطمینان می دهدسازگار با MQM9790-NS2Fعملکرد با آداپتورهای ConnectX‑7 و DPU های BlueField‑3 موجود.

انتخاب های کلیدی استقرار شامل:

  • توپولوژی:درخت چربی غیر مسدود کننده با فرستنده‌های نوری 64 پورت OSFP تا 400G، پهنای باند کامل را برای تمام گره‌های GPU فعال می‌کند.
  • مدیریت:NVIDIA UFM (Unified Fabric Manager) برای تله متری بلادرنگ، تشخیص تراکم، و مسیریابی مجدد مسیر فعال.
  • تخلیه جمعی:SHARPv3 برای تسریع عملیات کاهش همه جانبه، بارگیری ارتباطات از CPUهای میزبان فعال است.

برای اطمینان از یک انتقال روان، تیم با آن مشورت کردبرگه داده MQM9790-NS2Fومشخصات MQM9790-NS2Fبرای تایید نیازهای برق و کابل کشی ضریب فرم 1U و منابع تغذیه اضافی به خوبی در چگالی رک موجود خود قرار می‌گیرند و پورت‌های OSFP هم از کابل‌های DAC و هم از ماژول‌های نوری پشتیبانی می‌کنند و انعطاف‌پذیری را برای گسترش آینده ارائه می‌دهند.

نتایج و مزایا اندازه‌گیری شده - سود قابل سنجش در عملکرد و کارایی

پس از استقرار و بهینه سازی کامل، سازمان پیشرفت های قابل توجهی را در ابعاد مختلف ثبت کرد:

متریک قبل (RoCEv2) بعد از (MQM9790-NS2F)
متوسط ​​تأخیر همه جانبه (1 گیگابایت) ~ 18 میکروثانیه < 8 میکروثانیه
تأخیر دم (99.9% ile) > 150 میکروثانیه < 15 میکروثانیه
استفاده موثر از GPU ~72٪ ~ 91٪
زمان تکمیل کار (متوسط) خط مبنا ‑28٪ (1.4× سریعتر)

فراتر از اعداد خام، تیم وقفه های مربوط به تراکم تقریباً صفر را گزارش کرد که عملیات شبکه را تا حد زیادی ساده کرد. تله متری داخلی و مسیریابی تطبیقیNVIDIA Mellanox MQM9790-NS2Fتعادل بار خودکار را در تمام 64 پورت OSFP مجاز می کند، و تنظیمات دستی ECN را حذف می کند. علاوه بر این،سوئیچ MQM9790-NS2F InfiniBandعملکرد قطعی را حتی با استفاده از پیوند 95٪ ارائه می دهد - شاهکاری که با راه اندازی اترنت قبلی آنها غیرممکن است.

این سازمان همچنین خاطرنشان کرد کهقیمت MQM9790-NS2Fهنگامی که در طول چرخه عمر 5 ساله مستهلک شد، با کاهش مصرف برق در هر پورت (≈1.5 وات در هر پورت 400G) و هزینه کابل کشی کمتر به دلیل تراکم پورت بیشتر جبران شد. با در دسترس بودن عمومی که اکنون بالغ شده است، آنها آن را تأیید کردندMQM9790-NS2F برای فروشاز طریق کانال های مجاز، تدارکات را ساده کرده اند، وبرگه داده MQM9790-NS2Fتمام جزئیات نصب و انطباق لازم را ارائه کرد.

خلاصه و چشم انداز – طرحی برای زیرساخت های هوش مصنوعی نسل بعدی

تصویب ازملانوکس (NVIDIA Mellanox) MQM9790-NS2Fدر این خوشه HPC/AI در مقیاس بزرگ نشان می‌دهد که پارچه InfiniBand ساخته شده دیگر یک لوکس نیست، بلکه یک ضرورت برای سازمان‌هایی است که مرزهای هوش مصنوعی و محاسبات علمی را پیش می‌برند. با ارائه تأخیر ثابت زیر میکروثانیه، انتقال RDMA بدون تلفات، و شتاب محاسبات درون شبکه،MQM9790-NS2F 400Gb/s NDR 64 پورت OSFPسوئیچ به مراکز داده قدرت می دهد تا به مقیاس پذیری تقریباً خطی تا ده ها هزار GPU دست یابند.

به دنبال آینده، تیم قصد دارد پارچه را با موارد اضافی گسترش دهدسوئیچ MQM9790-NS2F InfiniBandواحدهایی برای پشتیبانی از بارهای کاری کلاس exascale آتی، از جمله مدل‌سازی آب و هوا و ژنومیک. راسازگار با MQM9790-NS2Fاکوسیستم با نسل های آینده NVIDIA حفاظت از سرمایه گذاری را تضمین می کند. برای معماران و مدیران فناوری اطلاعات که به‌روزرسانی‌های مشابه را ارزیابی می‌کنند، این مورد واقعی تأیید می‌کند کهراه حل سوئیچ MQM9790-NS2F InfiniBandیک مسیر ثابت و مقرون به صرفه برای شبکه‌سازی خوشه‌ای با کارایی بالا و تأخیر کم ارائه می‌کند - یک عامل حیاتی برای دهه آینده نوآوری هوش مصنوعی.