NVIDIA Mellanox MQM9790-NS2F در عمل: ساخت یک پارچه RDMA با تأخیر کم برای خوشه‌های هوش مصنوعی و HPC

August 24, 2026

آخرین اخبار شرکت NVIDIA Mellanox MQM9790-NS2F در عمل: ساخت یک پارچه RDMA با تأخیر کم برای خوشه‌های هوش مصنوعی و HPC

NVIDIA Mellanox MQM9790-NS2F در عمل: ساخت یک پارچه RDMA کم تاخیر برای خوشه های هوش مصنوعی و HPC

پیش زمینه و چالش: وقتی که مقیاس بزرگ شدن به یک تنگنایی تبدیل می شود

همانطور که مدل های زبان بزرگ از هزاران تا ده ها هزار GPU مقیاس پذیر می شوند، و شبیه سازی آب و هوا به سمت رزولوشن مقیاس کیلومتری حرکت می کند،محدودیت های پارچه های سنتی اترنت آشکار می شوددر این محیط ها، الگوهای ارتباطات جمعی MPI مانند همه را کاهش دهید و همه را به همه بدهید، تقاضای زیادی در مورد تاخیر شبکه و کنترل ازدحام دارند. بدون یک اتصال بین المللی ساخته شده به این منظور،حتی قدرتمندترین گره های محاسباتی یک بخش قابل توجهی از چرخه های خود را صرف انتظار برای داده ها می کنند، به طور موثر منابع گران قیمت GPU را هدر می دهد.

این دقیقاً چالش است کهNVIDIA Mellanox MQM9790-NS2Fبه عنوان یک سوئیچ 400Gb/s NDR InfiniBand با 64 پورت OSFP، طراحی شده است تا تاخیر تعیین کننده، زیر میکرو ثانیه را در هزاران نقطه نهایی ارائه دهد،امکان مقیاس بندی خطی واقعی برای بارهای کار توزیع شده.

راه حل و پیاده سازی: یک پارچه برگ ستون فقرات ساخته شده برای RDMA

در یک سناریوی معمول برای یک آزمایشگاه تحقیقاتی بزرگ هوش مصنوعی،سوئیچ MQM9790-NS2F InfiniBandهسته ی یک توپولوژی دو لایه ی برگ-گروه پشتی را تشکیل می دهد. در لایه ی برگ، هر قفسه ی محاسباتی مجهز به یک یا دو واحد MQM9790-NS2F است.ارائه 64 پورت اتصال 400Gb / s به سرورهای GPU از طریق کابل های مس OSFP به OSFP یا کابل های نوری فعالدر لایه ستون فقرات، سوئیچ های اضافی MQM9790-NS2F برگ ها را به هم متصل می کنند و یک پارچه درخت چربی غیر مسدود کننده با پهنای باند کامل ایجاد می کنند.

What makes this solution particularly compelling is the switch's native support for RDMA over Converged Ethernet (RoCE) when operating in InfiniBand mode—though here it leverages InfiniBand's native RDMA capabilities for even lower latency and CPU offload.MQM9790-NS2F 400Gb/s NDR OSFP 64 پورتیکپارچه سازی فناوری SHARPv3 (پروتکل جمع آوری و کاهش سلسله مراتب مقیاس پذیر) NVIDIA، که عملیات جمعی را مستقیماً بر روی بافت سوئیچ قرار می دهد.این بدان معنی است که یک عملیات کاهش که به طور معمول چندین بار از شبکه عبور می کند اکنون در یک گذر انجام می شود.، زمان تکمیل کار را تا 30 درصد برای بار های کاری فشرده ارتباطی کاهش می دهد.

برای معماران شبکه ارزیابیMQM9790-NS2F راه حل سوئیچ InfiniBand، فرآیند پیاده سازی توسط مدیر پارچه ی متحد (UFM) NVIDIA ساده می شود. UFM دید متمرکز را در سلامت پارچه ، کشف توپولوژی خودکار ،و نظارت پیشگیرانه بر انسداد­ها­ قابلیت­های حیاتی در مدیریت پارچه­هایی با بیش از 2در این گزارش آمده است که تعداد پورت هایمطابقت با MQM9790-NS2Fاکوسیستم، که شامل طیف گسترده ای از کابل ها و گیرنده های گواهینامه NVIDIA است، تدارکات را ساده می کند و خطر استفاده را کاهش می دهد.

نتایج و دستاوردهای قابل اندازه گیری: از تئوری به واقعیت تولید

در یک توسعه تولید اخیر برای یک خوشه 2.048-GPU اختصاص داده شده به آموزش مدل ترانسفورماتور در مقیاس بزرگ، ارتقا از HDR (200Gb / s) به زیرساخت های NDR (400Gb / s)NVIDIA Mellanox MQM9790-NS2Fدر قلب آن، پیشرفت های قابل اندازه گیری در ابعاد متعدد حاصل شده است:

  • کاهش زمان تکمیل کار:تکرار آموزش از انتهای به انتهای برای یک مدل پارامتر 175B 28٪ کاهش یافت، که عمدتا به کاهش SHARPv3 و کاهش تاخیر دم نسبت داده می شود.
  • استفاده از شبکه:استفاده متوسط از پارچه از 62٪ به 89٪ افزایش یافت بدون اینکه سقوط ازدحام را ایجاد کند، به لطف مکانیسم های پیشرفته هدایت سازگار و کنترل ازدحام سوئیچ.
  • ساده سازی عملیاتی:با 64 پورت در هر سوئیچ، تعداد سوئیچ های ستون فقرات مورد نیاز در مقایسه با یک طراحی HDR 32 پورت به نصف کاهش یافت و به طور قابل توجهی پیچیدگی کابل و مصرف برق در هر قفسه را کاهش داد.

بر اساسمشخصات MQM9790-NS2F، سوئیچ تاخیر زیر 100ns پورت به پورت را ارائه می دهد و تا 51.2Tb / s از ظرفیت سوئیچینگ کلی را پشتیبانی می کند.مهندسان شبکه همچنین اشاره کردند کهورق اطلاعات MQM9790-NS2Fعملکرد دنیای واقعی را به دقت منعکس می کند، بدون هیچ سورپرایزی در طول مرحله اعتباربخشی.

از منظر TCO، توانایی یکپارچه سازی نقاط پایانی بیشتر در هر سطح سوئیچ به طور مستقیم هزینه های سرمایه را کاهش داد.قیمت MQM9790-NS2Fبا توجه به این که تعداد قطعات سوئیچ در مقایسه با راه حل های معادل 200Gb / s بالاتر است، هزینه شبکه در هر GPU به دلیل ارتفاع رادیکس و کاهش تعداد لایه های سوئیچ کاهش یافته است.در ترکیب با سود عملکرد، قضيه ي کسب و کار رو براي هيئت مديره ي آزمايشگاه روشن کرد

خلاصه و چشم انداز: بنیاد NDR برای محاسبات Exascale

درNVIDIA Mellanox MQM9790-NS2Fبا ارائه پهنای باند NDR 400Gb / s، تراکم 64 پورت، این امکان را برای یک سیستم عامل با سرعت بالا فراهم می کند.و شتاب محاسبات در شبکه در یک فاکتور فرم 1U، این به معماران اجازه می دهد تا پارچه هایی را بسازند که به ده ها هزار نقطه پایانی مقیاس پذیر باشند بدون اینکه عملکرد یا قابلیت مدیریت را از دست بدهند.

در آینده، به عنوان بار کار همچنان به درخواست پهنای باند بیشتر و تاخیر کمتر،سوئیچ MQM9790-NS2F InfiniBandبه عنوان سنگ بنای نسل بعدی سیستم های exascale عمل خواهد کرد.سازگاری آن با سیستم عامل های موجود NVIDIA Quantum-2 و ادغام یکپارچه با UFM یک مسیر مهاجرت بدون مشکل را برای سازمان های ارتقا دهنده از پارچه های HDR تضمین می کندبرای مدیران فناوری اطلاعات و معماران ارزیابی سرمایه گذاری های شبکه نسل بعدی خود، MQM9790-NS2F یک راه حل اثبات شده،راه حل آماده تولید که وعده بهینه سازی اتصال RDMA با تاخیر پایین را ارائه می دهد.