NVIDIA Mellanox MCX653105A-HDAT در عمل: RDMA / RoCE انتقال کم تاخیر و بهینه سازی خروجی سرور

July 29, 2026

آخرین اخبار شرکت NVIDIA Mellanox MCX653105A-HDAT در عمل: RDMA / RoCE انتقال کم تاخیر و بهینه سازی خروجی سرور

NVIDIA Mellanox MCX653105A-HDAT در عمل: RDMA / RoCE انتقال کم تاخیر و بهینه سازی خروجی سرور

پیش زمینه و چالش ها: گلوی فشنی شبکه در یک خوشه هوش مصنوعی / HPC

یک شرکت بزرگ فناوری به تازگی یک خوشه 128 گره GPU-سرعتی را برای آموزش مدل زبان بزرگ (LLM) مستقر کرد.با هر گره مجهز به هشت GPU NVIDIA H100 و ذخیره سازی NVMe با عملکرد بالابا این حال، با افزایش بیش از ۳۲ گره، خوشه به کاهش عملکرد چشمگیری دچار شد. تاخیر ارتباطات جمعی All-Reduce به ۸ تا ۱۰ میلی ثانیه رسید.در حالی که TCP/IP شبکه انبار مصرف بیش از 45٪ از منابع CPU در هر گرهشبکه ای که بر روی چندین پیوند 25GbE ساخته شده بود، به خنک اصلی تبدیل شده بود، به شدت استفاده از GPU را محدود می کرد و چرخه های آموزش را بسیار فراتر از جدول زمانی قابل قبول گسترش می داد.تیم به سرعت به یک راه حل نیاز داشت که قادر به ارائه تاخیر بسیار کم و پهنای باند عظیم در حالی که پردازش شبکه CPU فشرده را کاهش می دهد.

راه حل و پیاده سازی: تبدیل پارچه با MCX653105A-HDAT

پس از یک ارزیابی فنی کامل، تیمNVIDIA Mellanox MCX653105A-HDATهر گره گرافیکی مجهز به یککارت شبکه PCIe MCX653105A-HDAT ConnectX، با اتصال دو پورت 100GbE برای ارائه 200 Gb / s از پهنای باند کلی در هر سرور پیکربندی شده است.

این کار در چهار مرحله ساختاری انجام شد:

  • فاز 1 نصب سخت افزار (128 گره):هر سرورکارت آداپتور اترنت MCX653105A-HDAT، با هر دو پورت QSFP28 متصل به دو سوئیچ برگ NVIDIA Spectrum-4 اضافی. آداپتورها با آخرین نرم افزار و مجموعه درایور NVIDIA OFED نصب شده اند.
  • فاز 2 ‬ پیکربندی RoCEv2:این تیم RoCEv2 را در سراسر بافت فعال کرد و پارامترهای کنترل جریان اولویت (PFC) و اطلاع رسانی فشرده (ECN) را با دقت تنظیم کرد تا یک محیط اترن بدون ضرر ایجاد شود.ویژگی های پیشرفته مدیریت ازدحامورق اطلاعات MCX653105A-HDATدر دستیابی به تخصیص مطلوب بافر موثر بوده است.
  • فاز 3 بهینه سازی NCCL:کتابخانه ارتباطات جمعی NVIDIA (NCCL) برای استفاده از قابلیت های RDMA آداپتور مجدداً پیکربندی شد.با قوانین هدایت ترافیک سفارشی برنامه ریزی شده در موتورهای پردازش جاسازی شده آداپتور برای بهینه سازی الگوهای خاص تمام کاهش و همه جمع آوری بار کاری LLM.
  • فاز 4 ️ اعتبارسنجی و تنظیم دقیق:با استفاده از داده های تلمتری که از طریقمشخصات MCX653105A-HDAT، تیم پیکربندی را تأیید کرد، تنظیمات اعتدال قطع را تنظیم کرد و معیارهای عملکرد پایه را برای نظارت مداوم ایجاد کرد.

قابل توجه است که آداپتور ثابت شده استMCX653105A-HDAT سازگاربا زیرساخت های کابل سازی موجود، چون پورت های QSFP28 از هر دو اپتیک 100GbE و 25GbE پشتیبانی می کنند، که اجازه می دهد مهاجرت ظریف بدون تعویض کابل اختلال ایجاد شود.این تیم همچنین از قابلیت های چند میزبان آداپتور برای پشتیبانی از هر دو عملکرد محاسباتی و ذخیره سازی در همان پورت فیزیکی استفاده کرد.

نتایج و مزایا: سود قابل اندازه گیری در عملکرد آموزش

بهبود عملکرد ارائه شده توسطNVIDIA Mellanox MCX653105A-HDATاز همه پیش بینی های اولیه فراتر رفته است. معیارهای کلیدی عملکرد قبل و بعد از ارتقاء در زیر خلاصه شده است:

متریک پیش از ارتقاء (25GbE TCP/IP) پس از ارتقاء (MCX653105A-HDAT با RoCE) بهبود
تمام کم کردن تاخیر (۱۲۸ گره) 9.2 ms 0.28 ms 32.8× کاهش
استفاده از پردازنده شبکه (به هر گره) 47 درصد ۶% ۴۱ درصد از آن بازیافت شده است
استفاده از GPU (مرحله آموزش) 58 درصد 94 درصد +36٪ افزایش
تولید آموزش خوشه ای 1.9x سطح پایه 5.7x سطح پایه 3 برابر افزایش

علاوه بر این دستاوردهای کمی، تیم مزایای عملیاتی قابل توجهی را مشاهده کرد.سرعت چشمگیری چرخه های تکرار مدلمسیر داده قابل برنامه ریزی آداپتور امکان شکل گیری ترافیک سفارشی را برای جریان های اولویت فراهم می کند و اطمینان حاصل می کند که ترافیک ارتباطات جمعی حیاتی هرگز با مناقشه مواجه نمی شود.برای سازمان هایی که بازده سرمایه گذاری را ارزیابی می کنند،قیمت MCX653105A-HDATثابت شده است که به طور کامل با افزایش 3 × خروجی و توانایی به تعویق انداختن کسب سرور GPU اضافی حداقل 12 ماه توجیه شده است.MCX653105A-HDAT براي فروشبسته هایی با سوئیچ های NVIDIA Spectrum-4 مناسب ترین اقتصاد را برای استقرار کلستر ارائه می دهند.

خلاصه و چشم انداز: پایه ای برای زیرساخت های نسل بعدی هوش مصنوعی

این گسترش در مقیاس تولید تایید می کند کهNVIDIA Mellanox MCX653105A-HDATیک جزء تبدیل کننده برای خوشه های هوش مصنوعی و HPC مدرن است. ترکیبی از پهنای باند 200 گیگابایت در ثانیه، تاخیر ارتباطات جمعی کمتر از 0.3 میلی ثانیه،و بارگذاری سخت افزاری جامع سازمان ها را قادر می سازد تا مقیاس پذیری نزدیک خطی را برای بار های کاری شتاب دهنده GPU به دست آورند. به عنوان یک انتهای به انتهایMCX653105A-HDAT راه حل کارت آداپتور اترنت، آن را از بین می برد گلوی فشرده شبکه است که در طول تاریخ محدود توزیع آموزش بهره وری است.

در آینده، شرکت در حال بررسی ادغام با NVIDIA DOCA برای پیاده سازی برنامه نویسی مسیر داده اضافی برای بهینه سازی خاص بار کار است.آنها همچنین در حال بهره برداری از آمپول های پیشرفته دلمتری هستند که به طور گسترده ای درورق اطلاعات MCX653105A-HDAT۰ ساخت مدل های عملکردی پیش بینی شده و استراتژی های خودکار کاهش ترافیک.NVIDIA Mellanox MCX653105A-HDATتبدیل به سنگ بنای نقشه راه زیرساخت های هوش مصنوعی آنها شده است و یک پایه قوی و مقیاس پذیر برای نسل بعدی توسعه و استقرار مدل پایه فراهم می کند.