NVIDIA Mellanox MCX653106A-HDAT در عمل: RDMA / RoCE انتقال کم تاخیر و بهینه سازی خروجی سرور
July 30, 2026
یک ارائهدهنده اصلی ابر مقیاسپذیر که یک خوشه ۲۵۶ گرهای برای آموزش توزیعشده هوش مصنوعی و تجزیه و تحلیل بلادرنگ را اداره میکند، با افزایش مقیاس زیرساخت خود، با افت شدید عملکرد شبکه مواجه شد. شبکه مبتنی بر TCP/IP ۲۵GbE موجود، تأخیر All-Reduce را بیش از ۶ میلیثانیه در ۱۲۸ گره نشان داد، در حالی که استفاده از CPU برای پردازش شبکه بیش از ۴۰٪ از ظرفیت محاسباتی هر سرور را اشغال میکرد. این گلوگاه، استفاده از GPU را به تنها ۵۵٪ محدود کرد و چرخههای آموزش را به شدت طولانی و ظرفیت درآمدزایی را کاهش داد. این تیم به راهحلی نیاز داشت که بتواند هم تأخیر در مقیاس میکروثانیه و هم پهنای باند عظیم را ارائه دهد و در عین حال قابلیت برنامهریزی لازم برای بهینهسازی ترافیک خاص بار کاری را فراهم کند.
پس از یک ارزیابی فنی گسترده، ارائهدهنده، NVIDIA Mellanox MCX653106A-HDAT را به عنوان سنگ بنای تحول شبکه خود انتخاب کرد. هر گره سرور مجهز به یک کارت شبکه PCIe آداپتور MCX653106A-HDAT ConnectX بود که با اتصال دو پورت ۱۰0GbE پیکربندی شده بود تا پهنای باند تجمعی ۲۰۰ گیگابیت بر ثانیه در هر گره را ارائه دهد.
- فاز ۱ — آزمایشی (۸ گره): تیم کارت آداپتور اترنت MCX653106A-HDAT را بر روی زیرمجموعهای از سرورهای GPU نصب کرد و RoCEv2 را با PFC و ECN پیکربندی کرد تا یک شبکه اترنت بدون اتلاف ایجاد کند. آداپتورها با سوئیچهای NVIDIA Spectrum-4 برای مدیریت ازدحام سرتاسری جفت شدند.
- فاز ۲ — اعتبارسنجی و تنظیم: با استفاده از دادههای تلهمتری مستند شده در برگه داده MCX653106A-HDAT، تیم پیکربندی را تأیید کرد، پارامترهای DCB را تنظیم دقیق کرد و تنظیمات ارتباط جمعی NCCL را بهینه کرد. ویژگیهای برنامهریزی پیشرفته آداپتور، هدایت ترافیک سفارشی را برای الگوهای All-Reduce خاص بار کاری امکانپذیر کرد.
- فاز ۳ — استقرار کامل تولید (۲۵۶ گره): پس از اعتبارسنجی موفقیتآمیز، کل خوشه به آداپتور جدید منتقل شد. ماهیت سازگار با MCX653106A-HDAT راهحل، ادغام بیدرنگ با سرورهای موجود و توزیعهای لینوکس را تضمین کرد.
- فاز ۴ — بهینهسازی مداوم: تیم از تلهمتری درون خطی و مسیر داده قابل برنامهریزی آداپتور برای پیادهسازی سیاستهای مسیریابی آگاه از بار کاری استفاده کرد و عملکرد را برای وظایف آموزش هوش مصنوعی بیشتر بهینه کرد.
تیم خاطرنشان کرد که راهحل کارت آداپتور اترنت MCX653106A-HDAT یک مسیر مهاجرت ساده را فراهم کرد، زیرا پورتهای QSFP56 از اپتیکهای ۱۰۰GbE و ۲۵GbE پشتیبانی میکردند و امکان انتقال تدریجی و بدون اختلال در اتصال موجود را فراهم میکرد.
| معیار | قبل از ارتقا (۲۵GbE TCP/IP) | پس از ارتقا (MCX653106A-HDAT با RoCE) | بهبود |
|---|---|---|---|
| تأخیر All-Reduce (۲۵۶ گره) | ۶.۸ میلیثانیه | ۰.۲۲ میلیثانیه | کاهش ۳۰.۹ برابر |
| استفاده از CPU شبکه (در هر گره) | ۴۳٪ | ۵٪ | ۳۸ درصد بازیابی شد |
| استفاده از GPU (فاز آموزش) | ۵۵٪ | ۹۳٪ | افزایش ۳۸٪ |
| توان عملیاتی آموزش خوشه | ۲.۱ برابر پایه | ۶.۴ برابر پایه | افزایش ۳ برابر |
فراتر از این دستاوردهای کمی، ارائهدهنده مزایای عملیاتی قابل توجهی را مشاهده کرد. اجرای آموزش که قبلاً ۱۴ روز طول میکشید، تنها در ۴.۵ روز تکمیل شد و زمان عرضه به بازار برای خدمات جدید هوش مصنوعی را به شدت تسریع کرد. مسیر داده قابل برنامهریزی آداپتور، شکلدهی ترافیک سفارشی را برای جریانهای اولویتدار امکانپذیر کرد و تضمین کرد که ترافیک ارتباط جمعی حیاتی هرگز با رقابت مواجه نشود. برای سازمانهایی که بازگشت سرمایه را ارزیابی میکنند، قیمت MCX653106A-HDAT با افزایش ۳ برابری توان عملیاتی و توانایی به تعویق انداختن خرید سرورهای اضافی بیش از ۱۸ ماه، کاملاً توجیهپذیر بود. تیم همچنین خاطرنشان کرد که بستههای MCX653106A-HDAT برای فروش با سوئیچهای NVIDIA Spectrum-4 مطلوبترین اقتصاد را برای استقرارهای در مقیاس بزرگ ارائه میدادند.
ارائهدهنده همچنین از قابلیتهای جامع تلهمتری که در مشخصات MCX653106A-HDAT شرح داده شده است، برای ساخت مدلهای پیشبینی عملکرد و استراتژیهای خودکار کاهش ازدحام استفاده کرد و کارایی عملیاتی را بیشتر بهبود بخشید.
این استقرار در مقیاس تولید نشان میدهد که NVIDIA Mellanox MCX653106A-HDAT یک جزء تحولآفرین برای زیرساختهای مدرن هوش مصنوعی و ابری است. ترکیب پهنای باند تجمعی ۲۰۰ گیگابیت بر ثانیه، تأخیر ارتباط جمعی کمتر از ۰.۳ میلیثانیه و تخلیه سختافزاری جامع، مقیاسپذیری تقریباً خطی را برای بارهای کاری شتابدهنده GPU امکانپذیر میسازد. به عنوان یک راهحل کارت آداپتور اترنت MCX653106A-HDAT سرتاسری، گلوگاه شبکه را که به طور تاریخی کارایی آموزش توزیعشده و تحویل خدمات ابری را محدود کرده است، از بین میبرد.
در آینده، ارائهدهنده ابر در حال بررسی ادغام گسترده با NVIDIA DOCA برای پیادهسازی قابلیت برنامهریزی مسیر داده اضافی برای بهینهسازی خاص بار کاری در محیطهای چند مستأجر است. آنها همچنین از تلهمتری درون خطی آداپتور — که به طور گسترده در برگه داده MCX653106A-HDAT مستند شده است — برای توسعه نسل بعدی سیستمهای مدیریت عملکرد خودکار استفاده میکنند. NVIDIA Mellanox MCX653106A-HDAT به پایه نقشه راه زیرساخت هوش مصنوعی آنها تبدیل شده است و یک پلتفرم قوی و مقیاسپذیر برای نسل بعدی آموزش مدلهای پایه و خدمات تجزیه و تحلیل بلادرنگ فراهم میکند.

