آداپتور سرور NVIDIA Mellanox MCX4121A-ACAT در عمل | انتقال با تأخیر کم RDMA/RoCE و افزایش توان عملیاتی سرور
July 22, 2026
آداپتور سرور NVIDIA Mellanox MCX4121A-ACAT در عمل | انتقال با تأخیر کم RDMA/RoCE و افزایش توان عملیاتی سرور
پیشزمینه و چالش: زمانی که 25GbE با دیوار تأخیر روبرو میشود
یک ارائهدهنده خدمات ابری متوسط - بیایید آنها را "CloudNova" بنامیم - با یک گلوگاه آشنا اما دردناک روبرو بود. مرکز داده آنها بر روی زیرساخت 25GbE اجرا میشد، اما عملکرد برنامه داستان متفاوتی داشت. تکثیر پایگاه داده عقب افتاد، کارهای یادگیری ماشین توزیع شده در همگامسازی گرادیان متوقف شدند و آرایههای ذخیرهسازی NVMe هرگز IOPS وعده داده شده خود را ارائه نکردند. مقصر؟ سربار پشته سنتی TCP/IP بیش از 25٪ از هستههای CPU را در گرههای محاسباتی آنها مصرف میکرد و کارتهای شبکه موجود فاقد تخلیه سختافزاری برای RDMA بودند. آنچه آنها نیاز داشتند نه فقط پهنای باند بیشتر، بلکهپهنای باندقابل استفاده با تعیینپذیری در سطح میکروثانیه بود. جستجوی آنها آنها را به سمتNVIDIA Mellanox MCX4121A-ACATهدایت کرد - کارتی که دقیقاً برای این دردهای مرکز داده مدرن مهندسی شده بود.
راه حل: استقرار کارت آداپتور اترنت MCX4121A-ACAT
تیم معماری CloudNova کارتهای شبکه قدیمی 10GbE خود را باکارت آداپتور اترنت MCX4121A-ACATدر 120 گره محاسباتی جایگزین کرد که هر کدام مجهز به پورتهای دوگانه SFP28 بودند. استقرار از پشتیبانی بومی RoCE v2 آداپتور برای فعال کردن انتقال اترنت بدون اتلاف استفاده کرد و نیاز به شبکههای InfiniBand جداگانه را از بین برد. کلید راه حل، طراحیMCX4121A-ACAT ConnectX-4 Lx دو پورت 25GbE SFP28بود که امکان پیوند فعال-فعال را برای توان عملیاتی تجمعی 50 گیگابیت بر ثانیه در هر سرور فراهم میکرد. تیم PFC (کنترل جریان اولویت) و ECN (اعلان ازدحام صریح) را در سطح سوئیچ پیکربندی کرد و اطمینان حاصل کرد که ترافیک RoCE حتی در اوج بار بدون اتلاف باقی میماند. ظرف دو هفته، کل شبکه ذخیرهسازی و محاسباتی بر روی RDMA اجرا میشد - انتقالی که با سازگاری خارج از جعبه آداپتور با کابلکشی SFP28 موجود و سوئیچهای Mellanox Spectrum بدون دردسر انجام شد.
از دیدگاه عملیاتی، اکوسیستمسازگار با MCX4121A-ACATارزشمند بود. کارتها به طور بینقص با سرورهای مبتنی بر اوبونتو و خوشه کوبرنتیس CloudNova ادغام شدند و فقط به نصب درایور استاندارد نیاز داشتند. این تیم همچنین بهبرگه داده MCX4121A-ACATبرای تنظیم دقیق تخصیص بافر و تنظیمات تجمیع وقفه مراجعه کرد و به عملکرد بهینه برای محیط کاری ترکیبی خود - که شامل خوشههای MySQL، تجزیه و تحلیل Spark و کارهای آموزشی TensorFlow بود - دست یافت.
نتایج قابل اندازهگیری: توان عملیاتی، تأخیر و بهرهوری CPU
افزایش عملکرد فوری و قابل اندازهگیری بود. با فعال شدن RDMA از طریق RoCE از طریقNVIDIA Mellanox MCX4121A-ACAT، بکاند ذخیرهسازی شاهد کاهش تأخیر خواندن NVMe-oF از 85 میکروثانیه به تنها 12 میکروثانیه بود - بهبود 7 برابری. تأخیر تکثیر پایگاه داده بین گرههای اصلی و آماده به کار از 320 میلیثانیه به کمتر از 2 میلیثانیه کاهش یافت و امکان انتقال تقریباً همزمان را فراهم کرد. برای بارهای کاری یادگیری ماشین، زمان همگامسازی all-reduce برای آموزش ResNet-50 به میزان 62٪ کاهش یافت و زمان کلی آموزش دوره را از 4.2 ساعت به 1.6 ساعت کاهش داد.
فراتر از تأخیر، افزایش توان عملیاتی سرور نیز به همان اندازه چشمگیر بود. موتور تخلیه سختافزاری - که شامل تخلیه چکسام، LSO/LRO و برچسبگذاری VLAN است - استفاده از CPU را برای پردازش شبکه از 28٪ به کمتر از 5٪ در تمام گرهها کاهش داد. این امر بیش از 20 هسته CPU در هر سرور را برای منطق برنامه آزاد کرد و مستقیماً تراکم کانتینر را 40٪ افزایش داد. طبقمشخصات MCX4121A-ACAT، این کارت توان عملیاتی 25 گیگابیت بر ثانیه در هر پورت با تأخیر کمتر از 1 میکروثانیه را ارائه میدهد و معیارهای داخلی CloudNova این اعداد را در تولید تأیید کردند.
| معیار | قبل (کارت شبکه قدیمی) | بعد (MCX4121A-ACAT) | بهبود |
|---|---|---|---|
| تأخیر خواندن NVMe-oF | 85 میکروثانیه | 12 میکروثانیه | 7.1 برابر سریعتر |
| تأخیر تکثیر پایگاه داده | 320 میلیثانیه | < 2 میلیثانیه | کاهش 160 برابری |
| سربار شبکه CPU | 28% | 4.8% | 83% کمتر |
| زمان آموزش ML (ResNet-50) | 4.2 ساعت | 1.6 ساعت | 62% سریعتر |
مزایای عملیاتی: TCO و آمادگی برای آینده
در حالی که اعداد عملکرد خام داستان قانعکنندهای را بیان میکنند، مزایای عملیاتی نیز به همان اندازه قابل توجه بودند. راه حلکارت آداپتور اترنت MCX4121A-ACATهزینه کل مالکیت را با حذف نیاز به یک شبکه RDMA جداگانه (صرفهجویی بیش از 180 هزار دلار در زیرساخت سوئیچ) کاهش داد. مصرف برق در هر سرور 8 وات نسبت به کارتهای شبکه قبلی کاهش یافت که منجر به صرفهجویی سالانه در خنککننده تقریباً 15٪ شد. علاوه بر این، طراحی دو پورت آداپتور افزونگی بومی را فراهم کرد - هنگامی که یک پیوند دچار نوسان میشد، ترافیک به طور خودکار به پورت ثانویه با صفر اتلاف بسته منتقل میشد، همانطور که توسط گزارشهای تلمتری آداپتور تأیید شد.
برای مدیران IT کهقیمت MCX4121A-ACATرا در مقایسه با راه حلهای جایگزین ارزیابی میکنند، مدیر مالی CloudNova خاطرنشان کرد که دوره بازپرداخت کمتر از 10 ماه بود که عمدتاً ناشی از افزایش استفاده از سرور و کاهش زمان تکمیل کار بود. این تیم همچنین از معماری آیندهنگر قدردانی کرد - همانMCX4121A-ACAT برای فروشامروز از 25GbE پشتیبانی میکند اما میتواند با اپتیک مناسب برای محیطهای 10GbE یا 40GbE مجدداً استفاده شود و از سرمایهگذاری برای ارتقاء آینده محافظت میکند.
خلاصه و چشمانداز: طرحی برای مراکز داده آماده RDMA
سفر CloudNova باNVIDIA Mellanox MCX4121A-ACATیک طرح واضح برای سازمانهایی که به دنبال باز کردن پتانسیل کامل زیرساخت 25GbE هستند، نشان میدهد. با ترکیب توان عملیاتی دو پورت 25GbE، RoCE شتابدهنده سختافزاری و ادغام بینقص با اکوسیستمهای موجود،کارت آداپتور اترنت MCX4121A-ACATورودی/خروجی شبکه را از یک گلوگاه به یک توانمندساز عملکرد تبدیل میکند. نتایج - 7 برابر تأخیر ذخیرهسازی کمتر، 83٪ کاهش سربار CPU و 62٪ آموزش ML سریعتر - نشاندهنده توانایی آداپتور در ارائه نتایج تجاری قابل اندازهگیری است.
با نگاه به آینده، با توجه به اینکه بارهای کاری هوش مصنوعی و تجزیه و تحلیل بلادرنگ همچنان تقاضا برای شبکههای تعیینپذیر را افزایش میدهند،MCX4121A-ACAT ConnectX-4 Lx دو پورت 25GbE SFP28یک پایه محکم برای پذیرش RDMA بدون ارتقاء کامل فراهم میکند. برای معماران و رهبران IT که در حال برنامهریزی برای بهروزرسانی زیرساخت بعدی خود هستند، این آداپتور نه تنها یک جزء، بلکه یک دارایی استراتژیک است. پارامترهای تنظیم دقیق و بهترین شیوههای استقرار دربرگه داده MCX4121A-ACATرسمی موجود است - یک مرجع ضروری برای هر استقرار جدی.

