انتقال با تأخیر کم RDMA/RoCE و پیشرفت توان عملیاتی سرور
April 29, 2026
یک آزمایشگاه تحقیقاتی هوش مصنوعی با رشد سریع با مشکلی آشنا دست و پنجه نرم میکرد: زیرساخت 100 گیگابیت اترنت آنها پهنای باند با سرعت سیم را ارائه میداد، اما تأخیر برنامه به طور سرسختانه بالا باقی مانده بود. وظایف آموزش توزیع شده از لرزش مکرر شبکه رنج میبردند و دسترسی به ذخیرهسازی NVMe-over-Fabrics تأخیرهای غیرقابل پیشبینی را اضافه میکرد. علت اصلی؟ پشتههای سنتی TCP/IP تقریباً 30 درصد از هستههای CPU را فقط برای پردازش بستهها مصرف میکردند و محاسبات کمتری را برای بارهای کاری واقعی باقی میگذاشتند. تیم به یک تغییر اساسی نیاز داشت - انتقال دادهها بدون تحمیل بار بر CPU میزبان. این جستجو آنها را به ارزیابی کارت شبکه سرور Mellanox (NVIDIA Mellanox) MCX653105A-HDAT سوق داد.
این آزمایشگاه MCX653105A-HDAT را در 24 گره محاسباتی مستقر کرد که هر کدام مجهز به اتصال دو پورت 100 گیگابیت اترنت بودند. به عنوان یک کارت شبکه PCIe آداپتور کارت شبکه PCIe آداپتور MCX653105A-HDAT ConnectX بومی، از RoCE (RDMA over Converged Ethernet) با تخلیه سختافزاری پشتیبانی میکند و به دادهها اجازه میدهد تا از هسته عبور کرده و مستقیماً بین نواحی حافظه حرکت کنند. فرآیند پیکربندی ساده بود: پس از تأیید سرورهای سازگار با MCX653105A-HDAT(Supermicro و Dell PowerEdge)، مهندسان آخرین درایورهای MLNX_OFED را نصب کرده و RoCE را با کنترل ازدحام DCQCN فعال کردند. کارت آداپتور اترنت MCX653105A-HDAT بلافاصله پردازش شبکه را از CPU تخلیه کرد و سربار نرمافزار را به نزدیک صفر کاهش داد.
برای ترافیک ذخیرهسازی، تیم فضاهای نام NVMe را مستقیماً روی RDMA نگاشت کردند. NVIDIA Mellanox MCX653105A-HDAT انتقال دادهها را با تأخیر کمتر از یک میکروثانیه مدیریت کرد، در حالی که هدایت مبتنی بر سختافزار، جداسازی بین جریانهای محاسباتی و ذخیرهسازی را تضمین کرد. طبق برگه داده MCX653105A-HDAT، آداپتور از توان عملیاتی تجمعی تا 200 گیگابیت بر ثانیه پشتیبانی میکند - و در عمل، این آزمایشگاه به سرعت خطی 100 گیگابیت اترنت در هر پورت بدون حتی یک بسته از دست رفته تحت بار کامل دست یافت.
- کاهش 50 درصدی در تأخیر سرتاسری: تستهای پینگ پونگ MPI از 2.8 میکروثانیه (TCP) به 1.4 میکروثانیه (RoCE) کاهش یافت.
- استفاده از CPU 70 درصد کاهش یافت: پردازش پشته شبکه کاملاً به سختافزار منتقل شد و هستهها را برای آموزش مدل آزاد کرد.
- IOPS ذخیرهسازی دو برابر شد: NVMe-oF روی RDMA پل نرمافزاری را حذف کرد و تأخیر را برای دسترسیهای بلوک کوچک به زیر 10 میکروثانیه رساند.
این تیم همچنین مشخصات MCX653105A-HDAT را در برابر محیط تولید خود تأیید کرد: رابط PCIe 4.0 x16، طراحی حرارتی دو اسلاته و پشتیبانی کامل از اعلانهای ازدحام RoCE. برای برنامهریزی ظرفیت، آنها قیمت MCX653105A-HDAT را در مقابل کل هزینه مالکیت بررسی کردند - آداپتور در عرض سه ماه با کاهش پراکندگی سرور و بهبود تراکم بار کاری، هزینه خود را جبران کرد. هنگام جستجو برای MCX653105A-HDAT برای فروش از طریق توزیعکنندگان مجاز، آنها چندین گزینه پیکربندی (تک پورت، دو پورت، با یا بدون بوت امن) پیدا کردند.
| معیار | قبل (TCP) | بعد (MCX653105A-HDAT / RoCE) | بهبود |
|---|---|---|---|
| تأخیر پینگ پونگ MPI | 2.8 میکروثانیه | 1.4 میکروثانیه | -50% |
| استفاده از CPU (پشته شبکه) | ~30% (8 هسته) | ~5% (تخلیه شده سختافزاری) | -83% |
| NVMe-oF IOPS بلوک کوچک | 320 هزار | 680 هزار | +112% |
این استقرار تأیید میکند که NVIDIA Mellanox MCX653105A-HDAT بیش از یک کارت شبکه پرسرعت است - این یک پلتفرم کامل شتابدهنده داده است. با انتقال پردازش شبکه به سختافزار و فعال کردن RDMA/RoCE واقعی، سازمانها میتوانند بدون ارتقاء اساسی، از شبکهبندی محدود به CPU رها شوند. چه در حال اجرای آموزش هوش مصنوعی، پایگاههای داده توزیع شده، یا ذخیرهسازی فوق همگرا باشید، کارت شبکه PCIe آداپتور MCX653105A-HDAT ConnectX تأخیر کم قطعی و حداکثر توان عملیاتی را ارائه میدهد. برای تیمهایی که قصد دارند زیرساخت خود را مجدداً بهروزرسانی کنند، بررسی برگه داده MCX653105A-HDAT و مشخصات MCX653105A-HDAT اولین قدم منطقی است. این آداپتور به طور گسترده MCX653105A-HDAT برای فروش از طریق توزیعکنندگان جهانی موجود است و سازگاری با پلتفرمهای سرور پیشرو، مسیر مهاجرت هموار را تضمین میکند. همانطور که یکی از مهندسان خلاصه کرد: "کارت آداپتور اترنت MCX653105A-HDAT، شبکه 100 گیگابیت اترنت ما را از یک گلوگاه به یک ضربکننده عملکرد تبدیل کرد."

