NVIDIA Mellanox MCX4121A-ACAT Server Adapter کتاب سفید فنی.
July 22, 2026
NVIDIA Mellanox MCX4121A-ACAT آداپتور سرور کتاب سفید فنی
1. پیش زمینه پروژه و تجزیه و تحلیل نیازهای
مراکز داده های مدرن تحت فشار مداوم برای پشتیبانی از بار های کاری به طور فزاینده ای از آموزش AI / ML و تجارت فرکانس بالا به پایگاه های داده توزیع شده و ذخیره سازی NVMe-over-Fabrics هستند.در حالی که 25GbE اترنت به استاندارد اصلی لایه دسترسی تبدیل شده استبسیاری از سازمان ها متوجه می شوند که پهنای باند خام به تنهایی به عملکرد برنامه ترجمه نمی شود. گلوی اساسی در استیک سنتی TCP / IP قرار دارد:تاخیر غیر قابل پیش بینیبرای برنامه های کاربردی حساس به تاخیر و گرسنه به خروجی، زیرسیستم شبکه اغلب ضعیف ترین حلقه می شود.
این کتاب سفید این چالش ها را از طریق یک راه حل جامع متمرکز برNVIDIA Mellanox MCX4121A-ACATبرای شرکت هایی طراحی شده است که به دنبال باز کردن تمام پتانسیل زیرساخت های 25GbE هستند.کارت آداپتور اترنت MCX4121A-ACATترکیب اتصال دو پورت 25GbE با RDMA شتاب دهنده سخت افزاری بر روی اترنت همگرا (RoCE). راه حل سه هدف اصلی را هدف قرار می دهد: (1) کاهش تاخیر در سطح برنامه به زیر 10μs،(2) کاهش هزینه پردازش شبکه CPU بیش از 80٪، و (3) امکان مقیاس پذیری بی نقص از چند گره به صدها بدون بازسازی معماری.
2طراحی معماری شبکه و سیستم
معماری توصیه شده یک توپولوژی برگ ستون فقرات را با 25GbE به عنوان لایه دسترسی به سرور و 100GbE به ستون فقرات اتخاذ می کند. در قلب طراحیMCX4121A-ACAT ConnectX-4 Lx دو پورت 25GbE SFP28آداپتور، در هر گره محاسباتی و ذخیره سازی مستقر شده است. معماری در اطراف سه اصل اصلی ساخته شده است:
- پارچه ایثرنت بدون ضرر:استفاده از RoCE v2 با PFC (کنترول جریان اولویت) و ECN (اطلاعات واضح ازدحام) برای حذف قطرات بسته و اطمینان از تاخیر تعیین کننده.
- هاردوئر هرجا که هست خارج میشه:بارگذاری پردازش لایه حمل و نقل از جمله چک سوم، بخش بندی و RDMA به آداپتور، آزاد کردن چرخه های CPU برای برنامه های تجاری.
- افزونه فعال فعال:استفاده از هر دو پورت SFP28 در حالت جمع آوری لینک (LACP) برای پهنای باند جمع 50Gb / s و تغییر خطا خودکار.
راه حل کاملاًسازگاری با MCX4121A-ACATبا سیستم عامل های سرور پیشرو (Dell PowerEdge، HPE ProLiant، Supermicro) و سوئیچ های NVIDIA Spectrum و Arista. برای ذخیره سازی، معماری از NVMe-oF بر روی RoCE پشتیبانی می کند،امکان ذخیره سازی به اشتراک گذاشته شده با تاخیر نزدیک به درایوهای NVMe محلی.
3نقش و ویژگی های اصلی NVIDIA Mellanox MCX4121A-ACAT
به عنوان جزء اساسی این راه حل،NVIDIA Mellanox MCX4121A-ACATسه کار مهم انجام می دهد:
| عملکرد | جزئیات اجرای | سود تجاری |
|---|---|---|
| موتور RDMA/RoCE | RoCE v2 مبتنی بر سخت افزار با پشتیبانی ECN/PFC، تاخیر کمتر از 1μs | مشارکت CPU نزدیک به صفر برای حرکت داده ها |
| دو پورت 25GbE | دو پورت مستقل SFP28، 50Gb / s مجموعی | اتصال فعال به فعال یا افزونه فعال به حالت آماده |
| مجازی سازی و بارگذاری پوشش | SR-IOV با حداکثر 128 VF در هر پورت؛ VXLAN/NVGRE offload | اجاره های چندگانه با تراکم بالا با عملکرد نرخ خط |
مشخصات کلیدیورق اطلاعات MCX4121A-ACATشامل پی سی ای ای 3.0 x8 میزبان رابط، offloads جامع (Checksum، LSO/LRO، VLAN striping/insertion) و پیشرفته دوربین سنجی در هر پورت است.بهره وری انرژی آداپتور (< 10W معمولی) و پشتیبانی گسترده از سیستم عامل (لینوکس)، ویندوز، VMware ESXi) آن را یک بلوک ساختاری متنوع برای محیط های ناهمگن می کند.
4توصیه های تعبیه و مقیاس بندی
برای استقرار های سبز، ما یک توپولوژی دو طبقه ای با دسترسی 25GbE و لینک های بالا 100GbE / 400GbE را توصیه می کنیم. هر سرور یک میزبان است.کارت آداپتور اترنت MCX4121A-ACATبا هر دو پورت متصل به سوئیچ های برگ جداگانه برای افزوده شدن. پارچه RoCE نیاز به پیکربندی QoS سازگار در سراسر تمام سوئیچ ها دارد.PFC در اولویت 3 و نشان ECN در همان کلاس ترافیکما توصیه می کنیم که یک VLAN اختصاصی برای ترافیک RoCE برای ساده سازی نظارت و رفع مشکل اختصاص داده شود.
برای محیط های قهوه ای،MCX4121A-ACAT راه حل کارت آداپتور اترنتبه دلیل اینکه آداپتور با 10GbE SFP + سازگار است، کابل های موجود می توانند در طول ارتقاء مرحله ای به 25GbE مورد استفاده قرار گیرند.آداپتور همچنین از سوئیچینگ استاندارد اترنت بدون فعال کردن اجباری RoCE پشتیبانی می کند، اجازه می دهد تا تیم ها ابتدا سخت افزار را مستقر کنند و قابلیت های RDMA را در مراحل بالغ شدن پارچه فعال کنند.
مقیاس بندی راه حل ساده است: گره های اضافی به سادگی با همانMCX4121A-ACAT برای فروشSKU، و بافت به طور خودکار نقاط پایانی جدید را از طریق مذاکره LLDP و DCBx پذیرفته است.ما توصیه می کنیم که یک کنترل کننده اختصاصی مدیریت ازدحام RoCE (e) استفاده شود..به عنوان مثال، NVIDIA اسپکترم سوئیچ با تله متری داخلی) برای حفظ رفتار بدون ضرر در مقیاس.
5. عملیات، نظارت، رفع مشکل و بهینه سازی
عملکرد موثر پارچه RoCE نیاز به یک استراتژی نظارت چند لایه دارد:
- تليمتري در سطح آداپتور:درمشخصات MCX4121A-ACATشامل شمارنده های هر پورت برای فریم های PFC، بسته های ECN و فریم های رها شده است.
mlx5cmdیا ابزارهای نرم افزار NVIDIA برای صادر کردن آنها به Prometheus / Grafana. - نظارت بر سطح سوئیچ:اشغال بافر، تعداد فریم های وقفه و عمق صف در سوئیچ های ستون فقرات و برگ را نظارت کنید. افزایش ناگهانی فریم های وقفه نشان دهنده فشارهای کوچک است که ممکن است نیاز به تنظیم آستانه ECN داشته باشد.
- معیارهای سطح برنامه:برای برنامه های RDMA، تاخیر های تکمیل WR (Work Request) و حوادث سرریز CQ (Completion Queue) را با استفاده از کتابخانه های ارائه شده توسط فروشنده ردیابی کنید.
سناریوهای رایج رفع مشکل عبارتند از:
- کاهش عملکرد RoCE:بررسی کنید که PFC در تمام پورت های سوئیچ فعال است و اینکه علامت DSCP با پیکربندی سوئیچ مطابقت دارد.ورق اطلاعات MCX4121A-ACATبرای تایید تنظیمات تخصیص بافر
- خطای ضربه زدن یا CRC:کیفیت کابل SFP28 را بررسی کنید و اطمینان حاصل کنید که نرم افزار آداپتور به آخرین نسخه آپدیت شده است.
- CPU با وجود تخليه هنوز بالاست:تأیید کنید که RDMA در واقع مورد استفاده قرار می گیرد (به TCP باز نمی گردد) با بررسی شمارنده های درایور و گزارش های برنامه.
برای بهینه سازی، ما پارامترهای تنظیم زیر را توصیه می کنیم (که از اعتبار سنجش آزمایشگاهی گسترده گرفته شده است): - Set interrupt coalescing (moderation) to 4 µs for mixed workloads - Enable hardware timestamping for precise latency measurement - Configure RSS (Receive Side Scaling) across multiple CPU cores for non-RDMA traffic - For storage workloads، افزایش حداکثر RDMA MTU به 4096 بایت برای کاهش پروتکل بالا
6خلاصه و ارزیابی ارزش
درNVIDIA Mellanox MCX4121A-ACATبا جایگزینی TCP/IP با RDMA/RoCE، سازمان ها می توانند کاهش تاخیر در سطح برنامه را 5×10 برابر کنند.کاهش CPU شبکه بیش از 80٪، و افزایش تراکم کانتینر سرور با 30٪ 50٪.کارت آداپتور اترنت MCX4121A-ACATیک مسیر مقرون به صرفه برای پذیرش 25GbE با حفاظت از سرمایه گذاری از طریق سازگاری عقب و قابلیت های تخلیه آماده آینده را فراهم می کند.
در ارزیابی کل هزینه مالکیت،قیمت MCX4121A-ACATبا صرفه جویی های عملیاتی قابل توجهی جبران می شود: کاهش تعداد سرورها (به دلیل استفاده بیشتر) ، کاهش هزینه های خنک کننده (به لطف مصرف برق <10W) ،و حذف پارچه های جداگانه InfiniBand یا پارچه های اختصاصیراه حل کاملاًسازگاری با MCX4121A-ACATبا اکوسیستم های اصلی منبع باز، از جمله Kubernetes، Apache Spark و TensorFlow، اطمینان از کاربرد گسترده در سراسر شرکت ها و استخر های بومی ابر.
برای اسکریپت های کاربردی دقیق، قالب های پیکربندی و گزارش های معیار عملکرد، لطفا به دفتر رسمی مراجعه کنیدورق اطلاعات MCX4121A-ACATاین کتاب سفید به عنوان یک نقطه شروع برای تایید معماری، اجزای آماده تولید و مزایای قابل اندازه گیری است.MCX4121A-ACAT ConnectX-4 Lx دو پورت 25GbE SFP28این فقط یک آداپتور نیست؛ این یک عامل استراتژیک برای مرکز داده های RDMA آماده و بهینه سازی شده در آینده است.

