مقاله فنی آداپتور سرور NVIDIA Mellanox MCX556A-ECAT | انتقال با تأخیر کم RDMA/RoCE و توان عملیاتی سرور
July 23, 2026
NVIDIA Mellanox MCX556A-ECAT آداپتور سرور کتاب سفید فنی.
1. پیش زمینه پروژه و تجزیه و تحلیل نیازهای
مراکز داده های مدرن در حال تغییر اساسی هستند که توسط هوش مصنوعی، محاسبات با عملکرد بالا (HPC) و تجزیه و تحلیل در زمان واقعی هدایت می شوند.این بارهای کاری نیاز به عملکرد بی سابقه ای از شبکه دارند نه فقط پهنای باند خامآداپتورهای سنتی اترنت، که به استیک های مبتنی بر نرم افزار TCP / IP متکی هستند، به یک تنگنای قابل توجهی تبدیل شده اند.مصرف 20٪ تا 30٪ از هسته های CPU و ایجاد تغییرات تاخیر غیر قابل پیش بینی که عملکرد برنامه را کاهش می دهدبرای سازمان هایی که در مقیاس بزرگ فعالیت می کنند، این ناکارآمدی به طور مستقیم به هزینه های زیرساخت بالاتر و زمان آهسته تری برای بینش تبدیل می شود.
این کتاب سفید یک راه حل فنی جامع را ارائه می دهد که در مرکز آنNVIDIA Mellanox MCX556A-ECATبرای شرکت هایی که به دنبال حداکثر رساندن بازده سرمایه گذاری های 100GbE خود هستند، طراحی شده است.کارت آداپتور اترنت MCX556A-ECATارائه RDMA شتاب دهنده سخت افزاری از طریق اترنت همگرا (RoCE) ، امکان حمل و نقل بدون ضرر و با تاخیر کم را فراهم می کند که I / O شبکه را از یک بدهی به یک دارایی استراتژیک تبدیل می کند.راه حل به طور خاص برای رسیدن به سه هدف اصلی طراحی شده است: (1) دستیابی به تاخیر برنامه های کاربردی زیر 10μs، (2) کاهش هزینه پردازش شبکه CPU به کمتر از 5٪، و (3) ارائه یک پایه مقیاس پذیر و آینده برای 100GbE و فراتر از آن.
2طراحی معماری شبکه و سیستم
معماری توصیه شده یک توپولوژی عملکرد بالا با 100GbE به عنوان لایه دسترسی سرور و 400GbE به ستون فقرات را اتخاذ می کند. در هسته این طراحی،کارت شبکه PCIe MCX556A-ECAT ConnectX، در هر گره محاسباتی و ذخیره سازی در سراسر بافت مستقر شده است. معماری در اطراف پنج اصل کلیدی ساخته شده است:
- پارچه ایثرنت بدون ضرر:استفاده از RoCE v2 با PFC (کنترول جریان اولویت) و ECN (اطلاعات واضح ازدحام) در تمام سوئیچ ها برای از بین بردن قطرات بسته و اطمینان از تاخیر تعیین کننده برای ترافیک RDMA.
- هاردوئر هرجا که هست خارج میشه:تخلیه پردازش لایه حمل و نقل شامل تخلیه چک سوم، بخش بندی (LSO / LRO) ، برچسب گذاری VLAN و RDMA به آداپتور، آزاد کردن چرخه های CPU برای منطق برنامه.
- افزونه فعال فعال:استفاده از هر دو پورت QSFP28 در حالت جمع آوری لینک (LACP) برای پهنای باند 200Gb / s و تغییر خطا خودکار با بازیابی زیر ثانیه.
- بخش بندی ترافیک:کلاس های ترافیک اختصاصی برای ذخیره سازی (NVMe-oF) ، محاسبات (MPI / RDMA) و ترافیک مدیریت، اطمینان از کیفیت پیش بینی شده در تمام بارهای کاری.
- سطح کنترل قابل اندازه گیری:مدیریت متمرکز از طریق سوئیچ های NVIDIA Spectrum با تله متری داخلی و اتوماسیون از طریق API های REST و کتاب های بازی Ansible.
راه حل کاملاًسازگاری با MCX556A-ECATبا سیستم عامل های سرور پیشرو (Dell PowerEdge، HPE ProLiant، Supermicro، Lenovo) و یکپارچه با سیستم عامل های اصلی (لینوکس، ویندوز سرور، VMware ESXi) ادغام می شود.معماری از NVMe-oF در RoCE پشتیبانی می کند، امکان ذخیره سازی به اشتراک گذاشته شده با تاخیر نزدیک به درایوهای NVMe محلی را فراهم می کند.
3نقش و ویژگی های اصلی NVIDIA Mellanox MCX556A-ECAT
به عنوان جزء اساسی این راه حل،NVIDIA Mellanox MCX556A-ECATسه نقش مهم در معماری دارد:
| عملکرد | جزئیات اجرای | سود تجاری |
|---|---|---|
| موتور RDMA/RoCE | RoCE v2 مبتنی بر سخت افزار با پشتیبانی ECN/PFC، تاخیر کمتر از 0.8μs | مشارکت CPU نزدیک به صفر برای حرکت داده ها؛ عملکرد تعیین کننده |
| دو پورت 100GbE | دو پورت مستقل QSFP28، 200Gb / s مجموعی | اتصال فعال-فعال برای پهنای باند؛ آماده سازی فعال برای افزوده شدن |
| مجازی سازی و بارگذاری پوشش | SR-IOV با حداکثر 128 VF در هر پورت؛ تخلیه سخت افزار VXLAN/NVGRE | اجاره های چند نفره با تراکم بالا با عملکرد و عایق بندی خط |
مشخصات فنی کلیدیورق اطلاعات MCX556A-ECATشامل پی سی ای ای 3.0/4.0 x16 است، قابلیت های فراگیر تخلیه (Checksum، LSO/LRO، VLAN stripping/insertion، RSS) و تله متری پیشرفته در هر پورت.بهره وری انرژی آداپتور (معمولاً کمتر از 15 وات) و پشتیبانی گسترده از سیستم عامل آن را به یک بلوک ساختاری متنوع برای محیط های ناهمگن تبدیل می کند.مشخصات MCX556A-ECATهمچنین حمایت از سازگاری 25GbE و 40GbE را برجسته می کند، انعطاف پذیری پیاده سازی را برای محیط های سرعت مخلوط ارائه می دهد.
4توصیه های تعبیه و مقیاس بندی
برای پیاده سازی های سبز، ما یک توپولوژی دو طبقه ای با دسترسی 100GbE و لینک های بالا 400GbE را توصیه می کنیم. هر سرور یک میزبانکارت آداپتور اترنت MCX556A-ECATبا هر دو پورت QSFP28 به سوئیچ های برگ جداگانه برای افزوده شدن متصل شده است. پارچه RoCE نیاز به پیکربندی QoS سازگار در تمام سوئیچ ها دارد به طور خاص،PFC در مورد اولویت 3 (برای ترافیک RDMA) و اولویت 4 (برای ذخیره سازی)ما توصیه می کنیم VLAN های اختصاصی را برای ترافیک RoCE، مدیریت و ذخیره سازی اختصاص دهیم تا نظارت و عیب یابی را ساده تر کنیم.
برای محیط های brownfield با زیرساخت های موجود 40GbE،MCX556A-ECAT راه حل کارت آداپتور اترنتبه دلیل اینکه آداپتور با 40GbE QSFP + سازگار است، کابل های موجود می توانند در طول ارتقاء مرحله ای به 100GbE مورد استفاده مجدد قرار گیرند.آداپتور همچنین از سوئیچینگ استاندارد اترنت بدون فعال کردن اجباری RoCE پشتیبانی می کند، به تیم ها اجازه می دهد تا ابتدا سخت افزار را مستقر کنند و قابلیت های RDMA را به صورت مرحله ای فعال کنند زیرا پارچه بالغ می شود و بار کاری انتقال را توجیه می کند.
مقیاس گذاری راه حل فراتر از 50 گره، ملاحظات اضافی را معرفی می کند.ما توصیه می کنیم اجرای یک استراتژی مدیریت انبساط RoCE اختصاصی با استفاده از سوئیچ های طیف NVIDIA با تله متری داخلی و تنظیم آستانه ECN پویابرای خوشه های بیش از 200 گره، در نظر گرفتن استقرار یک کنترل کننده مدیریت پارچه متمرکز (به عنوان مثال، NVIDIA Cumulus NetQ) برای حفظ دید از انتهای تا انتهای و سازگاری پیکربندی خودکار.درMCX556A-ECAT برای فروشاز طریق شرکای کانال جهانی NVIDIA شامل تضمین جامع و پشتیبانی از به روز رسانی نرم افزار است که اطمینان از قابلیت اطمینان طولانی مدت در مقیاس است.
5. عملیات، نظارت، رفع مشکل و بهینه سازی
عملکرد موثر پارچه RoCE نیاز به یک استراتژی چند لایه نظارت و رفع مشکل دارد:
- تليمتري در سطح آداپتور:درمشخصات MCX556A-ECATشامل شمارنده های هر پورت برای فریم های PFC، بسته های نشان داده شده ECN، فریم های رها شده و خطاهای پیوند است.
mlx5cmd,اتیول، یا ابزارهای نرم افزار NVIDIA برای صادر کردن این معیارهای به داشبورد های Prometheus / Grafana. - نظارت بر سطح سوئیچ:اشغال بافر، تعداد فریم های توقف، عمق صف، و نرخ های ECN را روی سوئیچ های ستون فقرات و برگ ها نظارت کنید.افزایش ناگهانی در فریم های توقف نشان دهنده فشارهای کوچک است که ممکن است نیاز به تنظیم آستانه ECN داشته باشد..
- معیارهای سطح برنامه:برای برنامه های RDMA، تاخیر های تکمیل WR (Work Request) ، رویدادهای سرریز CQ (Completion Queue) و شمارش خطای QP (Queue Pair) با استفاده از کتابخانه های NVIDIA libibverbs و rdma-core را پیگیری کنید.
سناریوهای رایج رفع مشکل و اقدامات توصیه شده آنها:
- کاهش عملکرد RoCE:بررسی کنید که PFC در تمام پورت های سوئیچ فعال است و اینکه علامت DSCP با پیکربندی سوئیچ مطابقت دارد.ورق اطلاعات MCX556A-ECATبرای تایید تنظیمات تخصیص بافر با مقادیر توصیه شده برای پروفایل بار کار شما.
- خطای ضربه زدن یا CRC:کیفیت کابل QSFP28 را بررسی کنید و اطمینان حاصل کنید که نرم افزار آداپتور به آخرین نسخه آپدیت شده است. اطمینان حاصل کنید که کابل ها با مشخصات IEEE 802.3bj برای 100GBASE-SR4 یا LR4 مطابقت دارند.
- CPU با وجود تخليه هنوز بالاست:تأیید کنید که RDMA در واقع مورد استفاده قرار می گیرد (به TCP باز نمی گردد) با بررسی شمارنده های درایور، گزارش های برنامه و وضعیت اتصال.
- PFC deadlock یا توقف طوفان:برای اولویت های اشتباه تنظیم شده بررسی کنید و اطمینان حاصل کنید که PFC فقط در کلاس های ترافیک RoCE فعال است (نه در ترافیک مدیریت یا ذخیره سازی).
برای بهینه سازی، ما پارامترهای تنظیم زیر را بر اساس تأیید آزمایشگاهی گسترده توصیه می کنیم:
- قطع همبستگی (توسط):برای بارهای کاری مخلوط (تجاری + ذخیره سازی) برای تعادل تاخیر و بهره وری CPU به 4 ¢ 8 μs تنظیم شود.
- واحد RDMA:افزایش به 4096 بایت برای بار کاری ذخیره سازی برای کاهش پروتکل و بهبود خروجی.
- آر اس اس (توسعه سمت دریافت):پیکربندی در میان چندین هسته CPU برای ترافیک غیر RDMA برای توزیع پردازش و جلوگیری از اشباع تک هسته ای.
- آستانه های ECN:برای ترافیک اولویت 3 حداقل حد 50٪ از بافر و حداکثر حد 80٪ را تنظیم کنید و بر اساس الگوهای انسداد مشاهده شده تنظیم کنید.
6خلاصه و ارزیابی ارزش
درNVIDIA Mellanox MCX556A-ECATبا جایگزین کردن TCP/IP مبتنی بر نرم افزار با RDMA/RoCE شتاب دهنده سخت افزاری،سازمان ها می توانند کاهش تاخیر در سطح برنامه را 5 × 10 برابر کنند، کاهش شبکه CPU بیش از 80٪ و افزایش تراکم مخزن سرور 30٪ تا 50٪.کارت آداپتور اترنت MCX556A-ECATیک مسیر مقرون به صرفه را برای پذیرش 100GbE با حفاظت از سرمایه گذاری از طریق سازگاری عقب به 40GbE و قابلیت های آماده برای آینده برای بار های کاری در حال ظهور فراهم می کند.
در ارزیابی کل هزینه مالکیت،قیمت MCX556A-ECATبا صرفه جویی های عملیاتی قابل توجهی جبران می شود: کاهش تعداد سرورها (به دلیل استفاده بیشتر) ، کاهش هزینه های خنک کننده (به لطف مصرف <15W) ،و حذف پارچه های جداگانه InfiniBand یا RDMA اختصاصیراه حل کاملاًسازگاری با MCX556A-ECATبا اکوسیستم های بزرگ منبع باز و سازمانی، از جمله Kubernetes، Apache Spark، TensorFlow و VMware vSphere، اطمینان از کاربرد گسترده در میان شرکت ها، HPC و استخر های بومی ابر.
برای اسکریپت های کاربردی دقیق، قالب های پیکربندی و گزارش های معیار عملکرد، لطفا به دفتر رسمی مراجعه کنیدورق اطلاعات MCX556A-ECATاین کتاب سفید به عنوان پایه ای برای تایید معماری، اجزای آماده تولید،و سودها قابل اندازه گیری هستند.کارت شبکه PCIe MCX556A-ECAT ConnectXاین فقط یک آداپتور نیست؛ این یک عامل استراتژیک برای مرکز داده RDMA آماده و بهینه سازی شده در آینده است.

