کتاب سفید فنی NVIDIA Mellanox MCX623106AN-CDAT Server Adapter
July 24, 2026
مقاله فنی آداپتور سرور NVIDIA Mellanox MCX623106AN-CDAT | بهینهسازی انتقال با تأخیر کم RDMA/RoCE و توان عملیاتی سرور
1. پیشزمینه پروژه و تحلیل الزامات
مراکز داده مدرن به دلیل رشد انفجاری هوش مصنوعی، یادگیری ماشین در مقیاس بزرگ و تجزیه و تحلیل بلادرنگ، شاهد یک تغییر پارادایم هستند. این بار کاری نیازمند عملکرد شبکه بیسابقه است — نه فقط پهنای باند خام، بلکه تأخیر قطعی زیر 5 میکروثانیه، انتقال داده کارآمد از نظر CPU و مقیاسپذیری بینقص به هزاران گره. آداپتورهای اترنت سنتی که به پشتههای TCP/IP مبتنی بر نرمافزار متکی هستند، به یک گلوگاه حیاتی تبدیل شدهاند و تا 40 درصد از هستههای CPU را در سرعتهای 200 گیگابیت بر ثانیه مصرف میکنند و تغییرات تأخیر غیرقابل پیشبینی را معرفی میکنند که عملکرد برنامه را کاهش میدهد. برای سازمانهایی که خوشههای هوش مصنوعی در مقیاس بزرگ (500+ GPU) یا زیرساخت ابری هایپرسکیل میسازند، این ناکارآمدی مستقیماً به زمانهای آموزش طولانیتر، هزینههای زیرساخت بالاتر و زمان ورود به بازار کندتر ترجمه میشود.
این مقاله فنی یک راهحل فنی جامع را با محوریت آداپتور سرور NVIDIA Mellanox MCX623106AN-CDAT ارائه میدهد. آداپتور اترنت کارت آداپتور اترنت MCX623106AN-CDAT که برای شرکتهایی طراحی شده است که به دنبال حداکثر کردن سرمایهگذاریهای 200 گیگابیت بر ثانیه خود هستند، RDMA شتابدهنده سختافزاری را بر روی اترنت همگرا (RoCE) ارائه میدهد و انتقال بدون اتلاف و با تأخیر فوقالعاده کم را امکانپذیر میسازد که ورودی/خروجی شبکه را از یک گلوگاه مقیاسپذیری به یک مزیت رقابتی تبدیل میکند. این راهحل به طور خاص برای دستیابی به سه هدف اصلی طراحی شده است: (1) دستیابی به تأخیر برنامه سرتاسری زیر 5 میکروثانیه برای ارتباطات جمعی هوش مصنوعی، (2) کاهش سربار پردازش شبکه CPU به کمتر از 5 درصد، و (3) فراهم کردن یک پایه مقیاسپذیر و آیندهنگر برای 200 گیگابیت بر ثانیه و فراتر از آن.
2. طراحی کلی معماری شبکه و سیستم
معماری پیشنهادی از توپولوژی برگ-اسپاین با کارایی بالا با استفاده از 200 گیگابیت بر ثانیه به عنوان لایه دسترسی سرور و لینکهای بالادستی 400 گیگابیت بر ثانیه/800 گیگابیت بر ثانیه به اسپاین استفاده میکند. در هسته این طراحی، کارت شبکه PCIe آداپتور صرفاً یک آداپتور نیست؛ بلکه یک توانمندساز استراتژیک برای مرکز داده آینده آماده هوش مصنوعی با تأخیر فوقالعاده کم است. قرار دارد که در هر گره محاسباتی و ذخیرهسازی در سراسر فابریک مستقر شده است. این معماری بر اساس شش اصل کلیدی ساخته شده است:
- فابریک اترنت بدون اتلاف: استفاده از RoCE v2 با PFC (کنترل جریان اولویت) و ECN (اعلان ازدحام صریح) در تمام سوئیچها برای حذف افت بستهها و اطمینان از تأخیر قطعی برای ترافیک RDMA.
- GPUDirect RDMA: امکان ارتباط مستقیم GPU به GPU در سراسر شبکه بدون دخالت CPU را فراهم میکند، تأخیر را کاهش میدهد و منابع CPU را برای وظایف محاسباتی آزاد میکند.
- خارج کردن سختافزار در همه جا: خارج کردن پروتکلهای انتقال، امنیتی (IPsec/MACsec) و ذخیرهسازی به آداپتور، چرخههای CPU را برای منطق برنامه آزاد میکند.
- افزونگی فعال-فعال: استفاده از هر دو پورت QSFP112 در حالت تجمیع لینک (LACP) برای پهنای باند تجمعی 400 گیگابیت بر ثانیه و جایگزینی خودکار در صورت خرابی با بازیابی زیر ثانیه.
- مهندسی ترافیک هوشمند: مسیریابی تطبیقی و تحویل بستههای خارج از ترتیب برای جلوگیری از نقاط داغ ازدحام و حداکثر کردن استفاده از فابریک.
- تلهمتری جامع: تلهمتری درونباند شبکه (INT) و نظارت بر هر جریان برای تشخیص ازدحام پیشگیرانه و برنامهریزی ظرفیت.
این راهحل کاملاً سازگاری MCX623106AN-CDAT با پلتفرمهای GPU NVIDIA (HGX، DGX) و سرورهای CPU پیشرو از Dell، HPE، Supermicro و Lenovo است. برای ذخیرهسازی، این معماری از NVMe-oF بر روی RoCE با تأخیر زیر 15 میکروثانیه پشتیبانی میکند و امکان ذخیرهسازی مجزا و مشترک را برای خوشههای آموزشی در مقیاس بزرگ فراهم میکند.
3. نقش و ویژگیهای کلیدی NVIDIA Mellanox MCX623106AN-CDAT
به عنوان جزء بنیادی این راهحل، NVIDIA Mellanox MCX623106AN-CDAT چهار نقش حیاتی را در معماری ایفا میکند:
| عملکرد | جزئیات پیادهسازی | مزیت تجاری |
|---|---|---|
| موتور RDMA/RoCE | RoCE v2 مبتنی بر سختافزار با ECN/PFC، تأخیر زیر 0.6 میکروثانیه، پشتیبانی GPUDirect | مشارکت تقریباً صفر CPU؛ 8 برابر سریعتر all-reduce برای آموزش هوش مصنوعی |
| 200 گیگابیت بر ثانیه دو پورت | دو پورت مستقل QSFP112، توان عملیاتی تجمعی 400 گیگابیت بر ثانیه | اتصال فعال-فعال برای پهنای باند؛ فعال-آمادهباش برای افزونگی |
| رابط PCIe 5.0 | PCIe 5.0 x16 (تا 32 GT/s) با موتور DMA پیشرفته | گلوگاه رابط میزبان را برای ترافیک 200 گیگابیت بر ثانیه حذف میکند |
| خارج کردن مجازیسازی و پوشش | SR-IOV با حداکثر 512 VF در هر پورت؛ خارج کردن VXLAN/NVGRE/IPsec/MACsec | چند مستأجری با تراکم بالا با امنیت و عملکرد خطی |
مشخصات فنی کلیدی استخراج شده از و پورتال جامع مستندات شبکه NVIDIA مراجعه کنید. این مقاله فنی به عنوان یک پایه عمل میکند — معماری اعتبارسنجی شده است، اجزا آماده تولید هستند و مزایا قابل اندازهگیری هستند. شامل قابلیتهای خارج کردن جامع (چکسام، LSO/LRO، حذف/درج VLAN، RSS با حداکثر 128 صف)، الگوریتمهای پیشرفته کنترل ازدحام و پشتیبانی کامل از کتابخانههای ارتباطات جمعی NVIDIA (NCCL) است. مشخصات MCX623106AN-CDAT همچنین پشتیبانی از سازگاری 100 گیگابیت بر ثانیه و 50 گیگابیت بر ثانیه را برجسته میکند و انعطافپذیری استقرار را برای محیطهای با سرعت مختلط ارائه میدهد.
4. توصیههای استقرار و مقیاسپذیری
برای خوشههای هوش مصنوعی جدید، ما یک توپولوژی دو لایه برگ-اسپاین با دسترسی 200 گیگابیت بر ثانیه و لینکهای بالادستی 800 گیگابیت بر ثانیه را توصیه میکنیم. هر سرور میزبان یک کارت آداپتور اترنت MCX623106AN-CDAT است که هر دو پورت QSFP112 آن برای افزونگی به سوئیچهای برگ جداگانه متصل میشوند. فابریک RoCE نیازمند پیکربندی QoS سازگار در تمام سوئیچها است — به طور خاص، PFC در اولویت 3 (برای ترافیک جمعی RDMA) و اولویت 4 (برای ذخیرهسازی)، با علامتگذاری ECN در همان کلاسهای ترافیکی. ما توصیه میکنیم VLANهای جداگانه را برای ترافیک RDMA، مدیریت، ذخیرهسازی و مستأجر برای سادهسازی نظارت و عیبیابی اختصاص دهید.
برای محیطهای موجود با زیرساخت 100 گیگابیت بر ثانیه موجود، راهحل کارت آداپتور اترنت MCX623106AN-CDAT یک مسیر مهاجرت آرام را ارائه میدهد. از آنجایی که آداپتور با اپتیکهای 100 گیگابیت بر ثانیه QSFP56 سازگار است، کابلکشی موجود را میتوان در طول ارتقاء مرحلهای به 200 گیگابیت بر ثانیه مجدداً استفاده کرد. این آداپتور همچنین از سوئیچینگ اترنت استاندارد بدون فعالسازی اجباری RoCE پشتیبانی میکند و به تیمها اجازه میدهد ابتدا سختافزار را مستقر کنند و قابلیتهای RDMA را به صورت مرحلهای با بالغ شدن فابریک و توجیه بار کاری، فعال کنند.
مقیاسبندی راهحل فراتر از 500 گره نیازمند ملاحظات اضافی است. ما پیادهسازی یک استراتژی مدیریت ازدحام اختصاصی RoCE با استفاده از سوئیچهای NVIDIA Spectrum-4 با تلهمتری داخلی و تنظیم آستانه ECN پویا را توصیه میکنیم. برای خوشههایی که از 1000 گره فراتر میروند، استقرار یک کنترلکننده مدیریت فابریک متمرکز (مانند NVIDIA NetQ) را برای حفظ دید سرتاسری و سازگاری پیکربندی خودکار در نظر بگیرید. MCX623106AN-CDAT برای فروش از طریق شرکای کانال جهانی NVIDIA شامل گارانتی جامع و پشتیبانی بهروزرسانی میانافزار است که قابلیت اطمینان طولانیمدت در مقیاس را تضمین میکند.
5. عملیات، نظارت، عیبیابی و بهینهسازی
عملیات مؤثر فابریک RoCE نیازمند یک استراتژی نظارت و عیبیابی چند لایه است:
- تلهمتری در سطح آداپتور: مشخصات MCX623106AN-CDAT شامل شمارندههای هر پورت برای فریمهای PFC، بستههای علامتگذاری شده ECN، فریمهای افتاده، خطاهای لینک و دورههای ازدحام است. از
mlx5cmd،ethtool، یا ابزارهای میانافزار NVIDIA برای استخراج این معیارها به داشبوردهای Prometheus/Grafana با هشدارهای مناسب استفاده کنید. - تلهمتری درونباند شبکه (INT): از پشتیبانی INT آداپتور برای ردیابی تأخیرهای هر جریان و عمق صف در سراسر فابریک استفاده کنید و امکان شناسایی دقیق منابع ازدحام میکرو را فراهم کنید.
- نظارت در سطح سوئیچ: اشغال بافر، تعداد فریمهای مکث، عمق صف و نرخ علامتگذاری ECN را در سوئیچهای اسپاین و برگ نظارت کنید. افزایش ناگهانی در فریمهای مکث نشاندهنده ازدحام میکرو است که ممکن است نیاز به تنظیم آستانه ECN داشته باشد.
- معیارهای سطح برنامه: برای برنامههای RDMA، تأخیرهای تکمیل WR (درخواست کار)، رویدادهای سرریز CQ (صف تکمیل) و تعداد خطاهای QP (جفت صف) را با استفاده از کتابخانههای NVIDIA libibverbs و rdma-core ردیابی کنید.
سناریوهای رایج عیبیابی و اقدامات پیشنهادی:
- کاهش عملکرد RoCE: فعال بودن PFC را در تمام پورتهای سوئیچ تأیید کنید و اطمینان حاصل کنید که علامتگذاری DSCP با پیکربندی سوئیچ مطابقت دارد. از و پورتال جامع مستندات شبکه NVIDIA مراجعه کنید. این مقاله فنی به عنوان یک پایه عمل میکند — معماری اعتبارسنجی شده است، اجزا آماده تولید هستند و مزایا قابل اندازهگیری هستند. برای تأیید تنظیمات تخصیص بافر در برابر مقادیر توصیه شده برای پروفایل بار کاری خود استفاده کنید.
- پرش لینک یا خطاهای CRC: کیفیت کابل QSFP112 را بررسی کنید (از انطباق با مشخصات 200G AOC یا DAC اطمینان حاصل کنید) و تأیید کنید که میانافزار آداپتور به آخرین نسخه بهروز شده است.
- مشکلات عملکرد GPU Direct: تأیید کنید که GPUDirect به درستی مقداردهی اولیه شده است و توپولوژی PCIe از DMA همتا به همتا بدون سوئیچینگ میانی پشتیبانی میکند.
- بنبست PFC یا طوفان مکث: اولویتهای پیکربندی نادرست را بررسی کنید و اطمینان حاصل کنید که PFC فقط در کلاسهای ترافیکی RoCE فعال است (نه در ترافیک مدیریت یا ذخیرهسازی).
برای بهینهسازی، ما پارامترهای تنظیم زیر را بر اساس اعتبارسنجی گسترده آزمایشگاهی توصیه میکنیم:
- تجمیع وقفه (تعدیل): برای بارهای کاری آموزش هوش مصنوعی روی 2-4 میکروثانیه تنظیم کنید تا تأخیر را به حداقل برسانید و در عین حال کارایی CPU را حفظ کنید.
- MTU RDMA: برای ارتباطات all-reduce به 4096 بایت افزایش دهید تا سربار پروتکل را کاهش داده و توان عملیاتی را بهبود بخشید.
- RSS (مقیاسبندی سمت دریافت): برای ترافیک غیر RDMA در چندین هسته CPU پیکربندی کنید تا پردازش را توزیع کرده و از اشباع تک هستهای جلوگیری کنید.
- آستانههای ECN: حداقل آستانه را در 40 درصد بافر و حداکثر آستانه را در 75 درصد برای ترافیک اولویت 3 تنظیم کنید و بر اساس الگوهای ازدحام مشاهده شده و ویژگیهای بار کاری تنظیم کنید.
6. خلاصه و ارزیابی ارزش
راهحل NVIDIA Mellanox MCX623106AN-CDAT ارزش تحولآفرینی را برای مراکز داده در مقیاس هوش مصنوعی مدرن ارائه میدهد. با جایگزینی TCP/IP مبتنی بر نرمافزار با RDMA/RoCE شتابدهنده سختافزاری و GPUDirect، سازمانها میتوانند به کاهش تأخیر در سطح برنامه 8-10 برابر دست یابند، سربار شبکه CPU را بیش از 85 درصد کاهش دهند و استفاده از GPU را از کمتر از 70 درصد به بیش از 95 درصد افزایش دهند. کارت آداپتور اترنت MCX623106AN-CDAT مسیری مقرون به صرفه برای پذیرش 200 گیگابیت بر ثانیه با حفاظت از سرمایهگذاری از طریق سازگاری با عقبگرد به 100 گیگابیت بر ثانیه و قابلیتهای خارج کردن آماده برای آینده برای بارهای کاری نوظهور فراهم میکند.
هنگام ارزیابی کل هزینه مالکیت، قیمت MCX623106AN-CDAT با صرفهجویی قابل توجه عملیاتی جبران میشود: کاهش زمان آموزش (تسریع زمان ورود به بازار)، تعداد سرور کمتر (به دلیل استفاده بیشتر از GPU)، کاهش هزینههای خنککننده (به لطف <20W power draw), and elimination of separate InfiniBand fabrics. The solution is fully سازگاری MCX623106AN-CDAT) و کاهش مصرف انرژی. این راهحل با پشتههای نرمافزاری اصلی هوش مصنوعی و HPC، از جمله کتابخانههای NVIDIA NCCL، PyTorch، TensorFlow و MPI، سازگار است و کاربرد گستردهای را در استقرارهای سازمانی، ابری و تحقیقاتی تضمین میکند.برای اسکریپتهای استقرار دقیق، الگوهای پیکربندی و گزارشهای معیار عملکرد، لطفاً به
برگه داده رسمی MCX623106AN-CDAT و پورتال جامع مستندات شبکه NVIDIA مراجعه کنید. این مقاله فنی به عنوان یک پایه عمل میکند — معماری اعتبارسنجی شده است، اجزا آماده تولید هستند و مزایا قابل اندازهگیری هستند. کارت شبکه PCIe آداپتور MCX623106AN-CDAT ConnectX صرفاً یک آداپتور نیست؛ بلکه یک توانمندساز استراتژیک برای مرکز داده آینده آماده هوش مصنوعی با تأخیر فوقالعاده کم است.

