آداپتور سرور NVIDIA Mellanox MCX623106AN-CDAT در عمل | انتقال با تأخیر کم RDMA/RoCE و افزایش توان عملیاتی سرور
July 22, 2026
آداپتور سرور NVIDIA Mellanox MCX623106AN-CDAT در عمل | انتقال با تأخیر کم RDMA/RoCE و افزایش توان عملیاتی سرور
پیشزمینه و چالش: زمانی که 200GbE با دیوار مقیاسپذیری هوش مصنوعی روبرو میشود
یک سازمان تحقیقاتی هوش مصنوعی با رشد سریع - بیایید آنها را "DeepCore Labs" بنامیم - با یک گلوگاه مقیاسپذیری حیاتی روبرو بود. خوشه آموزش مدل زبان بزرگ پرچمدار آنها، متشکل از 512 پردازنده گرافیکی NVIDIA H100 که در 128 گره توزیع شده بودند، با افزایش مقیاس فراتر از 64 گره، دچار افت شدید عملکرد میشد. مشکل نه محاسبات بود و نه حافظه، بلکه شبکه ارتباطی بود. همگامسازی گرادیانهای All-reduce بیش از 15 ثانیه در هر تکرار طول میکشید و استفاده از پردازنده گرافیکی به دلیل توقف شبکه تنها به 62٪ کاهش یافته بود. زیرساخت 100GbE موجود آنها که به TCP/IP مبتنی بر نرمافزار متکی بود، به سادگی قادر به مدیریت الگوهای ارتباطی پرانرژی و حساس به تأخیر آموزش توزیع شده نبود. این تیم به راه حلی نیاز داشت که بتواند توان عملیاتی خطی 200GbE را با تأخیر قطعی در سطح میکروثانیه ارائه دهد.
ارزیابی آنها منجر به انتخاب NVIDIA Mellanox MCX623106AN-CDAT شد - یک آداپتور سرور 200GbE که برای سنگینترین بارهای کاری هوش مصنوعی و HPC مهندسی شده است. تیم تحقیقاتی تشخیص داد که کارت شبکه PCIe آداپتور MCX623106AN-CDAT ConnectX قابلیتهای پیشرفته تخلیه و GPUDirect مورد نیاز برای حذف گلوگاه شبکه و به حداکثر رساندن استفاده از پردازنده گرافیکی را ارائه میدهد.
راه حل: استقرار کارت آداپتور اترنت MCX623106AN-CDAT
DeepCore Labs کارت آداپتور اترنت MCX623106AN-CDAT را در تمام 128 گره آموزشی مستقر کرد، با هر سرور مجهز به یک آداپتور دو پورتی QSFP112 متصل به یک شبکه برگ-ستون که بر روی سوئیچهای NVIDIA Spectrum-4 ساخته شده بود. این استقرار از پشتیبانی بومی RoCE v2 آداپتور برای فعال کردن انتقال اترنت بدون اتلاف استفاده کرد و نیاز به یک شبکه InfiniBand جداگانه را از بین برد. کلید راه حل، قابلیت GPUDirect RDMA آداپتور بود که امکان انتقال مستقیم داده بین پردازندههای گرافیکی در سراسر شبکه را بدون دخالت CPU فراهم میکرد - یک ویژگی حیاتی برای کاهش سربار همگامسازی.
این تیم PFC (کنترل جریان اولویت) و ECN (اعلان ازدحام صریح) را در سطح سوئیچ پیکربندی کرد و اولویت 3 را برای ترافیک ارتباطات جمعی و اولویت 4 را برای ورودی/خروجی ذخیرهسازی اختصاص داد. آنها همچنین از فناوری مسیریابی تطبیقی NVIDIA برای توزیع پویا ترافیک در مسیرهای متعدد استفاده کردند و نقاط داغ را به حداقل رساندند. ظرف چهار هفته، کل شبکه آموزشی بر روی RDMA اجرا میشد و تمام 512 پردازنده گرافیکی به طور یکپارچه از طریق RoCE ارتباط برقرار میکردند. اکوسیستم سازگار با MCX623106AN-CDAT قوی بود - کارتها بدون هیچ تغییری با سرورهای مبتنی بر H100 و کتابخانه ارتباطات جمعی NVIDIA (NCCL) به طور بینقص ادغام شدند.
این تیم به برگه داده MCX623106AN-CDAT مراجعه کرد تا تخصیص بافر و پارامترهای کنترل ازدحام را تنظیم کند و عملکرد بهینه را برای محیط کاری ترکیبی خود - که شامل آموزش همزمان (تحت سلطه all-reduce) و پشتیبانگیری ناهمزمان بود - به دست آورد.
نتایج قابل اندازهگیری: بهرهوری مقیاسپذیری، توان عملیاتی و استفاده از پردازنده گرافیکی
افزایش عملکرد متحول کننده بود. با فعال شدن RDMA از طریق RoCE از طریق NVIDIA Mellanox MCX623106AN-CDAT، تأخیر همگامسازی all-reduce از میانگین 15.2 ثانیه به تنها 1.8 ثانیه در هر تکرار کاهش یافت - بهبود 8.4 برابری. این مستقیماً به همگرایی سریعتر مدل ترجمه شد: زمان کل آموزش مدل 70 میلیارد پارامتری آنها از 42 روز به 19 روز کاهش یافت و چرخه تحقیقاتی آنها را بیش از 50٪ تسریع کرد.
استفاده از پردازنده گرافیکی، که به دلیل توقف شبکه در 62٪ باقی مانده بود، پس از ارتقا به 94٪ جهش کرد - بهبود 52٪ در ظرفیت محاسباتی مؤثر. قرارگیری دادههای خارج از ترتیب پیشرفته آداپتور و زمانبندی بستهها، ریز انفجارهای کوچکی را که باعث افزایش تأخیر دم میشدند، از بین برد و عملکرد ثابت را در تمام گرهها تضمین کرد.
فراتر از عملکرد آموزش، افزایش توان عملیاتی سرور نیز به همان اندازه چشمگیر بود. موتور تخلیه سختافزاری - از جمله تخلیه چکسام، LSO/LRO، و شتابدهنده RoCE - استفاده از CPU برای پردازش شبکه را از 38٪ به کمتر از 4٪ در تمام گرهها کاهش داد. این ظرفیت قابل توجه CPU را برای پیشپردازش دادهها، فشردهسازی پشتیبانگیری و سایر وظایف کمکی که قبلاً محدود شده بودند، آزاد کرد.
| معیار | قبل (کارت شبکه قدیمی 100GbE) | بعد (MCX623106AN-CDAT) | بهبود |
|---|---|---|---|
| تأخیر All-Reduce (در هر تکرار) | 15.2 ثانیه | 1.8 ثانیه | 8.4 برابر سریعتر |
| استفاده از پردازنده گرافیکی | 62% | 94% | 52% بالاتر |
| زمان آموزش مدل (70 میلیارد پارامتر) | 42 روز | 19 روز | 55% سریعتر |
| سربار شبکه CPU | 38% | کمتر از 4% | 89% کمتر |
| تأخیر خواندن NVMe-oF (ذخیرهسازی) | 185 میکروثانیه | 12 میکروثانیه | 15 برابر سریعتر |
مزایای عملیاتی: TCO و بهرهوری زیرساخت
در حالی که افزایش عملکرد چشمگیر بود، مزایای عملیاتی و مالی نیز به همان اندازه قابل توجه بود. راه حل کارت آداپتور اترنت MCX623106AN-CDAT با حذف نیاز به یک شبکه InfiniBand جداگانه، هزینه کل مالکیت را کاهش داد - بیش از 500 هزار دلار در هزینههای زیرساخت سوئیچ صرفهجویی شد. طراحی کم مصرف آداپتور (کمتر از 20 وات در هر کارت) به صرفهجویی قابل اندازهگیری در مصرف برق در خوشه 128 گرهای کمک کرد و هزینههای سالانه خنککننده را به طور تخمینی 18٪ کاهش داد.
برای مدیران IT که قیمت MCX623106AN-CDAT را در مقایسه با راه حلهای جایگزین ارزیابی میکنند، مدیر زیرساخت DeepCore خاطرنشان کرد که دوره بازگشت سرمایه کمتر از شش ماه بود - که عمدتاً ناشی از کاهش زمان آموزش بود که مستقیماً خط لوله توسعه محصول آنها را تسریع میکرد. این تیم همچنین ارزش آیندهنگری آداپتور را درک کرد: همان MCX623106AN-CDAT برای فروش امروز از 200GbE پشتیبانی میکند اما با اپتیکهای 100GbE و 50GbE نیز سازگار است و انعطافپذیری را برای محیطهای با سرعت ترکیبی و ارتقاء تدریجی فراهم میکند.
طبق مشخصات MCX623106AN-CDAT، آداپتور شامل ویژگیهای تلهمتری جامع، از جمله تلهمتری شبکه درون باند (INT) و ردیابی تأخیر در هر جریان است. DeepCore این معیارها را در پشته Prometheus/Grafana خود ادغام کرد و امکان تشخیص پیشگیرانه ریز ازدحام را قبل از تأثیرگذاری بر عملکرد آموزش فراهم کرد. این تیم همچنین از الگوریتمهای کنترل ازدحام آداپتور برای تنظیم پویا آستانههای ECN استفاده کرد و رفتار بدون اتلاف را حتی در طول عملیات پشتیبانگیری که بار شبکه اضافی ایجاد میکرد، حفظ کرد.
خلاصه و چشمانداز: طرحی برای شبکهسازی در مقیاس هوش مصنوعی
سفر DeepCore Labs با NVIDIA Mellanox MCX623106AN-CDAT یک طرح واضح برای سازمانهایی که زیرساخت هوش مصنوعی میسازند یا مقیاسبندی میکنند، نشان میدهد. با ترکیب توان عملیاتی دو پورتی 200GbE، رابط میزبان PCIe 5.0، و RDMA با قابلیت GPUDirect، کارت آداپتور اترنت MCX623106AN-CDAT شبکه را از یک گلوگاه مقیاسپذیری به یک ضربکننده عملکرد تبدیل میکند. نتایج - 8.4 برابر سریعتر all-reduce، 94٪ استفاده از پردازنده گرافیکی، و 55٪ سریعتر چرخههای آموزش - نشاندهنده توانایی آداپتور در ارائه نتایج ملموس کسبوکار در سنگینترین محیطهای محاسباتی است.
با نگاه به آینده، با توجه به اینکه اندازههای مدل هر چند ماه یکبار دو برابر میشوند و خوشههای آموزشی توزیع شده به هزاران پردازنده گرافیکی گسترش مییابند، کارت شبکه PCIe آداپتور MCX623106AN-CDAT ConnectX پایهای محکم برای شبکههای بدون اتلاف و با تأخیر فوقالعاده کم فراهم میکند. برای معماران و رهبران IT که سرمایهگذاری بعدی خود را در زیرساخت هوش مصنوعی برنامهریزی میکنند، این آداپتور نه تنها یک جزء، بلکه یک توانمندساز استراتژیک برای تمایز رقابتی است. پارامترهای تنظیم دقیق، اسکریپتهای استقرار و گزارشهای معیار عملکرد در برگه داده MCX623106AN-CDAT رسمی موجود است - یک مرجع ضروری برای هر استقرار هوش مصنوعی در مقیاس بزرگ.

