آداپتور سرور NVIDIA Mellanox MCX623106AN-CDAT در عمل | انتقال با تأخیر کم RDMA/RoCE و افزایش توان عملیاتی سرور

July 22, 2026

آخرین اخبار شرکت آداپتور سرور NVIDIA Mellanox MCX623106AN-CDAT در عمل | انتقال با تأخیر کم RDMA/RoCE و افزایش توان عملیاتی سرور

آداپتور سرور NVIDIA Mellanox MCX623106AN-CDAT در عمل | انتقال با تأخیر کم RDMA/RoCE و افزایش توان عملیاتی سرور

پیش‌زمینه و چالش: زمانی که 200GbE با دیوار مقیاس‌پذیری هوش مصنوعی روبرو می‌شود

یک سازمان تحقیقاتی هوش مصنوعی با رشد سریع - بیایید آنها را "DeepCore Labs" بنامیم - با یک گلوگاه مقیاس‌پذیری حیاتی روبرو بود. خوشه آموزش مدل زبان بزرگ پرچمدار آنها، متشکل از 512 پردازنده گرافیکی NVIDIA H100 که در 128 گره توزیع شده بودند، با افزایش مقیاس فراتر از 64 گره، دچار افت شدید عملکرد می‌شد. مشکل نه محاسبات بود و نه حافظه، بلکه شبکه ارتباطی بود. همگام‌سازی گرادیان‌های All-reduce بیش از 15 ثانیه در هر تکرار طول می‌کشید و استفاده از پردازنده گرافیکی به دلیل توقف شبکه تنها به 62٪ کاهش یافته بود. زیرساخت 100GbE موجود آنها که به TCP/IP مبتنی بر نرم‌افزار متکی بود، به سادگی قادر به مدیریت الگوهای ارتباطی پرانرژی و حساس به تأخیر آموزش توزیع شده نبود. این تیم به راه حلی نیاز داشت که بتواند توان عملیاتی خطی 200GbE را با تأخیر قطعی در سطح میکروثانیه ارائه دهد.

ارزیابی آنها منجر به انتخاب NVIDIA Mellanox MCX623106AN-CDAT شد - یک آداپتور سرور 200GbE که برای سنگین‌ترین بارهای کاری هوش مصنوعی و HPC مهندسی شده است. تیم تحقیقاتی تشخیص داد که کارت شبکه PCIe آداپتور MCX623106AN-CDAT ConnectX قابلیت‌های پیشرفته تخلیه و GPUDirect مورد نیاز برای حذف گلوگاه شبکه و به حداکثر رساندن استفاده از پردازنده گرافیکی را ارائه می‌دهد.

راه حل: استقرار کارت آداپتور اترنت MCX623106AN-CDAT

DeepCore Labs کارت آداپتور اترنت MCX623106AN-CDAT را در تمام 128 گره آموزشی مستقر کرد، با هر سرور مجهز به یک آداپتور دو پورتی QSFP112 متصل به یک شبکه برگ-ستون که بر روی سوئیچ‌های NVIDIA Spectrum-4 ساخته شده بود. این استقرار از پشتیبانی بومی RoCE v2 آداپتور برای فعال کردن انتقال اترنت بدون اتلاف استفاده کرد و نیاز به یک شبکه InfiniBand جداگانه را از بین برد. کلید راه حل، قابلیت GPUDirect RDMA آداپتور بود که امکان انتقال مستقیم داده بین پردازنده‌های گرافیکی در سراسر شبکه را بدون دخالت CPU فراهم می‌کرد - یک ویژگی حیاتی برای کاهش سربار همگام‌سازی.

این تیم PFC (کنترل جریان اولویت) و ECN (اعلان ازدحام صریح) را در سطح سوئیچ پیکربندی کرد و اولویت 3 را برای ترافیک ارتباطات جمعی و اولویت 4 را برای ورودی/خروجی ذخیره‌سازی اختصاص داد. آنها همچنین از فناوری مسیریابی تطبیقی NVIDIA برای توزیع پویا ترافیک در مسیرهای متعدد استفاده کردند و نقاط داغ را به حداقل رساندند. ظرف چهار هفته، کل شبکه آموزشی بر روی RDMA اجرا می‌شد و تمام 512 پردازنده گرافیکی به طور یکپارچه از طریق RoCE ارتباط برقرار می‌کردند. اکوسیستم سازگار با MCX623106AN-CDAT قوی بود - کارت‌ها بدون هیچ تغییری با سرورهای مبتنی بر H100 و کتابخانه ارتباطات جمعی NVIDIA (NCCL) به طور بی‌نقص ادغام شدند.

این تیم به برگه داده MCX623106AN-CDAT مراجعه کرد تا تخصیص بافر و پارامترهای کنترل ازدحام را تنظیم کند و عملکرد بهینه را برای محیط کاری ترکیبی خود - که شامل آموزش همزمان (تحت سلطه all-reduce) و پشتیبان‌گیری ناهمزمان بود - به دست آورد.

نتایج قابل اندازه‌گیری: بهره‌وری مقیاس‌پذیری، توان عملیاتی و استفاده از پردازنده گرافیکی

افزایش عملکرد متحول کننده بود. با فعال شدن RDMA از طریق RoCE از طریق NVIDIA Mellanox MCX623106AN-CDAT، تأخیر همگام‌سازی all-reduce از میانگین 15.2 ثانیه به تنها 1.8 ثانیه در هر تکرار کاهش یافت - بهبود 8.4 برابری. این مستقیماً به همگرایی سریع‌تر مدل ترجمه شد: زمان کل آموزش مدل 70 میلیارد پارامتری آنها از 42 روز به 19 روز کاهش یافت و چرخه تحقیقاتی آنها را بیش از 50٪ تسریع کرد.

استفاده از پردازنده گرافیکی، که به دلیل توقف شبکه در 62٪ باقی مانده بود، پس از ارتقا به 94٪ جهش کرد - بهبود 52٪ در ظرفیت محاسباتی مؤثر. قرارگیری داده‌های خارج از ترتیب پیشرفته آداپتور و زمان‌بندی بسته‌ها، ریز انفجارهای کوچکی را که باعث افزایش تأخیر دم می‌شدند، از بین برد و عملکرد ثابت را در تمام گره‌ها تضمین کرد.

فراتر از عملکرد آموزش، افزایش توان عملیاتی سرور نیز به همان اندازه چشمگیر بود. موتور تخلیه سخت‌افزاری - از جمله تخلیه چک‌سام، LSO/LRO، و شتاب‌دهنده RoCE - استفاده از CPU برای پردازش شبکه را از 38٪ به کمتر از 4٪ در تمام گره‌ها کاهش داد. این ظرفیت قابل توجه CPU را برای پیش‌پردازش داده‌ها، فشرده‌سازی پشتیبان‌گیری و سایر وظایف کمکی که قبلاً محدود شده بودند، آزاد کرد.

معیار قبل (کارت شبکه قدیمی 100GbE) بعد (MCX623106AN-CDAT) بهبود
تأخیر All-Reduce (در هر تکرار) 15.2 ثانیه 1.8 ثانیه 8.4 برابر سریعتر
استفاده از پردازنده گرافیکی 62% 94% 52% بالاتر
زمان آموزش مدل (70 میلیارد پارامتر) 42 روز 19 روز 55% سریعتر
سربار شبکه CPU 38% کمتر از 4% 89% کمتر
تأخیر خواندن NVMe-oF (ذخیره‌سازی) 185 میکروثانیه 12 میکروثانیه 15 برابر سریعتر

مزایای عملیاتی: TCO و بهره‌وری زیرساخت

در حالی که افزایش عملکرد چشمگیر بود، مزایای عملیاتی و مالی نیز به همان اندازه قابل توجه بود. راه حل کارت آداپتور اترنت MCX623106AN-CDAT با حذف نیاز به یک شبکه InfiniBand جداگانه، هزینه کل مالکیت را کاهش داد - بیش از 500 هزار دلار در هزینه‌های زیرساخت سوئیچ صرفه‌جویی شد. طراحی کم مصرف آداپتور (کمتر از 20 وات در هر کارت) به صرفه‌جویی قابل اندازه‌گیری در مصرف برق در خوشه 128 گره‌ای کمک کرد و هزینه‌های سالانه خنک‌کننده را به طور تخمینی 18٪ کاهش داد.

برای مدیران IT که قیمت MCX623106AN-CDAT را در مقایسه با راه حل‌های جایگزین ارزیابی می‌کنند، مدیر زیرساخت DeepCore خاطرنشان کرد که دوره بازگشت سرمایه کمتر از شش ماه بود - که عمدتاً ناشی از کاهش زمان آموزش بود که مستقیماً خط لوله توسعه محصول آنها را تسریع می‌کرد. این تیم همچنین ارزش آینده‌نگری آداپتور را درک کرد: همان MCX623106AN-CDAT برای فروش امروز از 200GbE پشتیبانی می‌کند اما با اپتیک‌های 100GbE و 50GbE نیز سازگار است و انعطاف‌پذیری را برای محیط‌های با سرعت ترکیبی و ارتقاء تدریجی فراهم می‌کند.

طبق مشخصات MCX623106AN-CDAT، آداپتور شامل ویژگی‌های تله‌متری جامع، از جمله تله‌متری شبکه درون باند (INT) و ردیابی تأخیر در هر جریان است. DeepCore این معیارها را در پشته Prometheus/Grafana خود ادغام کرد و امکان تشخیص پیشگیرانه ریز ازدحام را قبل از تأثیرگذاری بر عملکرد آموزش فراهم کرد. این تیم همچنین از الگوریتم‌های کنترل ازدحام آداپتور برای تنظیم پویا آستانه‌های ECN استفاده کرد و رفتار بدون اتلاف را حتی در طول عملیات پشتیبان‌گیری که بار شبکه اضافی ایجاد می‌کرد، حفظ کرد.

خلاصه و چشم‌انداز: طرحی برای شبکه‌سازی در مقیاس هوش مصنوعی

سفر DeepCore Labs با NVIDIA Mellanox MCX623106AN-CDAT یک طرح واضح برای سازمان‌هایی که زیرساخت هوش مصنوعی می‌سازند یا مقیاس‌بندی می‌کنند، نشان می‌دهد. با ترکیب توان عملیاتی دو پورتی 200GbE، رابط میزبان PCIe 5.0، و RDMA با قابلیت GPUDirect، کارت آداپتور اترنت MCX623106AN-CDAT شبکه را از یک گلوگاه مقیاس‌پذیری به یک ضرب‌کننده عملکرد تبدیل می‌کند. نتایج - 8.4 برابر سریعتر all-reduce، 94٪ استفاده از پردازنده گرافیکی، و 55٪ سریعتر چرخه‌های آموزش - نشان‌دهنده توانایی آداپتور در ارائه نتایج ملموس کسب‌وکار در سنگین‌ترین محیط‌های محاسباتی است.

با نگاه به آینده، با توجه به اینکه اندازه‌های مدل هر چند ماه یکبار دو برابر می‌شوند و خوشه‌های آموزشی توزیع شده به هزاران پردازنده گرافیکی گسترش می‌یابند، کارت شبکه PCIe آداپتور MCX623106AN-CDAT ConnectX پایه‌ای محکم برای شبکه‌های بدون اتلاف و با تأخیر فوق‌العاده کم فراهم می‌کند. برای معماران و رهبران IT که سرمایه‌گذاری بعدی خود را در زیرساخت هوش مصنوعی برنامه‌ریزی می‌کنند، این آداپتور نه تنها یک جزء، بلکه یک توانمندساز استراتژیک برای تمایز رقابتی است. پارامترهای تنظیم دقیق، اسکریپت‌های استقرار و گزارش‌های معیار عملکرد در برگه داده MCX623106AN-CDAT رسمی موجود است - یک مرجع ضروری برای هر استقرار هوش مصنوعی در مقیاس بزرگ.