NVIDIA Mellanox 920-9B210-00FN-0D0 در عمل: ساخت یک پارچه کم تأخیر NDR برای مدلهای MoE با تریلیون پارامتر
August 27, 2026
NVIDIA Mellanox 920-9B210-00FN-0D0 در عمل: ساخت یک شبکه NDR با تأخیر کم برای مدلهای MoE با تریلیون پارامتر
پیشزمینه و چالش: زمانی که ارتباطات All-to-All به گلوگاه آموزش تبدیل میشود
یک سازمان پیشرو در تحقیقات هوش مصنوعی اخیراً خوشه آموزش مدل زبان بزرگ خود را از 1,024 به 4,096 پردازنده گرافیکی NVIDIA H100 گسترش داده است، با هدف بلندپروازانه کاهش زمان آموزش یک مدل MoE (Mixture of Experts) پراکنده با 1.8 تریلیون پارامتر از ماهها به کمتر از دو هفته. با این حال، در طول اعتبارسنجی اولیه، تیم متوجه شد که شبکه HDR موجود 200 گیگابیت بر ثانیه آنها در مرحله ارتباطات All-to-All - یک الگوی مشخص معماریهای MoE - دچار ازدحام شدید شده است و باعث کاهش بهرهوری پردازنده گرافیکی از 85% مورد انتظار به تنها 52% شده است، که بسیار پایینتر از آستانه مورد نیاز برای رسیدن به مهلت آموزش آنها است.
تجزیه و تحلیل شبکه نشان داد که ارتباطات جمعی All-to-All بیش از 40% از ردپای ارتباطی مدل MoE را به خود اختصاص داده است و با افزایش تعداد متخصصان، الگوی ترافیک به طور فزایندهای پراکنده و ناگهانی شد. شبکه HDR موجود، پس از فعال کردن مکانیزمهای کنترل ازدحام، افزایش چشمگیری در تأخیر دم را تجربه کرد و بخش قابل توجهی از پردازندههای گرافیکی را بیکار و منتظر گذاشت. این سازمان به شدت به یک شبکه پارچه ای نیاز داشت که قادر به ارائه تأخیر قطعی زیر میکروثانیه، انتقال بدون اتلاف و مقیاسپذیری عظیم بدون مسدود شدن باشد - و NVIDIA Mellanox 920-9B210-00FN-0D0 به طور خاص برای این چالش ساخته شده بود.
راه حل و استقرار: معماری Leaf-Spine NDR بهینه شده برای MoE
این سازمان یک شبکه پارچه ای دو لایه Leaf-Spine را بر اساس سوئیچ InfiniBand 920-9B210-00FN-0D0 مستقر کرد. در هر رک محاسباتی، دو سوئیچ 920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDR در لایه Leaf مستقر شدند که اتصال 400 گیگابیت بر ثانیه را به 64 سرور H100 دو پورته از طریق کابلهای نوری فعال OSFP به OSFP فراهم میکرد. در لایه Spine، 16 سوئیچ اضافی 920-9B210-00FN-0D0 تمام سوئیچهای Leaf را به هم متصل کردند و یک شبکه Fat-Tree کاملاً بدون مسدود شدن با پهنای باند کلان 51.2 ترابیت بر ثانیه ایجاد کردند.
محور اصلی این راه حل، فناوری یکپارچه SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol) سوئیچ است. برای بار کاری MoE، ارتباطات All-to-All مستقیماً به شبکه سوئیچ منتقل شد و سوئیچها کاهش و توزیع مجدد دادهها را در شبکه انجام دادند. این امر نیاز به چندین مرحله در سمت میزبان را از بین برد و سربار ارتباطی را که استقرار قبلی HDR را مختل کرده بود، به شدت کاهش داد. دیتاشیت 920-9B210-00FN-0D0 تأخیر برش (cut-through) زیر 100 نانوثانیه را برجسته میکند که در مرحله اثبات مفهوم تأیید شد و برای الزامات تأخیر سختگیرانه بار کاری MoE حیاتی بود.
920-9B210-00FN-0D0 - از جمله منابع تغذیه دوگانه افزونه و فنهای قابل تعویض در حین کار - به تیم اطمینان داد که به هدف دسترسی 99.999% خود دست یابند. تیم مهندسی همچنین تأیید کرد که اکوسیستم سازگار با 920-9B210-00FN-0D0 شامل تمام اپتیکها و کابلهای OSFP بود که آنها قبلاً واجد شرایط کرده بودند، و تأخیرهای تدارکات را از بین برد و جدول زمانی استقرار را ساده کرد.
نتایج و دستاوردهای قابل اندازهگیری: از گلوگاه تا توانمندساز
پس از استقرار کامل شبکه NDR و راهاندازی مجدد شغل آموزش MoE، سازمان بهبودهای تحولآفرینی را در ابعاد مختلف اندازهگیری کرد:
- بازیابی بهرهوری پردازنده گرافیکی: میانگین بهرهوری پردازنده گرافیکی از 52% به 89% افزایش یافت و در طول فازهای فشرده محاسباتی به اوج 94% رسید - نتیجه مستقیم حذف توقفهای ناشی از شبکه.
- کاهش تأخیر All-to-All: زمان مورد نیاز برای تبادل کامل All-to-All در 4,096 پردازنده گرافیکی از 180 میلیثانیه به کمتر از 45 میلیثانیه کاهش یافت، که 75% بهبود مستقیماً به تکرارهای سریعتر آموزش ترجمه شد.
- زمان تکمیل شغل: جدول زمانی پیشبینی شده آموزش برای مدل MoE 1.8T از 14 روز به 9 روز کاهش یافت - شتاب 36% که هم زمان عرضه به بازار و هم هزینههای محاسباتی ابری را به طور قابل توجهی کاهش داد.
- کارایی عملیاتی: با 64 پورت در هر سوئیچ، تعداد سوئیچهای Spine مورد نیاز در مقایسه با طراحی HDR 40 پورته 37% کاهش یافت، که کابلکشی را سادهتر کرد و مصرف برق در هر رک را 28% کاهش داد.
از منظر کل هزینه مالکیت، تیم مالی سازمان خاطرنشان کرد که در حالی که قیمت 920-9B210-00FN-0D0 در هر واحد بالاتر از جایگزینهای HDR بود، هزینه شبکه در هر پردازنده گرافیکی به دلیل رادیکس بالاتر و کاهش تعداد لایههای سوئیچ کاهش یافت. این مزیت اقتصادی، همراه با بهبودهای چشمگیر عملکرد، ارتقاء NDR را به یک پیروزی تجاری واضح تبدیل کرد. راه حل 920-9B210-00FN-0D0 InfiniBand switch OPN solution همچنین به طور یکپارچه با استقرار NVIDIA UFM موجود آنها ادغام شد و دید متمرکز و هشدارهای خودکار را فراهم کرد که هزینههای عملیاتی را 40% کاهش داد.
خلاصه و چشمانداز: پایه NDR برای بارهای کاری MoE نسل بعدی
NVIDIA Mellanox 920-9B210-00FN-0D0 به عنوان راه حل تحولآفرینی که این سازمان تحقیقاتی هوش مصنوعی برای آزادسازی پتانسیل کامل خوشه 4,096 پردازنده گرافیکی H100 خود نیاز داشت، ثابت شد. با ارائه پهنای باند 400 گیگابیت بر ثانیه NDR، تراکم 64 پورته و محاسبات درون شبکه SHARPv3، این سوئیچ به آنها اجازه داد تا از 1,024 به 4,096 پردازنده گرافیکی بدون به خطر انداختن عملکرد یا قابلیت مدیریت مقیاسبندی کنند - دستاوردی که با زیرساخت HDR قبلی آنها غیرممکن بود.
با نگاه به آینده، این سازمان قصد دارد در 18 ماه آینده به 8,192 پردازنده گرافیکی گسترش یابد و از 920-9B210-00FN-0D0 برای فروش از طریق شرکای کانال NVIDIA برای ساخت یک شبکه Folded-Clos سه لایه حتی بزرگتر استفاده کند. برای سازمانهایی که سرمایهگذاریهای شبکه هوش مصنوعی و HPC نسل بعدی خود را ارزیابی میکنند، 920-9B210-00FN-0D0 یک راه حل اثبات شده و آماده تولید ارائه میدهد که وعده بهینهسازی اتصال RDMA با تأخیر کم در مقیاس اگزاکسل را تحقق میبخشد.

