NVIDIA Mellanox 920-9B210-00FN-0D0 در عمل: ساخت یک پارچه کم تأخیر NDR برای مدل‌های MoE با تریلیون پارامتر

August 27, 2026

آخرین اخبار شرکت NVIDIA Mellanox 920-9B210-00FN-0D0 در عمل: ساخت یک پارچه کم تأخیر NDR برای مدل‌های MoE با تریلیون پارامتر

NVIDIA Mellanox 920-9B210-00FN-0D0 در عمل: ساخت یک شبکه NDR با تأخیر کم برای مدل‌های MoE با تریلیون پارامتر

پیش‌زمینه و چالش: زمانی که ارتباطات All-to-All به گلوگاه آموزش تبدیل می‌شود

یک سازمان پیشرو در تحقیقات هوش مصنوعی اخیراً خوشه آموزش مدل زبان بزرگ خود را از 1,024 به 4,096 پردازنده گرافیکی NVIDIA H100 گسترش داده است، با هدف بلندپروازانه کاهش زمان آموزش یک مدل MoE (Mixture of Experts) پراکنده با 1.8 تریلیون پارامتر از ماه‌ها به کمتر از دو هفته. با این حال، در طول اعتبارسنجی اولیه، تیم متوجه شد که شبکه HDR موجود 200 گیگابیت بر ثانیه آنها در مرحله ارتباطات All-to-All - یک الگوی مشخص معماری‌های MoE - دچار ازدحام شدید شده است و باعث کاهش بهره‌وری پردازنده گرافیکی از 85% مورد انتظار به تنها 52% شده است، که بسیار پایین‌تر از آستانه مورد نیاز برای رسیدن به مهلت آموزش آنها است.

تجزیه و تحلیل شبکه نشان داد که ارتباطات جمعی All-to-All بیش از 40% از ردپای ارتباطی مدل MoE را به خود اختصاص داده است و با افزایش تعداد متخصصان، الگوی ترافیک به طور فزاینده‌ای پراکنده و ناگهانی شد. شبکه HDR موجود، پس از فعال کردن مکانیزم‌های کنترل ازدحام، افزایش چشمگیری در تأخیر دم را تجربه کرد و بخش قابل توجهی از پردازنده‌های گرافیکی را بیکار و منتظر گذاشت. این سازمان به شدت به یک شبکه پارچه ای نیاز داشت که قادر به ارائه تأخیر قطعی زیر میکروثانیه، انتقال بدون اتلاف و مقیاس‌پذیری عظیم بدون مسدود شدن باشد - و NVIDIA Mellanox 920-9B210-00FN-0D0 به طور خاص برای این چالش ساخته شده بود.

راه حل و استقرار: معماری Leaf-Spine NDR بهینه شده برای MoE

این سازمان یک شبکه پارچه ای دو لایه Leaf-Spine را بر اساس سوئیچ InfiniBand 920-9B210-00FN-0D0 مستقر کرد. در هر رک محاسباتی، دو سوئیچ 920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDR در لایه Leaf مستقر شدند که اتصال 400 گیگابیت بر ثانیه را به 64 سرور H100 دو پورته از طریق کابل‌های نوری فعال OSFP به OSFP فراهم می‌کرد. در لایه Spine، 16 سوئیچ اضافی 920-9B210-00FN-0D0 تمام سوئیچ‌های Leaf را به هم متصل کردند و یک شبکه Fat-Tree کاملاً بدون مسدود شدن با پهنای باند کلان 51.2 ترابیت بر ثانیه ایجاد کردند.

محور اصلی این راه حل، فناوری یکپارچه SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol) سوئیچ است. برای بار کاری MoE، ارتباطات All-to-All مستقیماً به شبکه سوئیچ منتقل شد و سوئیچ‌ها کاهش و توزیع مجدد داده‌ها را در شبکه انجام دادند. این امر نیاز به چندین مرحله در سمت میزبان را از بین برد و سربار ارتباطی را که استقرار قبلی HDR را مختل کرده بود، به شدت کاهش داد. دیتاشیت 920-9B210-00FN-0D0 تأخیر برش (cut-through) زیر 100 نانوثانیه را برجسته می‌کند که در مرحله اثبات مفهوم تأیید شد و برای الزامات تأخیر سختگیرانه بار کاری MoE حیاتی بود.

920-9B210-00FN-0D0 - از جمله منابع تغذیه دوگانه افزونه و فن‌های قابل تعویض در حین کار - به تیم اطمینان داد که به هدف دسترسی 99.999% خود دست یابند. تیم مهندسی همچنین تأیید کرد که اکوسیستم سازگار با 920-9B210-00FN-0D0 شامل تمام اپتیک‌ها و کابل‌های OSFP بود که آنها قبلاً واجد شرایط کرده بودند، و تأخیرهای تدارکات را از بین برد و جدول زمانی استقرار را ساده کرد.

نتایج و دستاوردهای قابل اندازه‌گیری: از گلوگاه تا توانمندساز

پس از استقرار کامل شبکه NDR و راه‌اندازی مجدد شغل آموزش MoE، سازمان بهبودهای تحول‌آفرینی را در ابعاد مختلف اندازه‌گیری کرد:

  • بازیابی بهره‌وری پردازنده گرافیکی: میانگین بهره‌وری پردازنده گرافیکی از 52% به 89% افزایش یافت و در طول فازهای فشرده محاسباتی به اوج 94% رسید - نتیجه مستقیم حذف توقف‌های ناشی از شبکه.
  • کاهش تأخیر All-to-All: زمان مورد نیاز برای تبادل کامل All-to-All در 4,096 پردازنده گرافیکی از 180 میلی‌ثانیه به کمتر از 45 میلی‌ثانیه کاهش یافت، که 75% بهبود مستقیماً به تکرارهای سریع‌تر آموزش ترجمه شد.
  • زمان تکمیل شغل: جدول زمانی پیش‌بینی شده آموزش برای مدل MoE 1.8T از 14 روز به 9 روز کاهش یافت - شتاب 36% که هم زمان عرضه به بازار و هم هزینه‌های محاسباتی ابری را به طور قابل توجهی کاهش داد.
  • کارایی عملیاتی: با 64 پورت در هر سوئیچ، تعداد سوئیچ‌های Spine مورد نیاز در مقایسه با طراحی HDR 40 پورته 37% کاهش یافت، که کابل‌کشی را ساده‌تر کرد و مصرف برق در هر رک را 28% کاهش داد.

از منظر کل هزینه مالکیت، تیم مالی سازمان خاطرنشان کرد که در حالی که قیمت 920-9B210-00FN-0D0 در هر واحد بالاتر از جایگزین‌های HDR بود، هزینه شبکه در هر پردازنده گرافیکی به دلیل رادیکس بالاتر و کاهش تعداد لایه‌های سوئیچ کاهش یافت. این مزیت اقتصادی، همراه با بهبودهای چشمگیر عملکرد، ارتقاء NDR را به یک پیروزی تجاری واضح تبدیل کرد. راه حل 920-9B210-00FN-0D0 InfiniBand switch OPN solution همچنین به طور یکپارچه با استقرار NVIDIA UFM موجود آنها ادغام شد و دید متمرکز و هشدارهای خودکار را فراهم کرد که هزینه‌های عملیاتی را 40% کاهش داد.

خلاصه و چشم‌انداز: پایه NDR برای بارهای کاری MoE نسل بعدی

NVIDIA Mellanox 920-9B210-00FN-0D0 به عنوان راه حل تحول‌آفرینی که این سازمان تحقیقاتی هوش مصنوعی برای آزادسازی پتانسیل کامل خوشه 4,096 پردازنده گرافیکی H100 خود نیاز داشت، ثابت شد. با ارائه پهنای باند 400 گیگابیت بر ثانیه NDR، تراکم 64 پورته و محاسبات درون شبکه SHARPv3، این سوئیچ به آنها اجازه داد تا از 1,024 به 4,096 پردازنده گرافیکی بدون به خطر انداختن عملکرد یا قابلیت مدیریت مقیاس‌بندی کنند - دستاوردی که با زیرساخت HDR قبلی آنها غیرممکن بود.

با نگاه به آینده، این سازمان قصد دارد در 18 ماه آینده به 8,192 پردازنده گرافیکی گسترش یابد و از 920-9B210-00FN-0D0 برای فروش از طریق شرکای کانال NVIDIA برای ساخت یک شبکه Folded-Clos سه لایه حتی بزرگتر استفاده کند. برای سازمان‌هایی که سرمایه‌گذاری‌های شبکه هوش مصنوعی و HPC نسل بعدی خود را ارزیابی می‌کنند، 920-9B210-00FN-0D0 یک راه حل اثبات شده و آماده تولید ارائه می‌دهد که وعده بهینه‌سازی اتصال RDMA با تأخیر کم در مقیاس اگزاکسل را تحقق می‌بخشد.