NVIDIA Mellanox 920-9B110-00FH-0D0 در عمل: بهینه‌سازی پارچه‌های RDMA با تأخیر کم برای خوشه‌های HPC و هوش مصنوعی

August 25, 2026

آخرین اخبار شرکت NVIDIA Mellanox 920-9B110-00FH-0D0 در عمل: بهینه‌سازی پارچه‌های RDMA با تأخیر کم برای خوشه‌های HPC و هوش مصنوعی

NVIDIA Mellanox 920-9B110-00FH-0D0 در عمل: بهینه سازی پارچه های RDMA کم تاخیر برای خوشه های HPC و AI

پیش زمینه و چالش: زمانی که عملکرد HDR با واقعیت بودجه مطابقت دارد

یک آزمایشگاه تحقیقاتی هوش مصنوعی متوسط اخیراً با یک چالش آشنا روبرو شد: پارچه موجود 100Gb / s EDR InfiniBand آنها در حال تبدیل شدن به یک گلوی فشرده برای خوشه GPU در حال گسترش آنها بود،که از 128 به 512 گره NVIDIA A100 رشد کرده بودزمان آموزش برای مدل های بزرگ ترانسفورماتور به دلیل ازدحام شبکه در طول عملیات تمام کاهش، بیش از 40٪ افزایش یافته است.و تیم نیاز به ارتقاء داشت که می تواند مزایای قابل توجهی را بدون هزینه های سرمایه ای مورد نیاز برای یک انکشاف کامل 400Gb / s NDR ارائه دهد..

آزمایشگاه چندین گزینه را ارزیابی کرد و HDR 200Gb / s را به عنوان تعادل ایده آل عملکرد و هزینه شناسایی کرد.کنترل فشرده سازی پیشرفته، و یکپارچه سازی با کابل ها و گیرنده های سازگار با HDR موجود.NVIDIA Mellanox 920-9B110-00FH-0D0وارد تصویر شد یک سوئیچ که به طور خاص برای محیط هایی ساخته شده است که HDR پهنای باند کافی را بدون بیش از حد فراهم می کند.

راه حل و پیاده سازی: یک پارچه HDR بهینه شده با هزینه

آزمايشگاه920-9B110-00FH-0D0 InfiniBand سوئیچ OPN(رقم سفارش بخش) به عنوان سنگ بنای معماری جدید برگ ستون فقرات آنها. هر قفسه محاسباتی یک سوئیچ مبتنی بر MQM8790-HS2F دریافت کرد920-9B110-00FH-0D0 MQM8790-HS2F 200Gb/s HDR✓40 پورت اتصال 200Gb / s به سرورهای GPU را از طریق کابل های اتصال مستقیم OSFP به OSFP فراهم می کند. در لایه ستون فقرات، چهار سوئیچ اضافی 920-9B110-00FH-0D0 تمام سوئیچ های برگ را به هم متصل می کند،ایجاد یک پارچه درخت چربی غیر مسدود کننده با پهنای باند کامل bisection.

چیزی که باعث شد این کار به ویژه موثر باشد، تکنولوژی شارپ 2 (پروتکل جمع بندی و کاهش سلسله مراتب مقیاس پذیر) بود.که عملیات ارتباطات جمعی را مستقیماً بر روی پارچه سوئیچ اجرا می کنددر عمل این بدان معناست که عملیات کاهش همه، که قبلا چرخه های CPU میزبان و پهنای باند شبکه را مصرف می کرد،در حال حاضر در یک گذر از سراسر پارچه انجام می شود که به طور چشمگیری زمان تکمیل کار را کاهش می دهد..

بر اساسصفحه اطلاعات 920-9B110-00FH-0D0، سوئیچ کمترین تاخیر قطع 200ns را ارائه می دهد، که از نزدیک با الزامات عملکرد آزمایشگاه مطابقت دارد. تیم مهندسی همچنین تایید کرد که920-9B110-00FH-0D0 سازگارسیستم زیست محیطی شامل تمام انواع کابل ها و نوری که در حال حاضر استاندارد شده بود، نیاز به تلاش های هزینه دار برای کابل سازی را از بین می برد.

نتایج و سود قابل اندازه گیری: از تنگنایی به فعال کننده

پس از انتشار، آزمایشگاه بهبود را در چندین ابعاد مهم اندازه گیری کرد:

  • کاهش زمان تکمیل کار:تکرار آموزش برای یک مدل پارامتر 13B 35٪ کاهش یافت، با کاهش تمام تاخیر از 12μs به کمتر از 5μs برای اندازه های جمعی معمولی.
  • استفاده از شبکه:استفاده متوسط از پارچه از 58٪ به 83٪ بدون ایجاد ازدحام افزایش یافت، به لطف مکانیسم های مسیریابی سازگار و کنترل ازدحام سوئیچ.
  • بهره وری انرژی و خنک کننده:در مقایسه با پارچه EDR قبلی، زیرساخت های جدید HDR مصرف برق در هر پورت را 30٪ کاهش داده است، که به آزمایشگاه اجازه می دهد بدون تجاوز از بودجه انرژی مرکز داده خود، گره های محاسباتی بیشتری اضافه کند.

از منظر کل هزینه مالکیت،920-9B110-00FH-0D0 قیمتدر هر بندر به طور قابل توجهی کمتر از جایگزین های NDR بود، که به آزمایشگاه اجازه می دهد تا کل ساختار خود را در بودجه موجود خود ارتقا دهد.مشخصات 920-9B110-00FH-0D0همچنین منابع برق دوگانه اضافی سوئیچ و ماژول های فن قابل تعویض گرم را برجسته کرد، که به هدف آزمایشگاه از 99.999٪ در دسترس بودن برای مشاغل آموزش تولید خود کمک می کند.

مهندسان شبکه اشاره کردند که920-9B110-00FH-0D0 راه حل OPN InfiniBand switchیکپارچه با مدیر پارچه ی متحد (UFM) NVIDIA ادغام شده است، که دید متمرکز در سلامت پارچه و هشدار خودکار را فراهم می کند.این به طور قابل توجهی زمان صرف شده برای رفع مشکل و نگهداری فعال را کاهش داد، آزاد کردن تیم برای تمرکز بر بهینه سازی لوله های آموزشی خود به جای مدیریت شبکه.

خلاصه و چشم انداز: بنیاد HDR مناسب

درNVIDIA Mellanox 920-9B110-00FH-0D0انتخاب درست برای این آزمایشگاه تحقیقاتی ثابت شد، ارائه عملکرد 200Gb / s HDR در یک ساختار هزینه ای که منطقی بود. با استفاده از چگالی 40 پورت سوئیچ،قابلیت های محاسباتی در شبکه، و ویژگی های مدیریت قوی، آزمایشگاه شبکه خود را از یک گلوی فشرده عملکرد به یک پایه مقیاس پذیر برای رشد آینده تبدیل کرد.

به جلو نگاه می کنیم، آزمایشگاه برنامه ریزی می کند که کلاستر خود را به 1024 گره در 18 ماه آینده افزایش دهد. با پشتیبانی 920-9B110-00FH-0D0 از توپولوژی های بزرگتر از طریق چندین سطح ستون فقرات،آنها مطمئن هستند که شبکه آنها می تواند در کنار ظرفیت محاسباتی خود رشد کندبرای سازمان هایی که گزینه های زیرساخت های HDR خود را ارزیابی می کنند،920-9B110-00FH-0D0 برای فروشاز طریق شرکای کانال NVIDIA یک راه حل قانع کننده و معتبر تولید را ارائه می دهد که عملکرد، تراکم و هزینه را متعادل می کند.