راه حل فنی سوئیچ InfiniBand Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0

July 15, 2026

راه حل فنی سوئیچ InfiniBand Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0

Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 راه حل فنی سوئیچ InfiniBand. بهینه سازی اتصال با تاخیر پایین برای خوشه های RDMA / HPC / AI

1. پیش زمینه پروژه و تجزیه و تحلیل نیازهای

چارچوب های آموزشی هوش مصنوعی مدرن و برنامه های کاربردی HPC به طور فزاینده ای توسط عملکرد اتصال شبکه به جای تراکم محاسبات محدود می شوند.شغل های آموزش توزیع شده ٬ به ویژه آنهایی که از مدل های زبان بزرگ استفاده می کنند ٬، الگوهای ترافیک همگام تمام کاهش و همه به همه که پارچه های سنتی اترنت را مغلوب می کنند. الزامات کلیدی شناسایی شده در سراسر پیاده سازی های سازمانی عبارتند از:تاخیر سوئیچ زیر میکرو ثانیه برای به حداقل رساندن هزینه های ارتباطی، بدون مسدود کردن سرعت در مقیاس برای از بین بردن اشتراک بیش از حد، کنترل فشرده سازی پیشرفته برای رسیدگی به انفجار های افزوده،و یکپارچه سازی با RDMA از طریق اترنت همگرا (RoCE) یا اکوسیستم های بومی InfiniBandعلاوه بر این، تیم های عملیاتی نیاز به تله متری عمیق برای تشخیص خطای فعال و مدیریت ساده در صدها بندر دارند.

2طراحی کلی معماری شبکه/سیستم

معماری پیشنهادی بر روی یک توپولوژی دو لایه برگ ستون فقرات متمرکز است که به طور خاص برای بار های کاری متمرکز بر GPU ساخته شده است.ملانوکس (NVIDIA Mellanox) 920-9B210-00FN-0D0به عنوان سوئیچ اصلی ToR (Top-of-Rack) ، اتصال تا 40 گره محاسباتی از طریق پیوندهای NDR 400Gb / s. لایه ستون فقرات شامل یک لایه دوم از920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDRسوئیچ هایی که قابلیت اتصال کامل با 4: 1 oversubscription یا کاملا غیر مسدود کننده در صورت استفاده از پورت های ستون فقرات کافی را فراهم می کنند.این طراحی از 512 گره GPU در یک دامنه پارچه واحد پشتیبانی می کند، با گزینه مقیاس افقی از طریق چند زیر شبکه متصل به یکدیگر از طریق UFM NVIDIA (Unified Fabric Manager).

این معماری از موتور محاسبات شبکه SHARPv3 (پروتکل جمع آوری و کاهش سلسله مراتب مقیاس پذیر) NVIDIA استفاده می کند و عملیات جمعی را مستقیماً بر روی سوئیچ ASIC بارگذاری می کند.این باعث کاهش حجم داده هایی می شود که از طریق بس های حافظه CPU / GPU عبور می کنند و تاخیر عملیات جمعی را تا 40٪ در مقایسه با رویکردهای مبتنی بر نرم افزار کاهش می دهد.920-9B210-00FN-0D0 InfiniBand سوئیچ OPNهمچنین از مسیریابی انطباقی پشتیبانی می کند که به طور پویا مسیر کمترین ازدحام را برای هر بسته انتخاب می کند، اطمینان از استفاده بهینه از پهنای باند حتی تحت بار ترافیک نامتقارن.

3نقش و ویژگی های کلیدی 920-9B210-00FN-0D0 در راه حل

درNVIDIA Mellanox 920-9B210-00FN-0D0به عنوان یک بلوک ساختمانی پایه ای برای کل بافت اتصال به هم عمل می کند. نقش اصلی آن عبارت است از:

  • جمع بندی با چگالی بالا:با 64 پورت غیر مسدود کننده 400Gb / s در یک فاکتور فرم 2U، سوئیچ ظرفیت سوئیچ کلی 25.6 Tb / s را ارائه می دهد. این تراکم تعداد سوئیچ های مورد نیاز در هر قفسه را کاهش می دهد،ساده سازی کابل و کاهش مصرف برق در هر بندر.
  • سوئیچینگ با تاخیر بسیار کم:سوئیچ تاخیر کمتر از 600ns را برای هر اندازه بسته حفظ می کند، که برای برنامه های حساس به تاخیر دم مانند نتیجه گیری آنلاین و HPC مالی بسیار مهم است.
  • محاسبات درون شبکه:ادغام SHARPv3 امکان تسریع سخت افزاری عملیات جمعی را فراهم می کند، تعداد عبور در سراسر بافت را کاهش می دهد و زمان تکمیل کل کار را تا 30٪ بهبود می بخشد.
  • تلمتري پیشرفته و کنترل ازدحام:این سوئیچ قابلیت مشاهده هر جریان را فراهم می کند و جریان های مخرب را برای تنظیمات میزبان نشان می دهد و هشدار زودهنگام نقاط گرم را امکان پذیر می کند.

بر اساسصفحه اطلاعات 920-9B210-00FN-0D0، سوئیچ از هر دو گیرنده QSFP-DD مس و نوری پشتیبانی می کند، و آن را920-9B210-00FN-0D0 سازگاربا زیرساخت های کابل سازی موجود در اکثر مراکز داده. جریان هوا از جلو به عقب و منابع برق اضافی، در محیط های سازمانی دسترسی بالایی را تضمین می کند.

4توصیه های استقرار و مقیاس بندی (توپولوژی معمولی)

برای استفاده از 128 گره گرافیکی، ما یک معماری دو طبقه با 4 سوئیچ برگ و 2 سوئیچ ستون فقرات را توصیه می کنیم.هر ستون فقرات با هر برگ از طریق 4x400Gb / s uplinks ٪ به نتیجه می رسد۱: ۱ نسبت اشتراک بیش از حد، که برای اکثر بارهای کاری آموزش قابل قبول است.طراحی غیر مسدود کننده را می توان با افزایش تعداد ستون فقرات به 4 مورد به دست آورد.، که باعث می شود یک ظرفیت کل uplink برابر با پورت های downlink باشد.

مقیاس گذاری فراتر از 512 گره نیاز به تقسیم پارچه به زیر شبکه های متعدد دارد که هر کدام توسط UFM به عنوان یک جزیره پارچه متمایز مدیریت می شوند.ارتباطات بین زیر شبکه ها را می توان از طریق دروازه های کوانتوم 2 NVIDIA یا از طریق مسیریابی مبتنی بر میزبان هدایت کرد، اگرچه رویکرد توصیه شده برای بارهای کاری حساس به عملکرد این است که بافت را در یک زیر شبکه واحد در هر کجا که ممکن است نگه دارید.مشخصات 920-9B210-00FN-0D0پشتیبانی از این توپولوژی های مقیاس بزرگ، با کنترل جریان داخلی و کنترل جریان مبتنی بر اولویت (PFC) برای جلوگیری از سقوط بسته در طول رویدادهای تغییر مسیر.

هنگام برنامه ریزی کابل سازی فیزیکی، استفاده از کابل های MPO-to-QSFP-DD برای اتصالات ستون فقرات را برای کاهش تراکم کابل یا کابل های نوری فعال (AOC) برای مسافت های بالاتر از 3 متر در نظر بگیرید.920-9B210-00FN-0D0 برای فروشبه طور معمول شامل یک کیت لوازم جانبی جامع است، اما توصیه می کنیم سازگاری گیرنده های شخص ثالث را از طریق ماتریس تعاملی فروشنده تأیید کنید تا از مشکلات آموزش پیوند جلوگیری شود.

5عملیات، نظارت و تشخیص خطاها

برتری عملیاتی یک سنگ بنای920-9B210-00FN-0D0 راه حل OPN InfiniBand switch. سوئیچ به طور یکپارچه با پلت فرم UFM NVIDIA ادغام می شود که ارائه می دهد:

  • نظارت بر سلامت پارچه در زمان واقعی:داشبورد ها برای وضعیت پیوند، دمای، مصرف برق و شمارنده های خطای هر پورت (CRC، نماد و خطاهای تراز).
  • تجزیه و تحلیل شکست پیش بینی:مدل های یادگیری ماشین بر روی UFM به طور فعال اپتیک های شکست خورده یا پیوندهای خراب شده را قبل از اینکه منجر به شکست در کار شوند، شناسایی می کنند.
  • راه حل مشکلات خودکار:این سیستم اقدامات اصلاحی را توصیه می کند، مانند تغییر مسیر ترافیک یا جدا کردن پیوندهای معیوب، که به طور قابل توجهی میانگین زمان حل (MTTR) را کاهش می دهد.

برای تشخیص پیشرفته، سوئیچ از sFlow و آینه سازی پورت پشتیبانی می کند و امکان بررسی عمیق بسته برای اشکال زدایی در سطح پروتکل را فراهم می کند. تیم ها همچنین می توانند به جزئیات دسترسی داشته باشند.مشخصات 920-9B210-00FN-0D0برای آستانه های بافر و تنظیمات توصیه شده، به ویژه برای تنظیم ترافیک RoCEv2 اگر در محیط های ترکیبی InfiniBand/Ethernet استفاده شود.تنظیم عملکرد باید بر روی آستانه های مسیریابی سازگار و فواصل جمع آوری SHARPv3 تمرکز کند، که می تواند برای هر مرحله از بار کار تنظیم شود، به عنوان مثال آموزش در مقابل نتیجه گیری.

نگهداری معمول شامل به روزرسانی نرم افزار است که با حداقل اختلال با استفاده از قابلیت ارتقاء روانه UFM انجام می شود.و تمیز کردن دوره ای از کانکتورهای نوری برای حفظ یکپارچگی سیگنال. قدرت اضافی سوئیچ و ماژول های فن اجازه می دهد تا تعویض گرم در طول کار.

6خلاصه و ارزیابی ارزش

درملانوکس (NVIDIA Mellanox) 920-9B210-00FN-0D0ارائه یک راه حل جامع برای سازمان هایی که به دنبال باز کردن عملکرد کامل سرمایه گذاری های هوش مصنوعی و HPC خود هستند. با ترکیب سرعت های NDR 400Gb / s، محاسبات در شبکه،و مدیریت ترافیک هوشمند در یک سیستم واحد، پلت فرم مقیاس پذیر، آن را به چالش های متقابل ارتباط با مرکز داده های امروز مواجه می کند. معماری توصیف شده یک مسیر اثبات شده از خوشه های آزمایشی 128 گره به 2،پارچه های سوپر کامپیوتری، با ابزارهای عملیاتی که مدیریت را ساده می کنند و کل هزینه مالکیت را کاهش می دهند.

در هنگام ارزیابی920-9B210-00FN-0D0 قیمت، ارزش بلند مدت را در نظر بگیرید: زمان های تکمیل کار کاهش یافته به طور مستقیم به هزینه های پایین تر ابر یا زمان سریع تر برای بار های کاری در محل تبدیل می شود.920-9B210-00FN-0D0 راه حل OPN InfiniBand switchتوسط شبکه پشتیبانی جهانی NVIDIA و اکوسیستم شرکای گسترده پشتیبانی می شود، که تضمین می کند سازمان ها می توانند با اطمینان زیرساخت های خود را برای سال های آینده مستقر، مقیاس پذیر و بهینه کنند.


برای برنامه ریزی دقیق، مراجعه کنید به رسمیصفحه اطلاعات 920-9B210-00FN-0D0ومشخصات 920-9B210-00FN-0D0سندی که شامل نقشه های مکانیکی، پروفایل های حرارتی و معیارهای عملکردی است.