طراحی کابل‌کشی شبکه برای رک‌های AI؛ تفاوت زیرساخت Ethernet و InfiniBand

  • فیدار کوثر
  • 1405/7/5
طراحی شبکه دیتاسنتر AI: چالش‌ها و راهکارها
طراحی کابل‌کشی شبکه برای رک‌های AI؛ تفاوت زیرساخت Ethernet و InfiniBand
 

تصمیم‌گیرندگان سازمانی، معماران شبکه و مهندسان دیتاسنتر در حال گذار از یک تغییر پارادایم بحرانی هستند؛ مهاجرت اجتناب‌ناپذیر از شبکه‌های سنتی مبتنی بر پردازشگرهای مرکزی (CPU) به کلاسترهای محاسباتی هوش مصنوعی با تراکم بالای پردازنده‌های گرافیکی (GPU).

در این مسیر، چالش بنیادین، ایجاد سازگاری میان محدودیت‌های بی‌رحمانه فیزیکی زیرساخت از جمله دفع حرارت شدید در رک‌های ۱۰۰ کیلوواتی، تراکم بالای پورت‌ها در معماری‌های Spine-Leaf، و محدودیت فواصل کابل‌کشی که توسط مدولاسیون پیشرفته PAM4 تحمیل شده‌اند با پیچیدگی‌های پروتکل‌های لایه انتقال و پیوند داده است.

مسئله اصلی در این معماری، چگونگی طراحی یک شبکه بک‌اند (Backend) با پهنای باند عظیم و کاملاً بدون اتلاف (Lossless) است.

چنین شبکه‌ای باید به گونه‌ای طراحی شود که از بروز گلوگاه‌های حرارتی (Thermal Bottlenecks)، افت فاجعه‌بار بسته‌های داده (Packet Loss) یا تأخیر شدیدی که بهره‌وری پردازنده‌های گرافیکی میلیون‌دلاری را کاهش می‌دهد، جلوگیری کند.

بار کاری هوش مصنوعی قوانین توپولوژی شبکه‌های سنتی و معماری فیزیکی رک‌ها را به طور کامل در هم می‌شکند. برای پشتیبانی کارآمد از کلاسترهای عظیم GPU، زیرساخت فیزیکی باید همگام و هماهنگ با لایه نرم‌افزار و پروتکل‌ها تکامل یابد.

این مقاله، به‌عنوان یک نقشه راه مهندسی عمیق، انطباق دقیق پروتکل‌های شبکه‌های AI با استانداردهای طراحی دیتاسنتر در سال‌های ۲۰۲۴ و ۲۰۲۶ را بررسی و تحلیل می‌کند.

 

کابل‌کشی پرسرعت سرور

 

۱. معماری دوگانه شبکه‌های AI: تفکیک Frontend و Backend

یکی از بزرگ‌ترین تصورات اشتباه در طراحی زیرساخت دیتاسنتر هوش مصنوعی، نگرش یکپارچه و مسطح (Flat Topology) به معماری شبکه است.

در محیط‌های سنتی سازمانی، ترافیک کاربری، ترافیک مدیریت ذخیره‌سازی و ترافیک محاسباتی غالباً از طریق یک شبکه همگرا (Converged) هدایت می‌شوند.

با این حال، سیستم‌های مدرن هوش مصنوعی نظیر معماری کلاسترهای NVIDIA GB200 NVL72 قانوناً به یک معماری شبکه‌ای دوگانه و کاملاً تفکیک‌شده در لایه فیزیکی و منطقی نیاز دارند.

این معماری، شبکه را به دو بخش کاملاً مجزا با رسالت‌های متفاوت تقسیم می‌کند:

  • شبکه محاسباتی (Compute Fabric) یا Backend: این فابریک منحصراً برای همگام‌سازی ترافیک بین تراشه‌های GPU طراحی شده و نیازمند پهنای باند عظیم و تأخیر قطعی و فوق‌العاده پایین (Ultra-low Latency) است. در فرآیند آموزش مدل‌های زبانی بزرگ (LLMs) و الگوریتم‌های یادگیری عمیق، فاز ارتباطی میان GPUها به شدت نسبت به تأخیر و افت بسته‌ها حساس است. بروز پدیده Jitter یا تأخیر چند میکروثانیه‌ای در این لایه باعث می‌شود چرخه‌های محاسباتی گران‌قیمت پردازنده‌ها در حالت انتظار (Idle) باقی بمانند. به همین دلیل، شبکه محاسباتی عموماً بر بستر پروتکل‌های تخصصی نظیر InfiniBand یا شبکه‌های اترنت بهینه‌سازی‌شده مستقر می‌گردد.
  • شبکه ذخیره‌سازی و مدیریت درون‌باندی (Frontend): این شبکه وظیفه مدیریت دسترسی نودهای پردازشی به آرایه‌های ذخیره‌سازی اشیاء (Object Storage)، استقرار کانتینرهای نرم‌افزاری، ارتباط کلاستر با دنیای خارج و مانیتورینگ را بر عهده دارد. ترافیک Frontend اگرچه نیازمند توان عملیاتی بالاست، اما تفکیک فیزیکی آن تضمین می‌کند که ترافیک ناگهانی (Burst) ناشی از فراخوانی داده‌های آموزشی، تداخلی در پردازش‌های حساس گرافیکی ایجاد نکرده و از پدیده تراکم درون‌ریزی (Incast Congestion) جلوگیری شود.

 

معماری شبکه هوش مصنوعی

 

۲. نبرد پروتکل‌ها در مقیاس AI: تقابل InfiniBand و Ethernet

 تفاوت اصلی میان InfiniBand و RoCEv2 برای هوش مصنوعی در چیست؟ InfiniBand یک فابریک بومیِ بدون اتلاف (Lossless) و مبتنی بر فناوری RDMA است که با استفاده از کنترل جریان مبتنی بر اعتبار (Credit-based Flow Control)، تأخیر بسیار پایینی را تضمین می‌کند؛ اما این پروتکل اساساً در انحصار یک تولیدکننده (NVIDIA) بوده و هزینه سرمایه‌ای بسیار بالایی دارد.

در مقابل، پروتکل RoCEv2 قابلیت‌های RDMA را به شبکه‌های اترنت بازگردانده و از اکوسیستم سخت‌افزاری باز پشتیبانی می‌کند؛ با این حال، حفظ ماهیت بدون اتلاف در آن نیازمند تنظیمات بسیار پیچیده و شکننده در بافرهای سوئیچ (مکانیسم‌های PFC و ECN) است تا از انسداد شبکه جلوگیری شود.

 

۲.۱ مزیت‌های ذاتی InfiniBand در پردازش‌های سنگین

پروتکل InfiniBand به عنوان استاندارد طلایی و بلامنازع برای دستیابی به کمترین تأخیر ممکن در دیتاسنترهای محاسبات با کارایی بالا (HPC) تکامل یافته است.

بر خلاف شبکه‌های اترنت که بر پایه پروتکل‌های مبتنی بر بهترین تلاش (Best-Effort) طراحی شده‌اند، InfiniBand از همان ابتدا به عنوان یک شبکه کاملاً بدون اتلاف مهندسی شده است.

مزیت بنیادین این پروتکل در معماری کنترل جریان مبتنی بر اعتبار (Credit-based Flow Control) نهفته است. در مکانیسم مبتنی بر اعتبار، پورت فرستنده پیش از ارسال هرگونه داده، موجودی اعتباری پورت گیرنده را بررسی می‌کند. این اعتبار نشان‌دهنده میزان فضای خالی در بافر گیرنده است.

فرستنده تنها زمانی بسته‌های داده را روی لینک فیزیکی ارسال می‌کند که بداند پورت گیرنده ظرفیت کافی برای پذیرش آن‌ها را دارد. این ویژگی ظریف باعث می‌شود که شبکه InfiniBand به صورت ذاتی در برابر سرریز بافر ایمن باشد. با این وجود، بزرگترین چالش در پذیرش گسترده InfiniBand، انحصار تکنولوژیک آن است.

تسلط کامل NVIDIA بر تجهیزات شبکه‌ای کلاس کوانتوم، هزینه‌های راه‌اندازی (CAPEX) را به شدت افزایش داده و سازمان‌ها را در معرض ریسک قفل‌شدگی فروشنده (Vendor Lock-in) قرار می‌دهد. این هزینه نه تنها تجهیزات اصلی، بلکه کابل‌های تخصصی مربوطه را نیز در بر می‌گیرد.

 

۲.۲ پیاده‌سازی RoCEv2؛ تلاش اترنت برای بقا در دیتاسنترهای AI

محدودیت‌های اقتصادی و نیاز به اکوسیستم‌های تأمین چند-فروشنده‌ای، صنعت را به سمت ادغام قابلیت‌های RDMA بر روی زیرساخت اترنت سوق داد.

پروتکل RoCEv2 (RDMA over Converged Ethernet Version 2) این امکان را فراهم می‌سازد که برنامه‌ها با دور زدن سیستم‌عامل (Kernel Bypass)، مستقیماً از طریق پروتکل UDP/IP به حافظه نودهای دیگر دسترسی پیدا کنند.

اما اترنت به صورت ذاتی شبکه‌ای مبتنی بر اتلاف (Lossy) است. برای تبدیل اترنت به یک فابریک بدون اتلاف، RoCEv2 نیازمند استقرار دو مکانیزم کنترلی لایه ۲ و لایه ۳ است: ECN (Explicit Congestion Notification) به عنوان سیگنال پیشگیرانه «کاهش سرعت» و PFC (Priority Flow Control) به عنوان سیگنال واکنشی و مطلق «توقف».

هشدار ایمنی: پدیده بن‌بست کنترل جریان اولویت‌دار (PFC Deadlock) خطرناک‌ترین چالش عملیاتی در شبکه‌های RoCEv2 است. مکانیسم PFC به گونه‌ای طراحی شده که هنگام پر شدن صف بافر (رسیدن به آستانه Xoff)، یک فریم PAUSE به پورت فرستنده بالادستی می‌فرستد تا ارسال داده متوقف شود. اگر آستانه‌های بافر به درستی هماهنگ نشوند، سوئیچ پیش از آنکه ECN بتواند سرعت فرستنده اصلی را کاهش دهد، فریم‌های مکث را صادر می‌کند. توقف‌ها به صورت آبشاری در کل شبکه منتقل شده و یک حلقه وابستگی متقابل ایجاد می‌کنند که به انسداد سر خط (Head-of-Line Blocking) و در نهایت فروپاشی کل فرآیند آموزش AI منجر می‌شود.

برای جلوگیری از وقوع توفان‌های توقف (Pause Storms) و بن‌بست در شبکه، تنظیم آستانه بافرها باید از یک سلسله‌مراتب دقیق مهندسی پیروی کند. قانون طلایی این است: سیگنال اخطار ECN همواره باید فرصت عمل داشته باشد و در عمق صف کمتری نسبت به سیگنال توقف PFC فعال شود.

 

مرحله بافر (Queue Depth) مکانیسم فعال‌شده در RoCEv2 عملکرد فرآیند (Action) تأثیر مهندسی بر ترافیک AI
۱. سطح پایین و امن صف‌بندی عادی (Normal Queuing) بدون اقدام؛ پکت‌ها با سرعت خط عبور می‌کنند. انتقال بی‌نقص داده‌ها با حداکثر توان عملیاتی.
۲. سطح متوسط (WRED Min) آغاز ECN Marking (مقدار باینری 11) سوئیچ فیلد ECN پکت‌ها را با مقدار باینری 11 (CE - Congestion Experienced) علامت‌گذاری می‌کند. گیرنده پیام CNP را به کارت شبکه مبدأ می‌فرستد تا سرعت به نرمی کاهش یابد.
۳. سطح بحرانی (WRED Max) علامت‌گذاری ۱۰۰٪ ECN تمامی پکت‌های عبوری این کلاس ترافیک با مقدار باینری 11 علامت‌گذاری می‌شوند. کاهش شدید، فوری و پیشگیرانه سرعت ارسال پیش از نیاز به توقف کامل.
۴. آستانه توقف (PFC Xoff) Priority Flow Control (PFC) ارسال پیام فیزیکی PAUSE به پورت سوئیچ یا سرور قبلی. توقف کامل و سخت ترافیک. آخرین خط دفاعی برای جلوگیری از Drop.
۵. فضای حاشیه (Headroom) جذب پکت‌های در حال پرواز ذخیره پکت‌هایی که روی کابل بوده‌اند پیش از رسیدن پیام توقف. جلوگیری فیزیکی از سرریز صف (بر اساس طول کابل و تأخیر محاسبه می‌شود).
۶. آستانه افت (Drop Limit) Packet Drop حذف فیزیکی پکت‌ها از بافر سخت‌افزاری سوئیچ. شکست مطلق معماری Lossless؛ توقف همگام‌سازی GPU.
نتیجه‌گیری مهندسی: شبکه‌های RoCEv2 یک راه‌حل Plug-and-Play نیستند. در استقرار سوئیچ‌های ۵۱.۲ ترابیتی، مکانیسم ECN باید به عنوان خط دفاعی اولیه، واکنش نرم و پویایی از خود نشان دهد، در حالی که PFC باید تنها به عنوان یک ترمز اضطراری عمل نماید. معکوس شدن این سلسله‌مراتب به دلیل تنظیمات نادرست، عامل اصلی شکست پروژه‌های زیرساخت AI سازمانی بر بستر اترنت است.

 

۳. ظهور Ultra Ethernet (UEC)؛ آینده شبکه‌های اپن‌سورس AI

ائتلاف Ultra Ethernet Consortium با انتشار مشخصات نسخه 1.0.3 خود در سال ۲۰۲۶، نقشه راه قطعی شبکه‌های دیتاسنتر را ترسیم کرد.

این پروتکل به جای تلاش بی‌فرجام برای بی‌نقص کردن شبکه‌های RoCEv2 از طریق پیچیدگی‌های PFC، لایه انتقال شبکه را به طور اساسی بازطراحی کرده و پروتکل UET (Ultra Ethernet Transport) را معرفی نمود.

اصلی‌ترین و انقلابی‌ترین نوآوری UEC در لایه انتقال، جایگزینی روش سنتی ECMP (Equal-Cost Multi-Path) با تکنولوژی پیشرفته پاشش بسته‌ها یا Packet Spraying است. در معماری ECMP، الگوریتم‌های هشینگ ترافیک (Flow Hashing) تمام ترافیک متعلق به یک نشست را تنها از یک مسیر فیزیکی عبور می‌دهند.

 

طراحی کابل‌کشی شبکه برای رک‌های AI

 

در کلاسترهای AI که با «فلوهای عظیم» (Elephant Flows) سر و کار دارند، تجمیع چند فلو روی یک لینک باعث اشباع آن پورت می‌شود، در حالی که لینک‌های موازی خالی می‌مانند.

پروتکل UET با استفاده از Packet Spraying، داده‌های متعلق به یک نشست را به صورت بسته به بسته تجزیه کرده و آن‌ها را به طور یکنواخت بر روی تمام Uplinkها اسپری می‌کند.

از آنجا که این کار باعث می‌شود بسته‌ها با تأخیرهای متفاوت و خارج از ترتیب (Out-of-order) به مقصد برسند، سیلیکون‌های اختصاصی UEC با استفاده از بافرهای بازآرایی (Reorder Buffers) در لایه سخت‌افزار، بسته‌ها را به سرعت مرتب کرده و به حافظه تحویل می‌دهند.

 

معیار مقایسه و ارزیابی InfiniBand (NDR/X800) Ethernet (RoCEv2) Ultra Ethernet (UEC)
مکانیسم کنترل احتقان مبتنی بر اعتبار؛ ذاتاً Lossless ECN (هشدار) + PFC (توقف) UET (کنترل متمرکز بر مبدأ)
معماری چندمسیری مسیریابی تطبیقی در سخت‌افزار متکی بر ECMP Packet Spraying
اکوسیستم و استاندارد بسته و تحت سلطه یک تولیدکننده (NVIDIA) استاندارد IEEE و Multi-Vendor کنسرسیوم جهانی Vendor-Neutral
بزرگترین ریسک معماری CAPEX فوق‌العاده بالا و انحصار خطر PFC Deadlock و ناپایداری ریسک بلوغ فاز پذیرش اولیه

 

۴. استانداردهای طراحی فیزیکی ۲۰۲۴: الزامات TIA-942-C و BICSI 002

 استاندارد TIA-942-C چه الزاماتی برای ابعاد رک‌های دیتاسنتر مشخص کرده است؟ بر اساس ویرایش ماه می ۲۰۲۴ از استاندارد ANSI/TIA-942-C، تمامی کابینت‌های مخابراتی که در مناطق توزیع شبکه شامل منطقه توزیع اصلی (MDA)، توزیع میانی (IDA) و توزیع افقی (HDA) مستقر می‌شوند، قانوناً باید حداقل ۸۰۰ میلی‌متر عرض داشته باشند.

این الزام برای ایجاد فضای کافی جهت مدیریت حجم انبوه کابل‌های شبکه وضع شده تا از انسداد جریان هوای تجهیزات پردازشی جلوگیری گردد.

 

۴.۱ الزام رک‌های ۸۰۰ میلی‌متری و فیزیک مدیریت حرارت

استاندارد مرجع: استاندارد ANSI/TIA-942-C (بازنگری ۲۰۲۴) به صراحت بیان می‌دارد که استفاده از رک‌های استاندارد ۶۰۰ میلی‌متری سرور برای توزیع شبکه در مناطق توزیع اصلی (MDA)، میانی (IDA) و افقی (HDA) ممنوع بوده و حداقل عرض مجاز در این نواحی به ۸۰۰ میلی‌متر ارتقاء یافته است.

دلیل فیزیکی این الزام استانداردی، ریشه در چالش‌های حرارتی دارد. در دیتاسنترهای مقیاس‌پذیر AI، کابل‌های مسی 800G DAC و کابل‌های نوری اکتیو (AOC) بسیار ضخیم‌تر و متراکم‌تر از کابل‌های نسل پیشین هستند.

انباشته شدن این حجم از کابل‌ها در کانال‌های جانبی محدود رک‌های ۶۰۰ میلی‌متری، پدیده‌ای خطرناک به نام سد جریان هوا (Airflow Dam) را به وجود می‌آورد.انسداد پنل‌های ورودی و خروجی هوا باعث بازگشت هوای گرم (Hot Air Recirculation) به داخل تجهیزات شده و دستگاه‌های تهویه مطبوع را وادار می‌کند با حداکثر توان کار کنند.

این مسئله می‌تواند بهره‌وری سیستم خنک‌کننده را بین ۲۰٪ تا ۳۰٪ کاهش دهد و به پدیده افت توان حرارتی (Thermal Throttling) در تراشه‌های GPU منجر شود. رک‌های ۸۰۰ میلی‌متری با فراهم آوردن فضای اختصاصی، مسیر تهویه تجهیزات را کاملاً باز نگه می‌دارند.

 

۴.۲ مدیریت جریان هوا و زیرساخت فیزیکی بر اساس BICSI 002-2024

استاندارد ANSI/BICSI 002-2024 مکمل الزامات TIA بوده و دستورالعمل‌های سخت‌گیرانه‌ای برای زیرساخت اعمال می‌کند.

این استاندارد تأکید دارد کابل‌کشی توان الکتریکی باید در راهروی سرد (Cold Aisle) و کابل‌کشی داده باید در راهروی گرم (Hot Aisle) مسیردهی شوند.این تفکیک فیزیکی هم تداخل الکترومغناطیسی (EMI) را در کابل‌های مسی کاهش می‌دهد و هم مانع از اثرات مخرب حرارت بالا بر روی سیگنال‌های نوری می‌گردد.

همچنین، BICSI 002-2024 ضمیمه‌های تخصصی جدیدی را به طور خاص برای پشتیبانی فیزیکی از لوله‌کشی سیستم‌های خنک‌کننده غوطه‌وری مایع (Liquid Immersion) و سیستم‌های مایع مستقیم به تراشه (Direct-to-Chip Cooling) معرفی کرده است.

 

حوزه الزامات زیرساخت مهندسی ANSI/TIA-942-C (ویرایش می ۲۰۲۴) ANSI/BICSI 002-2024
ابعاد رک‌های شبکه و توزیع الزام عرض 800mm برای کابینت‌های MDA, IDA و HDA تمرکز بر مدیریت فیزیکی کابل برای جلوگیری از انسداد عبور هوا
تکنولوژی کانکتورهای فیبر صدور مجوز استفاده از کانکتورهای بسیار کوچک (VSFF) تعیین دقیق عمق مسیرهای کابلی در زیر کف کاذب
طراحی فیزیکی مسیرهای کابل توصیه به استفاده از فیبرهای تک‌حالته G.657.A1 (مقاوم در برابر خمش) برای داخل رک و OS2 برای بین‌ردیف‌ها الزام قطعی تفکیک کابل‌های برق در راهروی سرد و دیتا در راهروی گرم
خنک‌سازی و مدیریت حرارت هماهنگی با کلاس H1 از استانداردهای حرارتی ASHRAE معرفی ضوابط پشتیبانی فیزیکی از خنک‌کننده‌های مایع

 

جریان هوای رک شبکه

 

۵. چالش لایه فیزیکی: انتخاب کابل‌ها و ماژول‌های اپتیکال 800G

گذر از لایه منطقی به واقعیت‌های فیزیکی، نیازمند درک عمیق از محدودیت‌های سیگنالینگ سرعت بالا در دیتاسنترهای AI است.

 

۵.۱ چرا برد کابل‌های مسی (DAC) در شبکه‌های AI شدیداً محدود شده است؟

بر اساس مشخصات تعیین‌شده در استاندارد IEEE 802.3ck، دستیابی به سرعت 800G از طریق انتقال ۱۰۰ گیگابیت بر ثانیه در هر مسیر فیزیکی (100G-per-lane) و استفاده از مدولاسیون پالس دامنه ۴ سطحی (PAM4) صورت می‌پذیرد.

در این مدولاسیون، نرخ ارسال نماد به 53.125 GBaud می‌رسد.فشردگی ۴ سطح ولتاژ در یک سیکل فرکانسی باعث می‌شود چشم سیگنال به شدت کوچک شده و حساسیت به نویز و تداخل الکترومغناطیسی افزایش یابد. در این فرکانس‌ها، افت درج (Insertion Loss) کانال‌های مسی به شدت بالا می‌رود. به همین دلیل، استاندارد IEEE به صورت فیزیکی و قطعی، برد کابل‌های پسیو Direct Attach Copper (DAC) را در سرعت‌های 100G/Lane نهایتاً به حدود ۲ متر محدود ساخته است.

استفاده از کابل‌های مسی بیش از این طول، باعث افت شدید نسبت سیگنال به نویز (SNR) شده و لینک شبکه مدام دچار قطعی می‌شود. این محدودیت بنیادین، کابل‌های مسی DAC را منحصراً به اتصالات داخل رک (مانند سوئیچ ToR به سرورها) محدود می‌سازد و برای فواصل طولانی‌تر باید از کابل‌های مسی اکتیو (AEC) یا کابل‌های نوری (AOC/Transceivers) استفاده کرد.

 

۵.۲ نبرد ترنسیورها: OSFP در برابر QSFP-DD در محیط‌های 800G

 چرا فرم‌فاکتور OSFP برای شبکه‌های متراکم هوش مصنوعی 800G نسبت به QSFP-DD برتری مهندسی دارد؟ ماژول‌های OSFP از نظر فیزیکی ابعاد بزرگتری دارند و با بهره‌گیری از هیت‌سینک خنک‌کننده یکپارچه در ساختار خود، می‌توانند توانی پیوسته بین ۱۵ تا ۲۵ وات را به صورت کاملاً ایمن به هوا منتقل کنند.

این ظرفیت دفع حرارتی برتر، در کلاسترهای پرتراکم هوش مصنوعی از پدیده کاهش سرعت به دلیل حرارت (Throttling) جلوگیری می‌کند.

در مقابل، فرم‌فاکتور QSFP-DD عموماً به دفع حرارتی ۱۲ تا ۲۰ وات محدود است و در توان‌های بالا ریسک سوختن لیزرهای نوری را افزایش می‌دهد.

 

مشخصه فنی لایه فیزیکی ماژول OSFP ماژول QSFP-DD
ظرفیت حداکثر مصرف و حرارت ۱۵ وات تا بیش از ۲۵ وات (تا ۳۳ وات در XD) محدود به حدود ۱۲ وات تا حداکثر ۲۰ وات
معماری طراحی فیزیکی دارای پره‌های هیت‌سینک یکپارچه (Integrated fins) متکی به هیت‌سینک سوار بر قفسه سوئیچ (Riding heatsink)
سازگاری با پورت‌های نسل قبل نیازمند آداپتور مبدل سازگاری کاملاً مستقیم با پورت‌های QSFP28
استراتژی مورد استفاده ایده‌آل شبکه‌های Hyperscale AI و آمادگی کامل برای گذار به 1.6T ارتقاء به 400G/800G با حفظ زیرساخت موجود و هزینه کمتر
نتیجه‌گیری مدیریتی: استانداردسازی بر روی پورت‌های QSFP-DD به دلیل مزیت‌های سازگاری (Backward Compatibility) وسوسه‌انگیز است؛ اما این تصمیم در محیط‌های متراکم AI سازمان را با محدودیت‌های شدید حرارتی مواجه ساخته و مانع از پشتیبانی ایمن از تجهیزات نسل آینده (1.6T) می‌شود. انتخاب OSFP ریسک ارتقاء مجدد و پرهزینه در سطح تجهیزات هسته شبکه را در سال‌های آتی کاهش می‌دهد.

 

ماژول اپتیکال OSFP

 

۶. استراتژی فیدارکوثر در طراحی زیرساخت دیتاسنتر AI و چارچوب تصمیم‌گیری

پیاده‌سازی دیتاسنتری که بتواند توان مصرفی خیره‌کننده، ماژول‌های نوری با حرارت ۲۵ وات، کابل‌های حجیم و پروتکل‌های شکننده لایه انتقال را به صورت همزمان مدیریت کند، نیازمند تخصصی جامع در حوزه‌های ترمودینامیک و فیزیک سیگنال است.

موفقیت زیرساخت نرم‌افزاری کاملاً در گرو استقرار فیزیکی بی‌نقص است. گروه فیدارکوثر با تسلط بر الزامات بین‌المللی از جمله استانداردهای TIA-942-C و BICSI 002، نقشه‌های مهندسی زیرساخت را به راه‌حل‌های کاملاً اجرایی در پروژه‌های انترپرایز و در سطح طراحی کابل‌کشی دیتاسنتر کانتینری تبدیل می‌کند.

مدیران فناوری می‌توانند از طریق سرویس زیرساخت های دیتاسنتر و ابزارهای محاسبه دقیق این شرکت، تخمین کارآمدی از بودجه حرارتی و نیازمندی‌های شبکه به دست آورند.

چارچوب تصمیم‌گیری فابریک شبکه در پروژه‌های AI:

  • انتخاب InfiniBand: مناسب برای کلاسترهای یکپارچه NVIDIA (نظیر H100 و B200) که نیازمند کمترین تأخیر مطلق هستند و بودجه سرمایه‌ای (CAPEX) لازم برای تأمین انحصاری را در اختیار دارند.
  • انتخاب RoCEv2: مناسب برای شبکه‌هایی با سخت‌افزارهای چند-فروشنده‌ای که دارای تیم متخصص شبکه جهت تنظیمات میلی‌متری بافرهای سوئیچ و پیشگیری از PFC Deadlock هستند.
  • انتخاب Ultra Ethernet (UEC): راهکار استراتژیک برای توسعه دیتاسنترها در افق ۲۰۲۶ به بعد؛ مناسب برای سازمان‌هایی که خواهان پهنای باند اترنت همراه با پایداری مکانیزم پاشش بسته‌ها (Packet Spraying) برای رهایی از شکنندگی‌های RoCEv2 می‌باشند.

طراحی و پیاده‌سازی زیرساخت‌های استاندارد هوش مصنوعی

کلاسترهای محاسباتی AI نیازمند طراحی دقیق حرارتی، توانمند و کاملاً منطبق با استانداردهای فیزیکی و شبکه‌ای روز دنیا هستند. گروه مهندسی فیدارکوثر آماده است تا با ارائه مشاوره تخصصی، دیتاسنتر شما را برای نسل بعدی پردازش‌های سنگین تضمین و مقاوم‌سازی کند.

درخواست مشاوره تخصصی و ارزیابی زیرساخت

     

نظرات :
ارسال نظر :

بعد از ورود به حساب کاربری می توانید دیدگاه خود را ثبت کنید