طراحی AI Pod در دیتاسنتر ماژولار؛ بررسی جامع اجزای Power، Cooling، Rack و Network

  • فیدار کوثر
  • 1405/7/12
بررسی تفاوت AI Pod با دیتاسنترهای کانتینری سنتی
طراحی AI Pod در دیتاسنتر ماژولار؛ بررسی جامع اجزای Power، Cooling، Rack و Network
 

فهرست مطالب

۱. گذار از دیتاسنترهای سنتی به معماری AI Pod

تحلیل‌های استراتژیک و بررسی‌های عمیق مهندسی در زیرساخت‌های پردازشی نشان می‌دهد که صنعت دیتاسنتر در حال تجربه یک تغییر پارادایم بنیادین و استراتژیک است. در دهه‌های گذشته و در دیتاسنترهای کلاسیک، واحد پایه طراحی و استقرار، یک «سرور مجزا» یا نهایتاً یک رک استاندارد با توان مصرفی ۵ الی ۱۵ کیلووات بود.

در آن معماری، هر سرور به عنوان یک موجودیت مستقل عمل می‌کرد و زیرساخت فیزیکی تنها وظیفه تامین فضای استقرار، برق متناوب و تهویه هوای سرد را بر عهده داشت. اما با ظهور مدل‌های زبانی بزرگ (LLMs) با صدها میلیارد پارامتر و نیاز به پردازش‌های تانسوری به شدت پیچیده، این رویکرد سنتی پاسخگو نیست.

امروزه، واحد پایه استقرار زیرساخت محاسباتی هوش مصنوعی به یک "واحد محاسباتی اتمیک و یکپارچه" به نام AI Pod تغییر یافته است.

 

۱.۱ تفاوت معماری AI Pod با دیتاسنترهای کانتینری سنتی

کانتینرهای سنتی غالباً محفظه‌هایی فیزیکی (ISO Containers) برای استقرار تجهیزات استاندارد فناوری اطلاعات با سیستم‌های تهویه هوایی و PDUهای متداول هستند.

در مقابل، یک AI Pod یک بلوک ساختمانی یکپارچه، از پیش‌مهندسی‌شده و تکرارپذیر است که توزیع برق متراکم (نظیر باس‌بارهای دی‌سی ۴۸ ولت)، سرمایش مایع مستقیم تراشه (با استفاده از سیستم‌های ایزوله CDU)، و فابریک شبکه‌های پردازش موازی در آن به صورت سیستمیک در هم تنیده شده‌اند.

این مهندسی یکپارچه، امکان مدیریت بار حرارتی بیش از ۱۲۰ کیلووات در هر رک را فراهم کرده و تأخیرهای پردازشی را به حداقل می‌رساند. اصل اساسی در این معماری، تکرارپذیری (Repeatability) قطعی است؛ طراحی باید به گونه‌ای مهروموم و استاندارد شده باشد که نصب پاد دهم در سایت، دقیقاً مشابه نصب پاد اول باشد و نیازی به مهندسی مجدد در محل استقرار وجود نداشته باشد.

جدول زیر مقایسه‌ای شفاف میان معماری‌های رایج زیرساخت برای درک بهتر این جهش تکنولوژیک ارائه می‌دهد:

ویژگی / شاخص ارزیابی دیتاسنتر سنتی (Enterprise) دیتاسنتر ماژولار استاندارد معماری پردازشی AI Pod
واحد پایه استقرار سرور مجزا یا رک‌های پراکنده کانتینرهای ISO مجهز به IT بلوک یکپارچه محاسباتی اتمیک
چگالی حرارتی (توان رک) ۵ الی ۱۵ کیلووات تا ۳۰ الی ۴۰ کیلووات بیش از ۱۲۰ کیلووات
فناوری اصلی سرمایش هوایی (CRAC/CRAH) هوایی + سیستم‌های In-Row سرمایش مایع مستقیم (CDU و TCS)
توپولوژی شبکه Spine-Leaf کلاسیک Spine-Leaf مقیاس‌پذیر Rail-Optimized (بدون انسداد)

 

پاد پردازشی یکپارچه

 

۲. محدودیت‌های فیزیکی و ظهور استاندارد OCP ORv3 در ساختار Rack

جهش چگالی توان از میانگین دیتاسنترهای کلاسیک به ارقام نجومی ۱۲۰ تا ۱۵۰ کیلووات در هر رک برای کلاسترهای نسل جدید، استفاده از رک‌های استاندارد ۱۹ اینچی مبتنی بر استاندارد EIA-310 را با چالش‌های جدی مکانیکی، الکتریکی و حرارتی مواجه کرده است.

برای پاسخگویی به این تراکم متمرکز، معماری Open Rack Version 3 (ORv3) که تحت نظارت پروژه محاسبات باز (Open Compute Project) تدوین شده، به عنوان استاندارد برتر در طراحی AI Podها پذیرفته شده است.

 

۲.۱ معماری مکانیکی و ابعاد رک‌های ORv3

استاندارد ORv3 عرض داخلی رک را از ۱۹ اینچ به ۲۱ اینچ افزایش داده و عمق آن را برای پذیرش تجهیزات حجیم‌تر توسعه داده است. این فضای افزوده صرفاً یک تغییر هندسی نیست، بلکه فضایی استراتژیک برای ادغام باس‌بارهای توان بالا (Busbars) در قسمت پشتی رک و استقرار منیفولدهای عمودی انتقال سیال خنک‌کننده فراهم می‌آورد.

در پلتفرم‌های پرچمدار هوش مصنوعی نظیر NVIDIA GB200 NVL72، وزن یک رک مایع‌خنک با احتساب سرورها، شینه‌های مسی، منیفولدهای پر از مایع و سوییچ‌ها می‌تواند بین ۱۳۶۰ تا بیش از ۲۲۰۰ کیلوگرم باشد. این بار متمرکز (Point Load) نیازمند بازنگری کامل در محاسبات بارگذاری کف (Floor Loading) است.

شاسی‌های تقویت‌شده با تحمل بار استاتیک بیش از ۱۵۰۰ کیلوگرم بر متر مربع، پیش‌نیاز قطعی استقرار یک AI Pod محسوب می‌شوند.

 

۲.۲ مکانیزم‌های Blind-Mate و اتصالات هیدرولیک UQD

در سطح عملیاتی، یکی از بزرگترین خطرات در سیستم‌های مبتنی بر سرمایش مایع مستقیم تراشه (Direct-to-Chip Liquid Cooling)، خطر نشت سیال در هنگام سرویس و خروج سرورها است. استاندارد OCP برای رفع این چالش، استفاده از کانکتورهای Universal Quick Disconnect (UQD) با طراحی نصب کور (Blind-mate) را نهادینه کرده است.

در این معماری، شاسی سرور به صورت کشویی وارد رک شده و با هدایت ریل‌های مکانیکی، اتصالات هیدرولیک UQD با خطای انطباق جبران‌شونده تا ۶.۴ میلی‌متر، به طور خودکار درون منیفولد عمودی قفل می‌شوند. همزمان، کانکتورهای برق نیز متصل می‌گردند.

این معماری مهندسی‌شده ریسک نشتی مایع در هنگام سرویس را به حداقل ممکن می‌رساند و تجهیزات با سرعت درج تا یک متر بر ثانیه بدون آسیب به سیستم متصل می‌گردند.

 

رک استاندارد OCP

 

نتیجه‌گیری مهندسی: طراحی فیزیکی AI Pod دیگر محدود به محفظه فلزی نیست. گذر از رک‌های ۱۹ اینچی به شاسی‌های ۲۱ اینچی ORv3 با وزن بالغ بر ۲ تن، نیازمند یکپارچگی مهندسی سازه، مکانیک سیالات در اتصالات UQD و محاسبات دقیق بارگذاری کف است.

 

۳. معماری توزیع توان (Power Architecture) و مهار نوسانات الکتریکی

پردازنده‌های گرافیکی به دلیل ماهیت پردازش‌های ماتریسی موازی، دارای رفتار الکتریکی به شدت دینامیکی هستند. این رفتار، شبکه‌های توزیع برق سنتی متکی به ولتاژ متناوب را تا مرز ناپایداری پیش می‌برد.

 

۳.۱ چرا رک‌های هوش مصنوعی به باتری‌های پشتیبان (BBU) نیاز دارند؟

پردازنده‌های گرافیکی در کمتر از چند میلی‌ثانیه از حالت غیرفعال به حداکثر مصرف می‌‌رسند. UPSهای سنتی دیتاسنتر برای پاسخگویی به این تغییرات سریع بهینه‌سازی نشده‌اند؛ از این رو، استقرار باتری‌های پشتیبان (BBU) درون رک در معماری‌های OCP برای جذب این شوک‌ها و حفظ پایداری سیستم حیاتی است.

 

۳.۲ توزیع توان ۴۸ ولت دی‌سی و مشخصات باس‌بارهای OCP

انتقال توانی معادل ۱۲۰ کیلووات با ولتاژ ۱۲ ولت کلاسیک، نیازمند جریانی بالغ بر ۱۰۰۰۰ آمپر در هر رک است که منجر به تلفات حرارتی شدید (I²R) می‌شود. معماری OCP ORv3 این چالش را با ارتقای ولتاژ درون‌رک به ۴۶ الی ۵۲ ولت دی‌سی حل کرده است.

جریان از طریق باس‌بارهای ضخیم مسی با مقاومت تماسی فوق‌العاده پایین (حداکثر ۰.۵۵ میلی‌اهم) توزیع می‌شود تا افت ولتاژ در جریان‌های بالا به حداقل برسد.

نکته طراحی: باید توجه داشت که در توان‌های بسیار بالا (نظیر ۱۲۰ کیلووات)، معماری توزیع برق معمولاً از توزیع دوگانه (2N) کلاسیک دیتاسنترها فاصله گرفته و برای جلوگیری از انسداد فیزیکی فضای درون رک با انبوه کابل‌ها، به سمت افزونگی ماژولار (N+1) در سطح Power Shelf و باس‌بارهای یکپارچه حرکت می‌کند.

 

۳.۳ چالش نوسانات گذرا (High di/dt Transients) و نقش BBU و UPS

تغییر پله‌ای جریان مصرفی GPUها در فاز آموزش، به عنوان High di/dt شناخته می‌شود. دستگاه‌های UPS متمرکز، حتی دوگانه تبدیلی (Double-conversion)، نمی‌‌توانند بدون افت کیفیت توان این شوک‌ها را مهار کنند. ماژول‌های BBU درون‌رک با باتری‌های لیتیومی با نرخ تخلیه بالا، وظیفه تراشیدن پیک بار (Peak Shaving) را در کمتر از ۲ میلی‌ثانیه انجام می‌دهند.

استاندارد مرجع: در ارزیابی سیستم‌های UPS بالادستی، تطابق با استاندارد IEC 62040-3 کلاس ۱ (Class 1 Dynamic Performance) یک الزام قطعی است. در تغییرات پله‌ای بار، UPS موظف است خروجی ولتاژ را زیر ۲۰۰ میلی‌ثانیه بازیابی کرده و انحراف ولتاژ گذرای آن از ۱۰٪ تجاوز نکند.

 

۳.۴ مدیریت هارمونیک‌ها مبتنی بر IEEE 519-2022

استقرار صدها ماژول منبع تغذیه (AC/DC) در یک دیتاسنتر، اعوجاج هارمونیک کل (THD) را افزایش می‌دهد که می‌تواند به کابل‌های نول و ترانس‌ها آسیب برساند. استاندارد IEEE 519-2022 محدودیت‌های دقیقی وضع کرده است (THDv زیر ۸٪ برای ولتاژهای زیر ۱ کیلوولت). استفاده از منابع تغذیه دارای اصلاح ضریب توان فعال (Active PFC) در طراحی AI Pod برای مهار این هارمونیک‌ها کاملاً الزامی است.

 

۴. مدیریت حرارتی پیشرفته و الزامات مدار ثانویه در سرمایش مایع

هنگامی که توان رک از ۳۰ الی ۴۰ کیلووات عبور می‌کند، سرمایش هوایی به محدودیت ترمودینامیکی می‌رسد. شار حرارتی پردازنده‌های AI بالغ بر ۵۰۰ وات بر سانتی‌متر مربع است که تنها با سرمایش مایع مستقیم تراشه (Direct-to-Chip Liquid Cooling) قابل مدیریت است.

 

۴.۱ تفاوت مدارهای FWS و TCS در سرمایش دیتاسنتر هوش مصنوعی

مدار آب تاسیسات (FWS) حاوی سیال کنترل‌نشده‌ای است که از چیلرها یا برج‌های خنک‌کننده به دستگاه مبدل (CDU) می‌رسد. مدار ثانویه خنک‌کننده فناوری (TCS) مدار ایزوله‌ای است که سیال تصفیه‌شده را مستقیماً به Cold Plate تراشه‌ها می‌رساند تا از رسوب‌گذاری و خوردگی جلوگیری شود.

 

۴.۲ نقش CDU و ایزولاسیون مدارهای خنک‌کاری

واحد توزیع سیال خنک‌کننده (Coolant Distribution Unit - CDU) قلب تپنده مدیریت حرارتی AI Pod است. این واحد با استفاده از مبدل حرارتی صفحه‌ای (Plate Heat Exchanger)، دو مدار FWS و TCS را کاملاً تفکیک می‌کند. این جداسازی فیزیکی تضمین می‌کند که در صورت نشتی در رک، تنها حجم کم مایع درون مدار TCS تخلیه شود و کل آب چیلرهای ساختمان سرازیر نگردد.

 

واحد توزیع مایع خنک‌کننده

 

۴.۳ استانداردهای ASHRAE و کیفیت شیمی سیالات (Water Chemistry)

استفاده از آب کاملاً دیونیزه (DI Water) به دلیل تشنگی شدید آن به یون، باعث خوردگی گالوانیک مس در تجهیزات سرور می‌شود. مطابق دستورالعمل‌های فنی ASHRAE TC 9.9، استفاده از محلول‌های حاوی بازدارنده خوردگی نظیر پروپیلن گلیکول ۲۵ درصد (PG25) استاندارد طلایی است تا خوردگی، یخ‌زدگی و رشدهای بیولوژیک مهار شوند.

ارزیابی تحلیلی سیالات در جدول زیر ارائه شده است:

شاخص ارزیابی حرارتی و شیمیایی آب دیونیزه فوق‌خالص (DI Water) محلول مبتنی بر PG25 با مهارکننده‌ها
ظرفیت گرمایی و انتقال حرارت عالی بسیار خوب (کاملاً کافی برای تراکم بالا)
خطر خوردگی گالوانیک (مس) به شدت بالا (تهاجمی) پایین (پسیو شدن سطح فلز)
خطر انسداد زیستی (Bio-fouling) بالا مصون

 

۴.۴ الزامات حرارتی کلاس H1 و W4

کمیته ASHRAE TC 9.9 کلاس‌های محیطی H1 و W4 را برای زیرساخت‌های پرتراکم معرفی کرده است. کلاس W4 امکان ورود سیال تا دمای ۴۵ درجه سانتی‌گراد را به مدار TCS مجاز می‌داند که امکان استفاده گسترده از سیستم سرمایش آزاد (Free-cooling) را فراهم می‌آورد

. با این حال، باید توجه داشت که در اقلیم‌های گرم (مانند ایران و خاورمیانه) که دمای محیط به راحتی از ۴۵ درجه فراتر می‌رود، استفاده از درای‌کولرها (Dry Coolers) به تنهایی پاسخگو نیست و استفاده از چیلرهای تراکمی پشتیبان (Trim Chillers) یا سیستم‌های آدیاباتیک برای حفظ پایداری حرارتی سیستم در ماه‌های گرم سال کاملاً الزامی است.

هشدار ایمنی: پدیده فرار حرارتی (Thermal Runaway) در رکی با توان ۱۳۲ کیلووات دارای تایم‌لاین بسیار کوتاهی است. توقف پمپ‌های CDU می‌تواند در چند ثانیه دمای سیلیکون‌ها را تا مرز تخریب بالا ببرد. استفاده از پمپ‌های دور متغیر (VFD) با افزونگی حداقل N+1 در CDU یک الزام حیاتی است.

 

۵. فابریک شبکه هوش مصنوعی: گذر از گلوگاه‌های پردازشی

هنگام آموزش مدل‌های زبانی عظیم، ظرفیت و تاخیر فابریک شبکه زمان و هزینه آموزش را تعیین می‌کند، نه لزوماً سرعت تراشه‌ها. این فابریک به دو لایه مقیاس‌پذیری عمودی (Scale-up) و افقی (Scale-out) تفکیک می‌شود.

 

۵.۱ تمایز لایه‌های Scale-up و Scale-out

لایه Scale-up: ارتباطات مستقیم درون رک میان GPUها (نظیر فناوری NVLink انویدیا) را مدیریت می‌کند که در رک‌های مدرن به پهنای باند دوطرفه ۱.۸ ترابایت بر ثانیه به ازای هر تراشه دست می‌یابد.

لایه Scale-out: وظیفه اتصال نودها و AI Podهای مختلف را بر عهده دارد تا از گلوگاه‌های انتقال داده در سطح کل دیتاسنتر جلوگیری شود.

 

۵.۲ معماری بدون انسداد و توپولوژی Rail-Optimized

همگام‌سازی وزن‌های مدل نیازمند عملیات پردازش گروهی سنگین نظیر All-Reduce است. برخلاف معماری Spine-Leaf سنتی که کارت شبکه به چندین سوییچ متصل می‌شد، در توپولوژی بهینه‌شده ریلی (Rail-optimized)، هر رابط شبکه مستقیماً به سوییچ Leaf اختصاصی (ریل) خود متصل می‌شود. این ساختار ترافیک حساس را تنها با یک پرش (Single Hop) انتقال می‌دهد.
 
 
فابریک شبکه دیتاسنتر
 
 

۵.۳ انتخاب پروتکل شبکه: نبرد InfiniBand، RoCEv2 و Spectrum-X

پروتکل‌های انتقال داده در فابریک هوش مصنوعی شامل سه گزینه اصلی هستند:
  • اینفینی‌بند (InfiniBand): ذاتا بدون افت بسته (Lossless) با تاخیر زیر ۶۰۰ نانوثانیه، اما بسیار گران‌قیمت با ریسک قفل‌شدگی سخت‌افزاری (Vendor Lock-in).
  • اترنت RoCEv2: اقتصادی‌تر، اما در معرض بن‌بست اولویت (PFC Deadlock) به دلیل وابستگی به تنظیمات کنترلی در شبکه‌های ذاتا Lossy.
  • فناوری Spectrum-X: مسیریابی تطبیقی روی اترنت (Adaptive Routing) که پایداری اینفینی‌بند را در بستر انعطاف‌پذیر اترنت شبیه‌سازی می‌کند.

 

متغیر ارزیابی فابریک InfiniBand اترنت استاندارد (RoCEv2) Spectrum-X
کنترل ازدحام / افت بسته بسیار عالی ضعیف (ریسک Deadlock) بسیار خوب (مسیریابی پویا)
وابستگی سخت‌افزاری به شدت بالا (بسته) ناچیز متوسط

 

۵.۴ چشم‌انداز فابریک: استاندارد IEEE 802.3dj و توسعه ۱.۶ ترابیت

در حال حاضر، کارگروه IEEE 802.3dj استاندارد نسل بعدی اترنت را در قالب پیش‌نویس (Draft) توسعه داده است که نقشه راه تجهیزات آینده را شکل می‌دهد. این پیش‌نویس پشتیبانی از سرعت‌های ۲۰۰، ۴۰۰، ۸۰۰ گیگابیت و به ویژه ۱.۶ ترابیت بر ثانیه (1.6T) را ممکن می‌سازد.

انتقال داده در این سطح چالش‌های تاخیر (Latency) در تصحیح خطای پیشرو (RS-FEC) ایجاد می‌کند که نیازمند راهکارهای Bypass در کدهای داخلی تجهیزات است.

 

۶. تطابق با استانداردهای زیرساختی و طراحی تاب‌آور

یک AI Pod مهندسی‌شده باید از منظر ایمنی، دسترسی‌پذیری و مقاومت در برابر خرابی (Fault Tolerance)، استانداردهای جهانی را رعایت نماید.

 

۶.۱ وابستگی‌های خارج از سایت (External Dependencies)

یک AI Pod هرچند در داخل خود دارای افزونگی الکتریکی و پردازشی است، اما به شدت به پایداری منابع زیرساختی خارجی وابسته است؛ به ویژه منبع تامین آب صنعتی پایدار (برای تغذیه سیستم FWS خنک‌کننده در مقیاس مگاوات) و مسیرهای دوگانه و ایزوله فیبر تاریک (Dark Fiber) برای لایه Scale-out بین سایت‌ها.

قطع طولانی‌مدت هر یک از این دو منبع به معنای ایجاد نقطه خرابی منفرد (Single Point of Failure) برای کل عملیات کلاستر پردازشی خواهد بود و استقلال و ماژولار بودن رک به تنهایی نمی‌تواند جایگزین این وابستگی‌های فیزیکی گردد.

 

۶.۲ به‌روزرسانی‌های استاندارد TIA-942-C در عصر هوش مصنوعی

استاندارد ANSI/TIA-942-C ویرایش ۲۰۲۴، حداقل عرض کابینت‌های توزیع شبکه را به دلیل حجم متراکم کابل‌های فیبر نوری موازی (نظیر اتصالات MPO-16 و MPO-24 برای سرعت‌های 800G) از ۶۰۰ میلی‌متر به ۸۰۰ میلی‌متر افزایش داده است تا شعاع خمش مجاز و تهویه تجهیزات تضمین گردد.

 

۶.۳ استاندارد ISO/IEC 22237 و دسترسی‌پذیری سیستم

حفظ دسترسی‌پذیری در کلاسترهای پرهزینه GPU الزامی است. توقف فرآیند آموزش مدل به دلیل قطعی برق به معنای اتلاف هزینه محاسباتی شدید است. طراحی بر اساس کلاس‌های ۳ (Concurrently Maintainable) و ۴ (Fault Tolerant) در استاندارد ISO 22237، به ویژه دوگانه‌سازی برقِ پمپ‌های سیستم CDU، رویکردی اساسی در حفظ تاب‌آوری است.

جدول زیر تحلیل مدول‌های خرابی و مکانیزم‌های کنترل ریسک مهندسی را نشان می‌دهد:

سناریوی بحرانی خرابی اثرات مهلک بر سیستم مکانیزم کنترل و کاهش ریسک
توقف پمپ‌های خنک‌کننده CDU وقوع فرار حرارتی سریع و خاموشی سخت‌افزاری کلاستر استفاده از پمپ‌های VFD افزونه (Redundant) و رصد تله‌متری
بن‌بست شبکه‌ای در ترافیک (Deadlock) مسدود شدن جریان All-Reduce و توقف همگام‌سازی GPUها مسیریابی تطبیقی (Adaptive Routing) مانند Spectrum-X

 

پمپ افزونه دیتاسنتر

 

۷. چک‌لیست اجرایی و سوالات متداول (FAQ)

 

۷.۱ چک‌لیست ارزیابی و طراحی AI Pod

  • ارزیابی سازه‌ای: آیا شاسی‌های سالن توان تحمل بار استاتیک بیش از ۱۵۰۰ کیلوگرم بر متر مربع را دارند؟
  • مدیریت هارمونیک: آیا دستگاه‌های UPS بالادستی توانایی پاسخگویی به شوک‌های جریانی (di/dt) مطابق کلاس ۱ استاندارد IEC 62040-3 را دارا می‌باشند؟
  • ایمنی مایعات: آیا اتصالات درون رک از نوع Blind-mate UQD جهت پیشگیری از نشت به کار رفته است؟
  • شیمی آب: آیا مدار TCS دارای ترکیبات ضدخوردگی نظیر PG25 و فیلتراسیون زیر ۵ میکرون می‌باشد؟

 

۷.۲ سوالات متداول (FAQ)

  1. مفهوم دقیق AI Pod چیست؟ یک واحد پایه و یکپارچه محاسباتی شامل فابریک شبکه، سرمایش مایع مستقیم (CDU)، و توزیع برق متراکم (شامل باس‌بارهای ۴۸ ولت و BBU) است که به صورت یک بلوک یکپارچه، پیش‌مهندسی و تکرارپذیر برای استقرار تجهیزات سنگین هوش مصنوعی عمل می‌کند.
  2. چگونه حرارت بیش از ۱۰۰ کیلووات در یک رک مهار می‌شود؟ از طریق فناوری خنک‌کاری مایع مستقیم تراشه (Direct-to-Chip Liquid Cooling) که حرارت متمرکز سیلیکون‌ها را با استفاده از سیال کنترل‌شده دریافت کرده و توسط دستگاه‌های CDU به محیط بیرون منتقل می‌نماید.
  3. تفاوت شبکه‌های Lossless با اترنت معمولی در کلاسترهای پردازشی چیست؟ شبکه‌های پردازش گروهی در هوش مصنوعی (عملیات All-Reduce) نیازمند انتقال بی‌وقفه و همگام داده‌ها هستند. افت بسته (Packet Loss) در اترنت سنتی کل فرآیند محاسبات را متوقف می‌کند؛ از این رو استفاده از فناوری‌هایی نظیر InfiniBand یا شبکه‌های مبتنی بر مسیریابی تطبیقی برای تضمین تاخیر پایین الزامی است.

 

۸. نتیجه‌گیری نهایی و مشاوره تخصصی

نتیجه‌گیری مدیریتی: مدیران ارشد فناوری اطلاعات (CIO) باید آگاه باشند که استقرار زیرساخت‌های هوش مصنوعی صرفاً خرید سرور نیست، بلکه یک دگردیسی در لایه‌های مکانیک، برق، سازه و شبکه است. نادیده گرفتن تنظیمات دقیق شیمی سیالات، توپولوژی‌های شبکه Rail-optimized و ارتقای استاندارد توزیع توان درون‌رک (BBU و OCP ORv3) به افت شدید راندمان سیستم و ریسک بالای خرابی قطعات منجر خواهد شد.

ارتقای ایمن زیرساخت سازمان برای بارهای کاری هوش مصنوعی

آیا دیتاسنتر سازمان شما برای پذیرش پردازنده‌های پرچمدار و حرارت بالای ردیف‌های هوش مصنوعی آماده است؟ تیم مهندسی زیرساخت فیدارکوثر آماده ارائه خدمات مشاوره طراحی و یکپارچه‌سازی سیستم‌های پیچیده Power و Cooling برای دیتاسنترهای ماژولار شماست.

دریافت مشاوره مهندسی زیرساخت

     

نظرات :
ارسال نظر :

بعد از ورود به حساب کاربری می توانید دیدگاه خود را ثبت کنید