تجاریسازی پرشتاب هوش مصنوعی مولد (Generative AI)، مدلهای زبانی بزرگ (LLMs) و یادگیری ماشین در مقیاس وسیع، بحرانی بیسابقه در زیرساخت فیزیکی دیتاسنترها ایجاد کرده است. از نظر تاریخی، معماری دیتاسنترها روندی تکاملی داشت و برای پردازشگرهای استاندارد x86 در رکهای استاندارد ۱۹ اینچی با مصرف توانی بین ۵ تا ۱۰ کیلووات (kW) بهینهسازی میشد.
اما ظهور ابررایانههای مبتنی بر رک، که توسط معماریهای سیلیکونی نظیر NVIDIA GB200 NVL72 و AMD Helios هدایت میشوند، این استانداردهای تاریخی را در هم شکسته است. گذر از یک رک استاندارد IT به یک رک بومی هوش مصنوعی (AI-Native Rack)، صرفاً یک ارتقای ساده در ظرفیت سرور نیست؛ بلکه یک تغییر پارادایم بنیادین در مهندسی برق، ترمودینامیک و طراحی مکانیکی محسوب میشود.
یک رک مدرن هوش مصنوعی میتواند تا ۱۳۲ کیلووات برق مصرف کند (معادل مصرف تقریبی ۸۰ واحد مسکونی) و بار حرارتی متناسبی تولید کند که از محدودیتهای فیزیکی فناوریهای خنککننده بادی فراتر میرود.
با توجه به اینکه هزینه سرمایهای (CAPEX) یک رک هوش مصنوعی مجهز در سال ۲۰۲۵ به طور متوسط ۳.۹ میلیون دلار است، زیرساخت دربرگیرنده این سیستمها باید با تحمل خطای صفر (Zero Tolerance) در برابر فرار حرارتی، قوس الکتریکی یا آلودگی مایع خنککننده مهندسی شود.
این مقاله با ارائه یک تحلیل مهندسی جامع، تغییرات معماری مورد نیاز را بررسی کرده و تفاوتهای دقیق مکانیکی، الکتریکی و حرارتی بین رکهای سنتی ۱۹ اینچی و سیستمهای مدرن و پرتراکم هوش مصنوعی را کالبدشکافی میکند.
فوریترین گلوگاهی که در استقرار سختافزارهای هوش مصنوعی در محیطهای قدیمی با آن مواجه میشویم، معماری توزیع برق است. دیتاسنترهای سنتی برای توزیع برق متناوب (AC) به واحدهای توزیع برق (PDU) که به صورت عمودی در پشت رک نصب میشوند، متکی هستند.
این معماری برای بارهایی تا حدود ۳۰ کیلووات به طور پایدار عمل میکند. اما مقیاسپذیری این مدل برای رسیدن به ۱۳۲ کیلووات، موانع فیزیکی و الکتریکی غیرقابل عبوری ایجاد میکند. انتقال بیش از ۱۰۰ کیلووات جریان AC نیازمند کابلهای مسی با ضخامت و سختی بسیار بالاست که مدیریت کابل را غیرممکن کرده و با مسدود کردن کامل جریان هوای خروجی، خفگی حرارتی شدیدی در پشت رک ایجاد میکند.
برای رفع این مشکل، صنعت دیتاسنترهای مقیاسپذیر (Hyperscale) به طور گستردهای استاندارد Open Rack V3 (ORv3) پروژه محاسبات باز (OCP) را پذیرفته است که گذر به توزیع برق متمرکز 48V DC را الزامآور میکند. در معماری ORv3، PDUهای سنتی و منابع تغذیه (PSU) اختصاصی هر سرور حذف میشوند[طراحی توزیع برق داخل دیتاسنتر کانتینری]
در عوض، برق AC به قفسههای متمرکز برق در داخل رک منتقل میشود. این قفسهها دارای ماژولهای یکسوساز (Rectifier) عظیمی هستند که تبدیل AC به 48V DC را به صورت تکمرحلهای و با راندمان بالا انجام میدهند. سپس جریان 48V DC به یک شینه (Busbar) مسی یکپارچه که به صورت عمودی در قاب پشتی رک تعبیه شده، تزریق میگردد.
ارتباط بین تجهیزات IT و شینه مسی از طریق کانکتورهای بسیار پیشرفتهای موسوم به Blind-Mate برقرار میشود. این کانکتورها برای تحمل ۵۰۰ آمپر جریان پیوسته به ازای هر قطب طراحی شدهاند و به طور خودکار هنگام قرارگیری سرور در رک، بدون نیاز به اتصال دستی کابل، با شینه درگیر میشوند.

تغییر به سمت بارهای کاری هوش مصنوعی نیازمند بازطراحی کامل مکانیکی ساختار رک [طراحی Rack و Cabinet] برای جا دادن هیتسینکهای بزرگتر، مانیفولدهای پیچیده خنککننده مایع و جرم عظیم پردازندههای گرافیکی (GPUs) است. برای دههها، استاندارد EIA-310 با تعریف رکهای ۱۹ اینچی و واحد اندازهگیری RU (معادل ۴۴.۴۵ میلیمتر)، بر مکانیک دیتاسنترها حاکم بود.
اما این ابعاد با واقعیتهای فیزیکی شتابدهندههای مدرن در تضاد هستند. استاندارد ORv3 این محدودیتها را با افزایش عرض داخلی قابل استفاده به ۲۱ اینچ و بازتعریف واحد عمودی به عنوان واحد باز (Open Unit - OU) به میزان دقیق ۴۸ میلیمتر برطرف میکند.
افزایش عرض، حدود ۱۵ درصد فضای جانبی بیشتری فراهم میکند که برای نصب بردهای اصلی وسیعتر GPU و مسیریابی لولههای رفت و برگشت مایع خنککننده حیاتی است.
| پارامتر مشخصات | استاندارد سنتی EIA-310 (رک ۱۹ اینچی) | استاندارد بومی هوش مصنوعی OCP ORv3 | پیامد معماری و مهندسی |
|---|---|---|---|
| عرض فضای داخلی تجهیزات | ۱۷.۷ اینچ (۴۵۰ میلیمتر) | ۲۱ اینچ (۵۳۹ یا ۶۱۰ میلیمتر) | افزایش ۱۵ درصدی عرض برای گرههای متراکم GPU و نصب مانیفولدهای مایع جانبی. |
| ارتفاع واحد عمودی | Rack Unit (RU) = ۴۴.۴۵ میلیمتر | Open Unit (OU) = ۴۸ میلیمتر | فراهم کردن فضای عمودی بیشتر برای فنهای بزرگتر و هیتسینکهای بلندتر. |
| توزیع نیروی برق | PDUهای عمودی AC نصب شده در کنار | قفسه مرکزی AC-DC و شینه مسی 48V در پشت | حذف کامل کابلهای مزاحم AC، بهبود آیرودینامیک و امکانپذیری بارهای بالای ۱۰۰ کیلووات. |
| حداکثر ظرفیت تحمل بار | معمولاً ۵۰۰ تا ۱۰۰۰ کیلوگرم | حداقل ۱۴۰۰ کیلوگرم (۳۰۸۶ پوند) | نیازمند شاسیهای تقویتشده و چرخهای صنعتی (Casters) برای تحمل وزن سرورهای پر از مایع. |
| توپولوژی خنککننده | صرفاً جریان هوای جلو به عقب | پشتیبانی بومی از مانیفولدهای توزیع مایع در پشت رک | طراحی اختصاصی برای نصب سیستم توزیع سیال بدون انسداد مسیر تعمیر و نگهداری تجهیزات. |
قوانین انتقال حرارت دیکته میکنند که هوا به دلیل ظرفیت گرمایی ویژه پایین و هدایت حرارتی ضعیف، رسانه بسیار ناکارآمدی برای دفع بارهای حرارتی متمرکز است. زمانی که توان طراحی حرارتی (TDP) تراشههای GPU به بالای ۱۰۰۰ وات میرسد، حجم هوای مورد نیاز برای جلوگیری از اختلال حرارتی (Thermal Throttling) از نظر فیزیکی غیرممکن میشود.
تلاش برای خنکسازی بادیِ یک رک ۱۰۰ کیلوواتی به فنهایی با چنان سرعتی نیاز دارد که نویز کرکنندهای ایجاد کرده و لرزشهای مخربی به تجهیزات نوری (Optical) شبکه وارد میکنند. ضرورت مطلق استفاده از خنککننده مایع مستقیم (DLC)، به ویژه خنککننده مستقیم روی تراشه (Direct-to-Chip)، شالوده ترمودینامیکی دیتاسنترهای AI را تشکیل میدهد.
ظرفیت حرارتی حجمی آب حدود ۳۲۰۰ برابر و هدایت حرارتی آن تقریباً ۲۵ برابر هواست. با گردش سیال خنککننده از طریق صفحات سرد (Cold Plates) دارای میکروکانال که مستقیماً روی پردازندهها نصب شدهاند، ۸۰ تا ۹۵ درصد حرارت تولیدی دفع میشود.
اتصال بین صفحات سرد سرور و مانیفولد رک با استفاده از قطعکنندههای سریع و ایمن (Universal Quick Disconnects - UQDs) انجام میشود که برای تعمیر و نگهداری بدون چکه و تعویض در حالت روشن (Hot-swappable) مهندسی شدهاند.
اجرای این سیستم نیازمند جداسازی دقیق دو حلقه ترمودینامیکی مجزا است:
پُل ارتباطی بین این دو سیستم، واحد توزیع خنککننده (CDU) است که به عنوان مبدل حرارتی عمل کرده و علاوه بر تبادل گرما، وظیفه پمپاژ سیال TCS و نظارت بر دمای آن برای جلوگیری از تقطیر (Condensation) رطوبت درون رک را بر عهده دارد.

پویایی سیالات و تعادل شیمیایی درون سیستم TCS یکی از بحرانیترین بردارهای ریسک در دیتاسنترهای هوش مصنوعی است. از آنجا که سیال در تماس مستقیم با فلزات ترکیبی (آلومینیوم، مس، برنج) در سرتاسر حلقه خنککننده قرار دارد، سیستم به شدت در معرض خوردگی گالوانیک (Galvanic Corrosion) است.
| پارامتر کیفیت آب (ASHRAE TC 9.9 / OCP TCS) | مشخصات هدف | پیامد عملیاتی انحراف از استاندارد |
|---|---|---|
| پتانسیل هیدروژن (pH) | ۶.۸ تا ۸.۵ (سیالات پایه آب) | مقادیر زیر ۶.۸ خوردگی اسیدی را تسریع میکنند؛ مقادیر بالای ۸.۵ خطر حملات قلیایی به Cold Plateهای آلومینیومی را به همراه دارند. |
| رسانایی الکتریکی (Conductivity) | کمتر از ۱۰۰ µS/cm (برای سیستمهای آب تصفیهشده) * رسانایی بالاتر تنها در مخلوطهای پایه گلیکول (PG/EG) قابل تحمل است. | رسانایی بالا نشاندهنده آلودگی یونی است که در حلقههای آب خالص، خطر خوردگی گالوانیک و اتصال کوتاه الکتریکی را به شدت افزایش میدهد. |
| سختی کل (کلسیم/منیزیم به عنوان CaCO₃) | کمتر از ۲۰ میلیگرم در لیتر | آب سخت باعث رسوب کربنات کلسیم میشود. تنها ۰.۲۵ میلیمتر رسوب، راندمان انتقال حرارت را ۱۰٪ کاهش داده و موجب افت عملکرد GPU میشود. |
| بازدارندههای خوردگی (آزولها - Azoles) | بیشتر از ۱۰۰ ppm (نظیر TTA) | عدم وجود آزولها، فلزات زرد (مس، برنج) را در برابر تخریب اکسیداتیو و گالوانیک کاملاً بیدفاع میگذارد. |
| فیلتراسیون ذرات معلق | کمتر از ۵۰ میکرون به طور مطلق | ناتوانی در فیلتر ذرات زیر ۵۰ میکرون منجر به گرفتگی میکروکانالها شده و سختافزارهای چند میلیون دلاری را از کار میاندازد. |
آموزش مدلهای زبانی بزرگ بر روی سرورهای ایزوله انجام نمیشود؛ بلکه به قدرت محاسباتی توزیعشده هزاران GPU متکی است که به صورت همگام به عنوان یک ابررایانه واحد عمل میکنند.
این معماری نیازمند یک شبکه بکاند (Backend) با توان عملیاتی بیسابقه و تاخیر در حد میکروثانیه است (مانند معماریهای InfiniBand یا شبکههای RoCE). از آنجایی که تاخیر شبکه مستقیماً با فاصله فیزیکی و تعداد پرشهای نوری (Optical Hops) در ارتباط است، رکهای هوش مصنوعی باید در کلاسترهای بسیار متراکم (Pods) مستقر شوند.
طراحان زیرساخت نمیتوانند سرورهای پرتراکم را برای کاهش تراکم حرارتی در چندین ردیف پراکنده کنند؛ این کار محدودیتهای سختگیرانه طول کابل برای همگامسازی کلاستر را نقض میکند. این تراکم شدید منجر به ازدحام صدها کابل فیبر نوری پرسرعت (بهویژه فیبرهای OM4 و OM5 برای فواصل کوتاه و OS2 برای ارتباطات Spine-and-Leaf) میشود.
عرض ۲۱ اینچی معماری ORv3 کانالهای مسیریابی عمودی اختصاصی را فراهم میکند تا اطمینان حاصل شود که دستههای بزرگ کابل فیبر باعث انسداد مسیر هوای خروجی قطعات باقیمانده یا ایجاد مانع در دسترسی به مانیفولدهای خنککننده مایع نمیشوند.

در حالی که مصرف مطلق برق در دیتاسنترهای AI به شدت بالاتر از تسهیلات سنتی است، تغییر معماری به خنککننده مایع فرصتهای چشمگیری برای بهینهسازی راندمان مصرف انرژی (PUE) باز میکند. جذب حرارت در سطح سیلیکون، نیاز به فنهای با سرعت بالا در سرورها را که تا ۱۵ درصد برق کل شاسی را مصرف میکنند، از بین میبرد.
البته باید توجه داشت: در حالی که حذف این فنها، ورود گردوغبار و لرزش مکانیکی را از بین میبرد، تابآوری و قابلیت اطمینان سیستم اکنون کاملاً به تحمل خطای پمپهای افزونه CDU و یکپارچگی بدون نشتی اتصالات UQD وابسته است.
مهمتر از آن، بر اساس دستورالعملهای کلاس W32 یا W40 در ASHRAE، میتوان پردازندههای گرافیکی ۱۰۰۰ واتی را با دمای آب تامینکننده بین ۳۲ تا ۴۵ درجه سانتیگراد خنک کرد. از آنجایی که این سیال میتواند در بیشتر ایام سال گرمتر از هوای محیط بیرون باشد، دیتاسنتر میتواند چیلرهای مکانیکی را به طور کامل از مدار خارج کرده (Chiller-less design) و منحصراً به سیستمهای خنککننده تبخیری یا درای کولرها (Dry Coolers) تکیه کند.
این رویکرد، شاخص PUE را به کمتر از ۱.۲ کاهش میدهد. افزون بر این، به دلیل اینکه دمای آب برگشتی به راحتی از ۵۰ درجه سانتیگراد فراتر میرود، این حرارتِ هدررفته قابلیت بازیابی و استفاده مجدد در سیستمهای گرمایش شهری یا فرایندهای صنعتی را دارا است.
مدیران زیرساخت برای میزبانی از تجهیزات جدید AI دو مسیر پیش رو دارند: نوسازی دیتاسنتر موجود یا استفاده از دیتاسنترهای ماژولار (Modular Data Centers).
نوسازی یک دیتاسنتر در حال کار برای پشتیبانی از رکهای ۱۰۰ کیلوواتی، نیازمند تخریب گسترده، تقویت سازههای بتنی، تغییر سایز کامل تابلوهای برق (Switchgear) و ژنراتورها، و لولهکشیهای خطرناک مایعات در مجاورت تجهیزات سنتی (Legacy IT) است.
به دلیل هزینههای سرسامآور سرمایهای و خطرات بالای عملیاتیِ چنین تغییراتی در محیط زنده، صنعت به سرعت به سمت استقرار زیرساخت [طراحی AI Pod در دیتاسنتر ماژولار]در قالب دیتاسنترهای پیشساخته و ماژولار (MDC) حرکت کرده است.
| معیار تصمیمگیری | نوسازی تسهیلات سنتی (Retrofit) | دیتاسنترهای ماژولار بومی هوش مصنوعی (MDC) |
|---|---|---|
| ظرفیت سازهای | نیازمند تخریب کف کاذب و تقویت دال بتنی است که ریسک توقف سرویس را به شدت بالا میبرد. | دارای شاسی بتنی یا فولادی یکپارچه؛ از پیش طراحیشده برای تحمل وزن خیرهکننده رکهای ORv3. |
| زیرساخت خنککننده | ریسک بالای اضافهکردن لولهکشیهای FWS در مجاورت تجهیزات حساس فعلی شبکه. | حلقههای FWS و TCS به همراه CDUهای یکپارچه از پیش در کارخانه نصب و تست فشار شدهاند. |
| زمان پیادهسازی | پروژههای ساختوساز چند ساله با تداخل عملیاتی شدید. | استقرار سریع و مقیاسپذیر در عرض چند ماه، کاملاً مستقل از محدودیتهای ساختمان اصلی. |
| زیرساخت توزیع توان | محدودیت ترانسفورماتورها و UPSهای قدیمی در تامین بارهای مستمر بالا بدون افت ولتاژ. | یکپارچهسازی با ترانسفورماتورهای فشار متوسط مختص بارهای پیوسته ۱۰۰ کیلووات به بالا. |

پیش از هرگونه سرمایهگذاری بر روی سختافزارهای پردازش هوش مصنوعی نظیر پلتفرمهای NVIDIA یا AMD، مدیران زیرساخت باید موارد زیر را با دقت ارزیابی کنند:

ادغام هوش مصنوعی در معماریهای سازمانی صرفاً یک استقرار نرمافزاری نیست؛ بلکه یک الزام سختافزاری است که پارامترهای فیزیکی دیتاسنتر را به طور کامل از نو تعریف میکند. عصر رکهای کمتراکم ۱۹ اینچی با خنککننده بادی و شبکهای از کابلهای آشفته AC، به پایان محدودیتهای ترمودینامیکی و الکتریکی خود رسیده است.
استقرار موفقیتآمیز شتابدهندههای هوش مصنوعی نیازمند پذیرش استانداردهای نوینی نظیر OCP ORv3، توزیع برق 48V DC، خنککنندههای مایع مستقیم (DLC) مجهز به اتصالات UQD و مدیریت دقیق شیمی سیالات بر اساس الزامات سختگیرانه ASHRAE است.
تلاش برای گنجاندن این سختافزارهای فوقپیشرفته، بسیار سنگین و پرتراکم در دیتاسنترهای قدیمی، به دلیل عدم توانایی زیرساخت در مهار حرارت و وزن، تنها به افزایش خطرات عملیاتی و کاهش محسوس بازگشت سرمایه منجر خواهد شد. در این مسیر پرخطر، اتخاذ رویکرد استفاده از دیتاسنترهای ماژولار (MDC) راهحلی مهندسیشده، ایمن، مقیاسپذیر و پایدار ارائه میدهد.
تیم متخصص مهندسی در فیدار کوثر آماده است تا با ارزیابی دقیق توان زیرساختی فعلی، مشاوره تخصصی در انتخاب تجهیزات خنککننده مایع و طراحی نسل جدید دیتاسنترهای ماژولار هوش مصنوعی (AI-Native MDC)، سازمان شما را در گذری ایمن و بدون توقف سرویس یاری دهد. مقیاسپذیری زیرساخت خود را از همین امروز تضمین کنید.
درخواست مشاوره مهندسی زیرساخت AI
بعد از ورود به حساب کاربری می توانید دیدگاه خود را ثبت کنید