پرش به محتوای اصلی
ORYX

Blog · 5 دقیقه مطالعه

تراکم توان مراکز داده: برنامه‌ریزی مراکز داده هوش مصنوعی با خنک‌سازی مایع در چارچوب محدودیت‌های شبکه برق و توان

هوش مصنوعی نحوه برنامه‌ریزی مراکز داده را تغییر می‌دهد؛ اکنون تمرکز بیشتر بر این است که محاسبات را واقع‌بینانه کجا می‌توان مستقر کرد، نه اینکه چقدر می‌توان به ظرفیت افزود.

ونس پیترسون (اشنایدر الکتریک)
Read in English →

تراکم توان مراکز داده از طراحی ساختمان‌ها پیشی گرفته است

میانگین تراکم رک در مراکز داده مقیاس‌بزرگ، ارائه‌دهندگان هم‌مکانی و نئوکلاودها از حدی که تأسیسات سنتی برای آن طراحی شده بودند، فراتر رفته است. میانگین تراکم رک از حدود ۱۶ کیلووات در سال ۲۰۲۵ به حدود ۲۷ کیلووات در سال ۲۰۲۶ رسیده، در حالی‌که تنها یک از هر پنج اپراتور می‌گوید برای پشتیبانی از رک‌های ۵۰ تا ۷۰ کیلوواتی که اکنون در استقرارهای هوش مصنوعی رایج شده‌اند، آماده است. پیش‌بینی‌ها نشان می‌دهد میانگین تراکم طی چند سال آینده به نزدیک ۴۰ کیلووات خواهد رسید و جدیدترین سامانه‌های هوش مصنوعی می‌توانند تا ۲۴۶ کیلووات در هر رک مصرف کنند.

سامانه‌های هوش مصنوعی مبتنی بر پردازنده گرافیکی محرک اصلی این روند هستند؛ برای نمونه پلتفرم Vera Rubin شرکت انویدیا می‌تواند نیاز توان هر رک را تا ۲۴۶ کیلووات افزایش دهد. به‌جای پخش بار کاری میان صدها سرور کم‌تراکم، زیرساخت‌های ابری و هوش مصنوعی توان را در تعداد کمتری رک متمرکز می‌کنند که این امر تقاضای حرارتی و الکتریکی‌ای ایجاد می‌کند که تأسیسات متعارف برای آن ساخته نشده‌اند.

تراکم بالاتر توان به این معناست که باید توان بسیار بیشتری در فضایی کوچک‌تر تحویل داده شود و به همان میزان گرما از آن دفع شود.

چرا تراکم توان مراکز داده اکنون یک مسئله شبکه برق است

در عمل، تراکم توان و رک مراکز داده به یک چالش برنامه‌ریزی زیرساختی تبدیل شده است. پیش‌بینی می‌شود تقاضای جهانی برق مراکز داده در سال ۲۰۲۶ به حدود ۱۳۲ گیگاوات برسد و تا سال ۲۰۳۰ به حدود ۲۹۰ گیگاوات افزایش یابد که عمدتاً ناشی از سرورهای بهینه‌شده برای هوش مصنوعی است. هم‌زمان، صف‌های اتصال به شبکه برق یکی از بزرگ‌ترین موانع استقرارهای جدید هوش مصنوعی شده‌اند؛ در برخی از بازارهای بزرگ آمریکا، تأمین ظرفیت جدید برق می‌تواند سه تا چهار سال طول بکشد که از زمان ساخت خود تأسیسات هم بیشتر است.

زمان دستیابی به توان در حال تبدیل‌شدن به عاملی به همان اندازه حیاتیِ زمان استقرار است. اپراتورها به‌جای طراحی بر مبنای توان نامحدود آینده، ناچارند حداکثر ظرفیت محاسباتی ممکن را در چارچوب تخصیص برقی موجود مستقر کنند.

خنک‌سازی مایع فراتر از عملکرد حرارتی را بهبود می‌بخشد

خنک‌سازی مستقیم‌به‌چیپ با مایع محدودیت‌های توان را از دو مسیر برطرف می‌کند. نخست، از تراکم‌های رکی پشتیبانی می‌کند که خنک‌سازی هوایی قادر به تأمین آن نیست؛ مجموعه راهکارهای سرتاسری خنک‌سازی مایع اشنایدر الکتریک برای نیازهای تراکم بالای مراکز داده ابری، ارائه‌دهندگان هم‌مکانی و نئوکلاودها طراحی شده است.

دوم، سربار تأسیسات را کاهش می‌دهد. تأسیسات قدیمی با خنک‌سازی هوایی معمولاً با شاخص PUE بین ۱.۵۵ تا ۱.۶۷ کار می‌کنند، یعنی تقریباً یک‌سوم برق ورودی صرف زیرساخت می‌شود نه تجهیزات فناوری اطلاعات. خنک‌سازی مستقیم‌به‌چیپ معمولاً به PUE حدود ۱.۱۰ تا ۱.۲۰ می‌رسد و ظرفیت برقی بیشتری را برای محاسبات آزاد می‌کند. معماری‌های مستقیم‌به‌چیپ اشنایدر الکتریک در کاربردهای مناسب کاهش ۳۰ تا ۶۰ درصدی مصرف انرژی خنک‌سازی را به همراه دارند.

طراحی بر اساس کل مسیر توان

موفقیت برنامه‌ریزی زیرساخت هوش مصنوعی به هماهنگی هم‌زمان میان دسترسی به برق، توزیع الکتریکی، زیرساخت UPS، معماری توان رک، توزیع خنک‌سازی و پایش عملیاتی بستگی دارد.

اشنایدر الکتریک خنک‌سازی مایع را در چارچوب رویکردی گسترده‌تر با عنوان «از شبکه تا چیپ و از چیپ تا چیلر» قرار می‌دهد که سامانه‌های الکتریکی و حرارتی را یک سامانه واحد می‌بیند. با گرایش خریداران به ارزیابی زیرساخت هوش مصنوعی به‌عنوان یک کل به‌هم‌پیوسته، گفت‌وگوها از خنک‌سازی مایع به‌تنهایی به سمت برنامه‌ریزی گسترده‌تر زیرساخت—شامل معماری توان، سرعت استقرار، زیرساخت ماژولار و آمادگی عملیاتی—تغییر جهت داده است.

نمونه عملی: برنامه‌ریزی بر پایه دسترسی موجود به شبکه برق

کمپین Lake Mariner متعلق به شرکت TeraWulf در بوفالوی نیویورک نمونه‌ای از این رویکرد در مقیاس بزرگ است. این پروژه به‌جای توسعه یک سایت کاملاً جدید، از یک محل صنعتی قدیمی با ظرفیت موجود اتصال به شبکه برق استفاده مجدد می‌کند. اشنایدر الکتریک به همراه Motivair by Schneider Electric زیرساخت یکپارچه توان و خنک‌سازی مایع را برای این کمپین تحویل می‌دهد که به‌صورت مرحله‌ای به ظرفیتی تا ۷۵۰ مگاوات خواهد رسید.

این استقرار شامل سامانه‌های UPS با نام تجاری Galaxy VX، زیرساخت باتری لیتیوم-یون، واحدهای توزیع خنک‌کننده Motivair، منیفولدهای داخل‌رکی، مبدل‌های حرارتی درِ عقبی ChilledDoor و نرم‌افزار پایش EcoStruxure IT است. این نمونه نشان می‌دهد طراحی هم‌زمان توان و خنک‌سازی می‌تواند زمان استقرار را کوتاه‌تر و ظرفیت برقی موجود را حداکثر کند.

تأسیسات موجود گزینه‌های بازسازی قابل‌اجرا دارند

همه ارائه‌دهندگان ابری یا هم‌مکانی در حال ساخت کمپین جدید هوش مصنوعی نیستند؛ بسیاری نیاز دارند بارهای کاری هوش مصنوعی با تراکم بالاتر را بدون بازسازی کامل، به تأسیسات موجود وارد کنند.

مسیرهای بازسازی شامل حلقه‌های خنک‌سازی مستقیم‌به‌چیپ، مبدل‌های حرارتی درِ عقبی، واحدهای توزیع خنک‌کننده و واحدهای دفع گرما است. این روش‌ها به تأسیسات موجود اجازه می‌دهند با بهره‌گیری از بخش زیادی از زیرساخت فعلی، تراکم‌های رکی بالاتری را بپذیرند؛ واحدهای دفع گرما حتی می‌توانند در نبود آب سردکن، گرما را به هوا منتقل کنند.

بازسازی همچنان به سرمایه‌گذاری و برنامه‌ریزی عملیاتی قابل‌توجهی نیاز دارد و اینکه کدام گزینه ارزش بلندمدت بهتری دارد، به توان در دسترس، وضعیت تأسیسات و اولویت‌های کسب‌وکار بستگی دارد.

برنامه‌ریزی زیرساخت هوش مصنوعی بر مبنای توان، نه فقط خنک‌سازی

با افزایش تراکم توان مراکز داده، موفقیت برنامه‌ریزی به درک این موضوع بستگی دارد که دسترسی به توان، راهبرد خنک‌سازی و زمان‌بندی استقرار چگونه بر یکدیگر اثر می‌گذارند. مراکز داده ابری، ارائه‌دهندگان هم‌مکانی و نئوکلاودهایی که این عوامل را در کنار هم ارزیابی می‌کنند، موقعیت بهتری برای مقیاس‌دهی کارآمد هوش مصنوعی دارند.

منابع

  • Data center power density: Planning liquid-cooled AI data centers around grid and power constraints Schneider Electric Blog

Next step

اوریکس را روی سناریوی واقعی شبکه‌ی خودتان ببینید.

در جلسه‌ی دمو، به‌جای ارائه‌ی عمومی، یک سناریوی واقعی از محیط شما را بررسی می‌کنیم: یک تغییر پرریسک، یک رخداد اخیر، یا حجم لاگی که تیم شما هر روز با آن روبه‌روست.