چرا کارخانه هوش مصنوعی به معماری جدیدی نیاز دارد
مصرف ماهانه توکن در هوش مصنوعی طی دو سال حدود ۱۵۸ برابر افزایش یافته است، زیرا هوش مصنوعی از مرحله آزمایش به محصولات و خدمات واقعی وارد شده است؛ در همین حال محاسبات آموزش مدلها از سال ۲۰۲۰ هر سال حدود ۵ برابر رشد کرده و استنتاج (inference) به بزرگترین بار کاری هوش مصنوعی تبدیل شده، چرا که مدلها اکنون میلیاردها تعامل را پاسخ میدهند.
هوش مصنوعی عاملمحور این فشار را تشدید میکند: یک درخواست واحد میتواند چندین مرحله استدلال، زیرعاملها، عملیات بازیابی و فراخوانی ابزار، بههمراه مسیریابی، زمانبندی و مدیریت حافظه در سمت پردازنده مرکزی را فعال کند؛ بنابراین نیاز فقط به توکن بیشتر نیست، بلکه هر نتیجه مفید به استنتاج، هماهنگی و جابهجایی داده بیشتری نیاز دارد که فشار مضاعفی بر محاسبات، حافظه، شبکه، تأخیر و هزینه هر توکن وارد میکند. ایامدی معتقد است این وضعیت به نقشه راه زیرساختی تازهای نیاز دارد که حول محور محاسبات پیشرو، معماری رَک باز، فابریکهای پرپهنایباند مقیاسبالا و مقیاسبیرون، برق و خنکسازی کارآمد، قابلیت سرویسدهی و راهکارهای آماده استقرار سریع، بهصورت یکپارچه طراحی شده باشد.
پردازنده گرافیکی اینستینکت MI455X موتور است، هلیوس سامانه است
در قلب هلیوس، پردازنده گرافیکی AMD Instinct MI455X قرار دارد که به گفته ایامدی جهشی نسلی در محاسبات هوش مصنوعی و نیز در ظرفیت و پهنایباند حافظه HBM4 ارائه میدهد. ایامدی گزارش میدهد که روی مدل متنباز DeepSeek-V4-Flash، پردازنده MI455X در بالاترین سطح تعامل تا ۳۴ برابر توان عملیاتی توکن بیشتر و تا ۱۸ برابر هزینه کمتر بهازای هر توکن، در مقایسه با نسل قبلی یعنی Instinct MI355X، ارائه میدهد.
درون هلیوس: یک رَک، یک سامانه همطراحیشده
هلیوس بر اساس مسیری طراحی شده که یک بار کاری در طول رَک طی میکند: ورود از لایه میزبان، انتقال به حوزه پردازنده گرافیکی، دسترسی به حافظه HBM4 برای مدل و دادههای فعال، و ارتباط در سراسر رَک از طریق فابریک مقیاسبالا. این رَک ترکیبی است از پردازندههای سرور نسل ششم AMD EPYC با کدنام «ونیز» از سری ۹۰۰۶، پردازندههای گرافیکی نسل پنجم AMD Instinct MI455X، و شبکه AMD Pensando همراه با فابریک UALoE که ۷۲ پردازنده گرافیکی را در یک حوزه مقیاسبالای واحد با پهنایباند ۲۶۰ ترابایت بر ثانیه به هم متصل میکند.
به گفته ایامدی، این رَک در مقایسه با رَک Vera Rubin NVL72 انویدیا تا ۱۵ درصد محاسبات هوش مصنوعی بیشتر، ۵۰ درصد ظرفیت HBM بیشتر و ۵۰ درصد پهنایباند مقیاسبیرون بیشتر ارائه میدهد؛ هلیوس در مجموع ۲.۹ اگزافلاپس محاسبات چگال FP4، ۱.۴ اگزافلاپس محاسبات FP8، ۳۱ ترابایت حافظه HBM4، ۱.۷ پتابایت بر ثانیه پهنایباند تجمعی HBM، ۲۶۰ ترابایت بر ثانیه پهنایباند مقیاسبالا و ۴۳ ترابایت بر ثانیه پهنایباند مقیاسبیرون دارد.
عملکرد و اقتصاد در مقیاس کارخانه هوش مصنوعی
ایامدی میگوید مشخصات اوج فقط مقیاس رَک را نشان میدهند؛ آنچه در عمل اهمیت دارد، توان عملیاتی در سطح معینی از تعامل، تعداد توکن تحویلی بهازای هر دلار، و تعداد بارهای کاری است که یک رَک میتواند همزمان اجرا کند. روی مدل Kimi K2 Thinking با دنباله ورودی ۳۲ هزار توکن و خروجی ۸ هزار توکن، توان عملیاتی مدلسازیشده هلیوس بهازای هر پردازنده گرافیکی در تعامل پایین تا ۱۵ درصد، در تعامل متوسط تا ۱۲ درصد و در تعامل بالا تا ۱۰ درصد بیشتر از عملکرد مدلسازیشده رَک Vera Rubin NVL72 انویدیا است؛ ایامدی این برتری را معادل تا ۳۰ درصد توکن بیشتر بهازای هر دلار نسبت به Vera Rubin NVL72 عنوان میکند.
باز بودن در تمام لایهها، از رَک تا نرمافزار
پشته نرمافزاری AMD ROCm سختافزار هلیوس را به بارهای کاری تولیدی متصل میکند و بهطور بومی از PyTorch، TensorFlow و JAX پشتیبانی میکند، در کنار کتابخانههای بهینهشده، استانداردهای باز و ابزارهایی برای استقرار، پایش و مدیریت چرخه عمر. ایامدی میگوید هلیوس هماکنون توسط شرکتهای هوش مصنوعی از جمله OpenAI، Meta، Microsoft و Oracle، و نیز شرکای زیرساختی از جمله Dell، HPE، IBM و Cisco، در حال پذیرش است.
جمعبندی پایانی
ایامدی هلیوس را گسترش دستاوردهای MI455X در زمینه محاسبات، پهنایباند حافظه و ظرفیت HBM به یک پلتفرم کامل رَکمقیاس متشکل از ۷۲ پردازنده گرافیکی، پردازندههای EPYC «ونیز»، شبکه Pensando، نرمافزار ROCm و معماری باز توصیف میکند؛ بخشی از آنچه این شرکت آن را گذار به یک چرخه سالانه، باز و چندنسلی برای زیرساخت هوش مصنوعی رَکمقیاس مینامد. به بیان ایامدی، «رَک دیگر صرفاً جایی نیست که سامانه هوش مصنوعی در آن نصب میشود»، بلکه «خود سامانه هوش مصنوعی» است.
منابع
- AMD Launches Helios: The Highest Performing Rackscale AI Infrastructure Solution — AMD