پرش به محتوای اصلی
ORYX

Blog · 6 دقیقه مطالعه

استنتاج عامل‌محور برای MLPerf Inference

مجموعه معیارهای MLPerf Inference باید هم‌گام با الگوهای استقرار هوش مصنوعی تکامل یابد.

ام‌ال‌کامانز (MLCommons)
Read in English →

مقدمه

مجموعه معیارهای MLPerf Inference باید هم‌گام با شیوه‌های واقعی استقرار هوش مصنوعی تکامل یابد. آزمون‌های اولیه بر طبقه‌بندی تصویر، تشخیص اشیاء، تشخیص گفتار، توصیه‌گر و تولید متن تک‌نوبتی متمرکز بودند؛ این بارهای کاری هنوز مهم‌اند، اما یکی از سریع‌ترین الگوهای رو به رشدِ استفاده از مدل‌های زبانی بزرگ در تولید را پوشش نمی‌دهند: استنتاج عامل‌محورِ چندنوبتی، جایی که یک دستیار برنامه‌نویسی یا یک عامل گردش‌کار به‌جای پاسخ به یک پرسش تنها، زمینه را می‌خواند، ابزار فراخوانی می‌کند و در طول نوبت‌های وابسته متعدد تکرار می‌کند. به گفته ام‌ال‌کامانز، این موضوع مسئله سرویس‌دهی را از چند جهت تغییر می‌دهد: زمینه و فشار حافظه‌نهان KV در طول یک مسیر گفت‌وگو رشد می‌کند، بازاستفاده از حافظه‌نهان KV به بهینه‌سازی کلیدی تبدیل می‌شود، طول خروجی‌ها از فراخوانی‌های کوتاه ابزار تا زنجیره‌های استدلال طولانی نوسان دارد، و توان عملیاتی باید به‌صورت پیشرفت حلقه‌بسته سنجیده شود، نه نرخ درخواست‌های مستقل. معیار جدید استنتاج عامل‌محور این دسته از بار کاری را به چارچوب MLPerf Endpoints اضافه می‌کند و ضمن حفظ اصول کلی سنجش MLPerf، انتخاب مدل، ترکیب دیتاست، تولید بار چندنوبتی، اعتبارسنجی خروجی و قواعد بهینه‌سازی‌هایی مانند حافظه‌نهان پیشوندی و رمزگشایی حدسی را تعریف می‌کند.

انتخاب مدل

این معیار به مدل‌های زمینه-بلند و توانمند در استدلال نیاز داشت که رفتار سرویس‌دهی سامانه‌های عامل‌محور را به چالش بکشند؛ از این‌رو ام‌ال‌کامانز دو مدل را برگزید: Kimi K2.6، یک مدل بزرگ آمیخته‌کارشناسان (۱ تریلیون پارامتر، ۳۲ میلیارد پارامتر فعال) که نماینده سامانه‌های عامل‌محور پیشرو است و با سری رمزگشایی حدسی مبتنی بر Eagle3 ارزیابی شده؛ و Qwen3.6-35B-A3B، مدلی کوچک‌تر (۳۵ میلیارد پارامتر، ۳ میلیارد فعال) با معماری تازه Gated DeltaNet و رمزگشایی چندنشانه‌ای بومی. هر دو مدل پنجره زمینه ۲۶۲٬۱۴۴ نشانه‌ای دارند و با روش و دیتاست یکسان ارزیابی می‌شوند، اما هرکدام نتیجه جداگانه خود را تولید می‌کند؛ این دو مدل هرگز در یک امتیاز واحد ترکیب نمی‌شوند.

انتخاب دیتاست و وظایف

دیتاست مرجع دو حوزه عامل‌محور را ترکیب می‌کند که هرکدام بخش متفاوتی از پشته سرویس‌دهی را تحت فشار می‌گذارند: مجموعاً ۶۱۳ مسیر گفت‌وگوی چندنوبتی — شامل ۱۱۳ مسیرِ برنامه‌نویسیِ عامل‌محور و ۵۰۰ مسیرِ گردش‌کارِ عامل‌محور — با نزدیک به ۳۰ هزار نوبتِ صادرشده از سمت کاربر و تعداد مشابهی نوبت پاسخ دستیار. مسیرهای برنامه‌نویسی از دیتاست DeepSWE ساخته‌شده توسط DataCurve (datacurve.ai) گرفته شده‌اند: کاربر یک مشکل نرم‌افزاری گزارش می‌کند و عامل با اجرای دستورات bash مخزن کد را بررسی می‌کند، کد را می‌خواند، آزمون اجرا می‌کند و تکرار می‌کند؛ این مسیرها عمیق‌اند (میانه‌ای در حد چند ده نوبت) و زمینه آن‌ها پیوسته رشد می‌کند. مسیرهای گردش‌کار که توسط Workato ارائه شده‌اند، مسیرهای مصنوعی‌ای هستند که بر پایه تجربه عملیاتی Workato در اجرای عامل‌های پشتیبانی مشتری سازمانی مدل‌سازی شده‌اند — مسیرهایی کم‌عمق‌تر اما با یک اعلان سامانه مشترکِ بزرگ حاوی تعاریف متعدد ابزار. ترافیک برنامه‌نویسی ظرفیت حافظه‌نهان KV و زمان‌بندی زمینه‌بلند را به چالش می‌کشد؛ ترافیک گردش‌کار بازاستفاده از پیشوند مشترک و محلی‌سازی مسیریابی را. ترکیب هر دو، سامانه سرویس‌دهی را از بهینه‌سازی صرف برای یک الگوی ترافیکی بازمی‌دارد.

طراحی کلاینت

ام‌ال‌کامانز پشتیبانی چندنوبتی را به MLPerf Endpoints افزود تا شرکت‌کنندگان بتوانند یک نقطه پایانی استاندارد سازگار با OpenAI (مانند vLLM، SGLang، TensorRT-LLM یا مشابه) را سر تا سر بسنجند. کلاینت موارد زیر را مدیریت می‌کند: پخش حلقه‌بسته (یک گفت‌وگوی فعال هر بار یک نوبت را صادر می‌کند و منتظر پاسخ کامل می‌ماند)، کنترل هم‌زمانی هدف بدون شکستن ترتیب نوبت‌ها، درج تأخیرهای میان‌نوبتیِ تعیین‌شده در دیتاست بدون احتساب آن‌ها در تأخیر سرویس‌دهی، ارسال یک شناسه نشست پایدار برای هر مسیر تا مسیریاب‌ها بتوانند محلی‌بودن حافظه‌نهان KV را حفظ کنند، استفاده از «نمک‌گذاری حافظه‌نهان» قطعی برای اجازه بازاستفاده معتبر درون یک مسیر و مسدودسازی بازاستفاده نامعتبر میان مسیرها، بازسازی اعلان‌های آینده از دیتاست از پیش‌ضبط‌شده (نه از خروجی زنده مدل) برای حفظ تکرارپذیری، و پاک‌سازی نشانه‌های تولیدشده از حافظه‌نهان KV تا نتایج به سامانه‌ای که مسیرها را در ابتدا تولید کرده وابسته نباشد.

معیارهای عملکرد

نتایج به‌صورت یک منحنی پارتو گزارش می‌شوند که هر نقطه آن یک اجرای معیار با هم‌زمانی ثابت است. محور عمودی، نشانه‌های خروجی در ثانیه به ازای هر سامانه (توان عملیاتی کل) است؛ محور افقی، نشانه‌های خروجی در ثانیه به ازای هر کاربر است، یعنی سرعت پیشرفت یک عامل منفرد در انجام وظیفه‌اش. با افزایش هم‌زمانی، سامانه می‌تواند کار کلی بیشتری انجام دهد حتی اگر پیشرفت هر عامل به‌تنهایی کندتر شود؛ هدف منحنی پارتو نمایان‌کردن همین بده‌بستان است.

معیارهای دقت

دقت در سه سطح بررسی می‌شود تا نتایج سریع‌تر ناشی از پاسخ‌های کوتاه‌تر یا کم‌کیفیت‌تر نباشند: بررسی میانگین طول توالی خروجی برای تطبیق با توزیع طول موردانتظار بار کاری؛ بررسی دقت درون‌خطی که خروجی‌های اجرای عملکرد را با داده‌های حقیقت زمینه مقایسه می‌کند (شامل بررسی فراخوانی ابزار در برنامه‌نویسی و بررسی کد قصد در گردش‌کار)؛ و بررسی دقت مستقل که با ۲۰۰ وظیفه از دیتاست SWE-bench Verified توانایی سر تا سر حل وظیفه را تأیید می‌کند. هر سه سطح باید برای هر نقطه از منحنی پارتو از آستانه تعیین‌شده عبور کنند. ام‌ال‌کامانز ارقام دقت موقت (قابل تغییر) زیر را منتشر کرده است: دقت درون‌خطی ۶۳٫۰۸٪ برای Kimi K2.6 در برابر ۵۵٫۸۶٪ برای Qwen3.6-35B-A3B؛ دقت مستقل ۷۶٫۵٪ در برابر ۶۷٫۰٪؛ و بازه میانگین طول خروجی هر نوبت [۴۰۴ تا ۴۹۴] نشانه در برابر [۳۵۵ تا ۴۳۴] نشانه.

جمع‌بندی

ام‌ال‌کامانز استنتاج عامل‌محور را یکی از سریع‌ترین کاربردهای رو به رشد هوش مصنوعی و مسئله سرویس‌دهیِ به‌مراتب دشوارتری نسبت به تولید تک‌نوبتی می‌داند؛ با زمینه رو به رشد، وابستگی‌های سخت‌گیرانه میان نوبت‌ها، تأخیرهای ناشی از ابزار، پیشوندهای مشترک، مسیرهای دنباله‌بلند و بررسی‌های کیفیتی که باید روی همان پیکربندیِ استفاده‌شده در آزمون عملکرد اجرا شوند.

منابع

  • Agentic Inference for MLPerf Inference MLCommons

Next step

اوریکس را روی سناریوی واقعی شبکه‌ی خودتان ببینید.

در جلسه‌ی دمو، به‌جای ارائه‌ی عمومی، یک سناریوی واقعی از محیط شما را بررسی می‌کنیم: یک تغییر پرریسک، یک رخداد اخیر، یا حجم لاگی که تیم شما هر روز با آن روبه‌روست.