مقدمه
مجموعه معیارهای MLPerf Inference باید همگام با شیوههای واقعی استقرار هوش مصنوعی تکامل یابد. آزمونهای اولیه بر طبقهبندی تصویر، تشخیص اشیاء، تشخیص گفتار، توصیهگر و تولید متن تکنوبتی متمرکز بودند؛ این بارهای کاری هنوز مهماند، اما یکی از سریعترین الگوهای رو به رشدِ استفاده از مدلهای زبانی بزرگ در تولید را پوشش نمیدهند: استنتاج عاملمحورِ چندنوبتی، جایی که یک دستیار برنامهنویسی یا یک عامل گردشکار بهجای پاسخ به یک پرسش تنها، زمینه را میخواند، ابزار فراخوانی میکند و در طول نوبتهای وابسته متعدد تکرار میکند. به گفته امالکامانز، این موضوع مسئله سرویسدهی را از چند جهت تغییر میدهد: زمینه و فشار حافظهنهان KV در طول یک مسیر گفتوگو رشد میکند، بازاستفاده از حافظهنهان KV به بهینهسازی کلیدی تبدیل میشود، طول خروجیها از فراخوانیهای کوتاه ابزار تا زنجیرههای استدلال طولانی نوسان دارد، و توان عملیاتی باید بهصورت پیشرفت حلقهبسته سنجیده شود، نه نرخ درخواستهای مستقل. معیار جدید استنتاج عاملمحور این دسته از بار کاری را به چارچوب MLPerf Endpoints اضافه میکند و ضمن حفظ اصول کلی سنجش MLPerf، انتخاب مدل، ترکیب دیتاست، تولید بار چندنوبتی، اعتبارسنجی خروجی و قواعد بهینهسازیهایی مانند حافظهنهان پیشوندی و رمزگشایی حدسی را تعریف میکند.
انتخاب مدل
این معیار به مدلهای زمینه-بلند و توانمند در استدلال نیاز داشت که رفتار سرویسدهی سامانههای عاملمحور را به چالش بکشند؛ از اینرو امالکامانز دو مدل را برگزید: Kimi K2.6، یک مدل بزرگ آمیختهکارشناسان (۱ تریلیون پارامتر، ۳۲ میلیارد پارامتر فعال) که نماینده سامانههای عاملمحور پیشرو است و با سری رمزگشایی حدسی مبتنی بر Eagle3 ارزیابی شده؛ و Qwen3.6-35B-A3B، مدلی کوچکتر (۳۵ میلیارد پارامتر، ۳ میلیارد فعال) با معماری تازه Gated DeltaNet و رمزگشایی چندنشانهای بومی. هر دو مدل پنجره زمینه ۲۶۲٬۱۴۴ نشانهای دارند و با روش و دیتاست یکسان ارزیابی میشوند، اما هرکدام نتیجه جداگانه خود را تولید میکند؛ این دو مدل هرگز در یک امتیاز واحد ترکیب نمیشوند.
انتخاب دیتاست و وظایف
دیتاست مرجع دو حوزه عاملمحور را ترکیب میکند که هرکدام بخش متفاوتی از پشته سرویسدهی را تحت فشار میگذارند: مجموعاً ۶۱۳ مسیر گفتوگوی چندنوبتی — شامل ۱۱۳ مسیرِ برنامهنویسیِ عاملمحور و ۵۰۰ مسیرِ گردشکارِ عاملمحور — با نزدیک به ۳۰ هزار نوبتِ صادرشده از سمت کاربر و تعداد مشابهی نوبت پاسخ دستیار. مسیرهای برنامهنویسی از دیتاست DeepSWE ساختهشده توسط DataCurve (datacurve.ai) گرفته شدهاند: کاربر یک مشکل نرمافزاری گزارش میکند و عامل با اجرای دستورات bash مخزن کد را بررسی میکند، کد را میخواند، آزمون اجرا میکند و تکرار میکند؛ این مسیرها عمیقاند (میانهای در حد چند ده نوبت) و زمینه آنها پیوسته رشد میکند. مسیرهای گردشکار که توسط Workato ارائه شدهاند، مسیرهای مصنوعیای هستند که بر پایه تجربه عملیاتی Workato در اجرای عاملهای پشتیبانی مشتری سازمانی مدلسازی شدهاند — مسیرهایی کمعمقتر اما با یک اعلان سامانه مشترکِ بزرگ حاوی تعاریف متعدد ابزار. ترافیک برنامهنویسی ظرفیت حافظهنهان KV و زمانبندی زمینهبلند را به چالش میکشد؛ ترافیک گردشکار بازاستفاده از پیشوند مشترک و محلیسازی مسیریابی را. ترکیب هر دو، سامانه سرویسدهی را از بهینهسازی صرف برای یک الگوی ترافیکی بازمیدارد.
طراحی کلاینت
امالکامانز پشتیبانی چندنوبتی را به MLPerf Endpoints افزود تا شرکتکنندگان بتوانند یک نقطه پایانی استاندارد سازگار با OpenAI (مانند vLLM، SGLang، TensorRT-LLM یا مشابه) را سر تا سر بسنجند. کلاینت موارد زیر را مدیریت میکند: پخش حلقهبسته (یک گفتوگوی فعال هر بار یک نوبت را صادر میکند و منتظر پاسخ کامل میماند)، کنترل همزمانی هدف بدون شکستن ترتیب نوبتها، درج تأخیرهای میاننوبتیِ تعیینشده در دیتاست بدون احتساب آنها در تأخیر سرویسدهی، ارسال یک شناسه نشست پایدار برای هر مسیر تا مسیریابها بتوانند محلیبودن حافظهنهان KV را حفظ کنند، استفاده از «نمکگذاری حافظهنهان» قطعی برای اجازه بازاستفاده معتبر درون یک مسیر و مسدودسازی بازاستفاده نامعتبر میان مسیرها، بازسازی اعلانهای آینده از دیتاست از پیشضبطشده (نه از خروجی زنده مدل) برای حفظ تکرارپذیری، و پاکسازی نشانههای تولیدشده از حافظهنهان KV تا نتایج به سامانهای که مسیرها را در ابتدا تولید کرده وابسته نباشد.
معیارهای عملکرد
نتایج بهصورت یک منحنی پارتو گزارش میشوند که هر نقطه آن یک اجرای معیار با همزمانی ثابت است. محور عمودی، نشانههای خروجی در ثانیه به ازای هر سامانه (توان عملیاتی کل) است؛ محور افقی، نشانههای خروجی در ثانیه به ازای هر کاربر است، یعنی سرعت پیشرفت یک عامل منفرد در انجام وظیفهاش. با افزایش همزمانی، سامانه میتواند کار کلی بیشتری انجام دهد حتی اگر پیشرفت هر عامل بهتنهایی کندتر شود؛ هدف منحنی پارتو نمایانکردن همین بدهبستان است.
معیارهای دقت
دقت در سه سطح بررسی میشود تا نتایج سریعتر ناشی از پاسخهای کوتاهتر یا کمکیفیتتر نباشند: بررسی میانگین طول توالی خروجی برای تطبیق با توزیع طول موردانتظار بار کاری؛ بررسی دقت درونخطی که خروجیهای اجرای عملکرد را با دادههای حقیقت زمینه مقایسه میکند (شامل بررسی فراخوانی ابزار در برنامهنویسی و بررسی کد قصد در گردشکار)؛ و بررسی دقت مستقل که با ۲۰۰ وظیفه از دیتاست SWE-bench Verified توانایی سر تا سر حل وظیفه را تأیید میکند. هر سه سطح باید برای هر نقطه از منحنی پارتو از آستانه تعیینشده عبور کنند. امالکامانز ارقام دقت موقت (قابل تغییر) زیر را منتشر کرده است: دقت درونخطی ۶۳٫۰۸٪ برای Kimi K2.6 در برابر ۵۵٫۸۶٪ برای Qwen3.6-35B-A3B؛ دقت مستقل ۷۶٫۵٪ در برابر ۶۷٫۰٪؛ و بازه میانگین طول خروجی هر نوبت [۴۰۴ تا ۴۹۴] نشانه در برابر [۳۵۵ تا ۴۳۴] نشانه.
جمعبندی
امالکامانز استنتاج عاملمحور را یکی از سریعترین کاربردهای رو به رشد هوش مصنوعی و مسئله سرویسدهیِ بهمراتب دشوارتری نسبت به تولید تکنوبتی میداند؛ با زمینه رو به رشد، وابستگیهای سختگیرانه میان نوبتها، تأخیرهای ناشی از ابزار، پیشوندهای مشترک، مسیرهای دنبالهبلند و بررسیهای کیفیتی که باید روی همان پیکربندیِ استفادهشده در آزمون عملکرد اجرا شوند.
منابع
- Agentic Inference for MLPerf Inference — MLCommons