یافته اصلی
اپاک AI گزارش میدهد که از ژانویه ۲۰۲۶ تاکنون، بهترین مدلهای وزن-باز بهطور میانگین چهار ماه از مدلهای بسته پیشرو بر پایه شاخص توانمندی اپاک (ECI) — معیار ترکیبی این مؤسسه برای سنجش توانمندی مدلها — عقب ماندهاند. به گفته اپاک، «فاصله میانگین شاخص ECI برابر ۸ امتیاز بود، مشابه فاصله میان GPT-5 و GPT-5.5.»
مقایسه با برآورد پیشین
این فاصله اندکی بیشتر از عقبماندگی سهماههای است که اپاک در تحلیل پیشین خود در اکتبر ۲۰۲۵ یافته بود؛ آن تحلیل بازه ژانویه ۲۰۲۳ تا اکتبر ۲۰۲۵ را پوشش میداد.
روششناسی
برای محاسبه فاصله زمانی، اپاک AI بازه تحلیل خود را روز به روز از ۱ ژانویه تا ۲۸ مه ۲۰۲۶ بررسی کرد. برای هر روز، برتریداشتهترین مدل وزن-باز موجود تا آن تاریخ شناسایی و این پرسش مطرح میشد: آخرین تاریخی که در آن هیچ مدل بستهای بهطور معنادار بهتر از این مدل باز نبود، چه زمانی بوده است؟ تعداد روزهای سپریشده از آن تاریخ، فاصله زمانی همان روز را میسازد. از آنجا که امتیازهای ECI با عدم قطعیت آماری همراهاند، اپاک از روش نمونهگیری بوتاسترپ روی دادههای معیار خود برای این مقایسه استفاده کرد و مدل باز را در صورتی «رسیده» به مدل پیشین در نظر گرفت که در دستکم ۵٪ نمونههای جفتشده بوتاسترپ از آن مدل بسته پیشی میگرفت. بر این اساس، میانگین فاصله زمانی چهار ماه بهدست آمد؛ اگر شرط سختگیرانهتری اعمال میشد — برتری قطعی برآورد نقطهای مدل باز بهجای صرفاً عدم شکست معنادار — این برآورد به شش ماه میرسید. اندازهگیری فاصله بر حسب امتیاز ECI بهجای زمان — یعنی میانگین فاصله عمودی میان مرز مدلهای بسته و باز در طول بازه — برابر ۸ امتیاز با بازه اطمینان ۹۰٪ معادل ۷ تا ۱۱ امتیاز بهدست آمد.
محدودیتها
اپاک AI به دو عامل اشاره میکند که ممکن است باعث کمبرآوردشدن فاصله واقعی میان مدلهای باز و بسته شوند: نخست، مدلهای وزن-باز نسبت به مدلهای بسته در معیارهای خصوصی — احتمالاً به این دلیل که توسعهدهندگان آنها با شدت بیشتری روی تابلوهای امتیاز عمومی بهینهسازی میکنند — عملکرد ضعیفتری از خود نشان میدهند؛ دوم، این تحلیل تنها مدلهایی را دربرمیگیرد که پوشش کافی در معیارهای عمومی برای محاسبه امتیاز ECI دارند، در حالی که آزمایشگاههای بسته پیشرو همیشه توانمندترین مدلهای خود را بهدلایل ایمنی، تجاری یا رقابتی عمومی منتشر نمیکنند.
منابع
- Open models lag state-of-the-art closed models by 4 months — Epoch AI