پرش به محتوای اصلی
ORYX

Blog · 3 دقیقه مطالعه

مدل‌های متن‌باز چهار ماه از به‌روزترین مدل‌های بسته عقب‌ترند

از ژانویه ۲۰۲۶ تاکنون، توانمندترین مدل‌های وزن-باز به‌طور میانگین چهار ماه از مدل‌های بسته پیشرو در شاخص توانمندی اپاک (ECI) — معیار ترکیبی این مؤسسه برای سنجش توانمندی مدل‌ها — عقب بوده‌اند.

جک ادواردز و لوک امبرسون (اپاک AI)
Read in English →

یافته اصلی

اپاک AI گزارش می‌دهد که از ژانویه ۲۰۲۶ تاکنون، بهترین مدل‌های وزن-باز به‌طور میانگین چهار ماه از مدل‌های بسته پیشرو بر پایه شاخص توانمندی اپاک (ECI) — معیار ترکیبی این مؤسسه برای سنجش توانمندی مدل‌ها — عقب مانده‌اند. به گفته اپاک، «فاصله میانگین شاخص ECI برابر ۸ امتیاز بود، مشابه فاصله میان GPT-5 و GPT-5.5.»

مقایسه با برآورد پیشین

این فاصله اندکی بیشتر از عقب‌ماندگی سه‌ماهه‌ای است که اپاک در تحلیل پیشین خود در اکتبر ۲۰۲۵ یافته بود؛ آن تحلیل بازه ژانویه ۲۰۲۳ تا اکتبر ۲۰۲۵ را پوشش می‌داد.

روش‌شناسی

برای محاسبه فاصله زمانی، اپاک AI بازه تحلیل خود را روز به روز از ۱ ژانویه تا ۲۸ مه ۲۰۲۶ بررسی کرد. برای هر روز، برتری‌داشته‌ترین مدل وزن-باز موجود تا آن تاریخ شناسایی و این پرسش مطرح می‌شد: آخرین تاریخی که در آن هیچ مدل بسته‌ای به‌طور معنادار بهتر از این مدل باز نبود، چه زمانی بوده است؟ تعداد روزهای سپری‌شده از آن تاریخ، فاصله زمانی همان روز را می‌سازد. از آنجا که امتیازهای ECI با عدم قطعیت آماری همراه‌اند، اپاک از روش نمونه‌گیری بوت‌استرپ روی داده‌های معیار خود برای این مقایسه استفاده کرد و مدل باز را در صورتی «رسیده» به مدل پیشین در نظر گرفت که در دست‌کم ۵٪ نمونه‌های جفت‌شده بوت‌استرپ از آن مدل بسته پیشی می‌گرفت. بر این اساس، میانگین فاصله زمانی چهار ماه به‌دست آمد؛ اگر شرط سخت‌گیرانه‌تری اعمال می‌شد — برتری قطعی برآورد نقطه‌ای مدل باز به‌جای صرفاً عدم شکست معنادار — این برآورد به شش ماه می‌رسید. اندازه‌گیری فاصله بر حسب امتیاز ECI به‌جای زمان — یعنی میانگین فاصله عمودی میان مرز مدل‌های بسته و باز در طول بازه — برابر ۸ امتیاز با بازه اطمینان ۹۰٪ معادل ۷ تا ۱۱ امتیاز به‌دست آمد.

محدودیت‌ها

اپاک AI به دو عامل اشاره می‌کند که ممکن است باعث کم‌برآوردشدن فاصله واقعی میان مدل‌های باز و بسته شوند: نخست، مدل‌های وزن-باز نسبت به مدل‌های بسته در معیارهای خصوصی — احتمالاً به این دلیل که توسعه‌دهندگان آن‌ها با شدت بیشتری روی تابلوهای امتیاز عمومی بهینه‌سازی می‌کنند — عملکرد ضعیف‌تری از خود نشان می‌دهند؛ دوم، این تحلیل تنها مدل‌هایی را دربرمی‌گیرد که پوشش کافی در معیارهای عمومی برای محاسبه امتیاز ECI دارند، در حالی که آزمایشگاه‌های بسته پیشرو همیشه توانمندترین مدل‌های خود را به‌دلایل ایمنی، تجاری یا رقابتی عمومی منتشر نمی‌کنند.

منابع

  • Open models lag state-of-the-art closed models by 4 months Epoch AI

Next step

اوریکس را روی سناریوی واقعی شبکه‌ی خودتان ببینید.

در جلسه‌ی دمو، به‌جای ارائه‌ی عمومی، یک سناریوی واقعی از محیط شما را بررسی می‌کنیم: یک تغییر پرریسک، یک رخداد اخیر، یا حجم لاگی که تیم شما هر روز با آن روبه‌روست.