متا Muse Spark 1.3 عرضه شد؛ xhigh هماکنون در دسترس
متا نسخهٔ 1.3 مدل Muse Spark را منتشر کرد. tier «xhigh» از همین حالا قابل استفاده است و نسخهٔ قدرتمندتر «max» فعلاً بهصورت پیشنمایش محدود برای شرکا فعال شده است. بزرگترین پیشرفتها در وظایف عاملمحور رخ داده؛ با این حال در بسیاری از بنچمارکها مدلهایی مانند Claude Fable 5.1 همچنان جلوتر قرار دارند.
نکات کلیدی
- دسترسی: tier «xhigh» در دسترس همه قرار دارد و «max» بهصورت پیشنمایش محدود عرضه شده است.
- قیمت: هزینهٔ اجرای هر آزمون شاخص حدود 0.55 دلار است؛ قیمت توکنی اعلامشده 1.25 دلار برای هر میلیون توکن ورودی و 4.25 دلار برای هر میلیون توکن خروجی است.
- عملکرد: بیشترین ارتقا در آزمونهای عاملمحور دیده میشود؛ اما در برخی زیرآزمونها مدلهای رقیب جلوتر هستند.
- آینده: متا انتشار نسخهٔ open-weights و مدلهای بزرگتر را وعده داده است.
قیمت و هزینهها؛ ارزانتر از رقبا
متا Muse Spark 1.3 را از طریق Muse Code و Meta Model API عرضه کرده است. قیمت توکنی اعلامشده ثابت مانده: 1.25 دلار برای هر میلیون توکن ورودی و 4.25 دلار برای هر میلیون توکن خروجی. با این نرخها، هر آزمون شاخص حدود 0.55 دلار هزینه دارد؛ رقبا در همین رده قیمتی معمولاً بین 0.94 تا 1.23 دلار قیمتگذاری شدهاند. نسخهٔ قبلی (1.2) حدود 0.40 دلار برای هر آزمون بود، پس هزینهٔ هر آزمون در نسخهٔ 1.3 افزایش یافته است.
علت افزایش امتیازات
شاخص هوش (Intelligence Index) برای هر زیرآزمون وزن مشخصی در نظر میگیرد و بیشترین پیشرفتهای Muse Spark 1.3 مربوط به زیرآزمونهایی است که وزن بیشتری در این شاخص دارند. برای آشنایی با مفهوم بنچمارکها میتوان به صفحهٔ بنچمارک در ویکیپدیا مراجعه کرد.
جزئیات عملکرد در زیرآزمونهای کلیدی
- τ³-Bench Banking: در سناریوی شبیهسازیشدهٔ بانکی که عاملها باید ابزارها را بهکار بگیرند، نسخهٔ max به 52% رسیده و در صدر قرار دارد. نسخهٔ xhigh به 47% رسیده که برابر با Claude Fable 5.1 (max) و GLM-5.3-Flash است. نسخهٔ 1.2 حدوداً 35% ثبت کرده بود.
- Terminal-Bench 2.1: در تستهای برنامهنویسی در ترمینال، xhigh از 80% به 85% رسید و max به 86% ارتقا یافت؛ با این حال Claude Fable 5.1 همچنان پیشتاز است.
- GDPval-AA v2: در آزمونی که عملکرد مدل را در مقایسه با کارشناسان انسانی (مقیاس 1000) میسنجد، امتیازها برای متا از 1,615 به 1,709 (xhigh) و 1,754 (max) افزایش یافته؛ در حالی که Claude Fable 5.1 (max) روی 1,853 قرار دارد.
حوزههایی که مدل هنوز بهبود نیاز دارد
خارج از آزمونهای عاملمحور، Muse Spark 1.3 اغلب در میانهٔ جدول قرار میگیرد. در GPQA Diamond نمره از 90 به 94 درصد افزایش یافته که در ردهٔ بالا قرار میگیرد، اما از مدلهایی مانند Gemini و Grok عقب است. در حوزهٔ فیزیک پژوهشی (CritPt) نیز پیشرفت وجود دارد، اما هنوز فاصلهای با مدلهای پیشرو مانند GPT-5.6 Sol و Claude Fable دیده میشود.
دو معیار نسبت به نسخهٔ 1.2 کاهش یافتهاند: AA-LCR از 83 به 79 درصد و دقت حقیقی در AA-Omniscience تا حدود 3 امتیاز افت داشته است؛ بخشی از این کاهش ناشی از تمایل بیشتر مدل به خودداری از پاسخ در شرایط عدم اطمینان است.
نکاتی برای دنبال کردن
متا هنوز قیمت رسمی نسخهٔ max را اعلام نکرده و انتشار نسخهٔ open-weights و مدلهای بزرگتر را وعده داده است. این تغییرات میتواند رقابت قیمتی را تشدید کند و توسعهدهندگان و شرکتها را به بازبینی گزینهها و تنظیم معماریهای کاربردیشان ترغیب کند. برای مرور فعالیتهای متا میتوان به صفحهٔ Meta Platforms و برای پوشش خبری گستردهتر به TechCrunch مراجعه کرد.
چشمانداز و جمعبندی
Muse Spark 1.3 نشان میدهد متا با تمرکز بر بهبود عملکرد در وظایف عاملمحور و ارائهٔ قیمت رقابتی به دنبال افزایش سهم بازار است؛ با این حال برای رسیدن به صدر بنچمارکها هنوز جای کار باقی است. انتشار نسخهٔ open-weights و اعلام قیمت نهایی tier «max» از مواردی است که باید در هفتهها و ماههای آینده پیگیری شود.





