متا Muse Spark 1.3 عرضه شد؛ xhigh هم‌اکنون در دسترس

متا نسخهٔ 1.3 مدل Muse Spark را منتشر کرد. tier «xhigh» از همین حالا قابل استفاده است و نسخهٔ قدرتمندتر «max» فعلاً به‌صورت پیش‌نمایش محدود برای شرکا فعال شده است. بزرگ‌ترین پیشرفت‌ها در وظایف عامل‌محور رخ داده؛ با این حال در بسیاری از بنچ‌مارک‌ها مدل‌هایی مانند Claude Fable 5.1 همچنان جلوتر قرار دارند.

نکات کلیدی

  • دسترسی: tier «xhigh» در دسترس همه قرار دارد و «max» به‌صورت پیش‌نمایش محدود عرضه شده است.
  • قیمت: هزینهٔ اجرای هر آزمون شاخص حدود 0.55 دلار است؛ قیمت توکنی اعلام‌شده 1.25 دلار برای هر میلیون توکن ورودی و 4.25 دلار برای هر میلیون توکن خروجی است.
  • عملکرد: بیشترین ارتقا در آزمون‌های عامل‌محور دیده می‌شود؛ اما در برخی زیرآزمون‌ها مدل‌های رقیب جلوتر هستند.
  • آینده: متا انتشار نسخهٔ open-weights و مدل‌های بزرگ‌تر را وعده داده است.

قیمت و هزینه‌ها؛ ارزان‌تر از رقبا

متا Muse Spark 1.3 را از طریق Muse Code و Meta Model API عرضه کرده است. قیمت توکنی اعلام‌شده ثابت مانده: 1.25 دلار برای هر میلیون توکن ورودی و 4.25 دلار برای هر میلیون توکن خروجی. با این نرخ‌ها، هر آزمون شاخص حدود 0.55 دلار هزینه دارد؛ رقبا در همین رده قیمتی معمولاً بین 0.94 تا 1.23 دلار قیمت‌گذاری شده‌اند. نسخهٔ قبلی (1.2) حدود 0.40 دلار برای هر آزمون بود، پس هزینهٔ هر آزمون در نسخهٔ 1.3 افزایش یافته است.

علت افزایش امتیازات

شاخص هوش (Intelligence Index) برای هر زیرآزمون وزن مشخصی در نظر می‌گیرد و بیشترین پیشرفت‌های Muse Spark 1.3 مربوط به زیرآزمون‌هایی است که وزن بیشتری در این شاخص دارند. برای آشنایی با مفهوم بنچ‌مارک‌ها می‌توان به صفحهٔ بنچ‌مارک در ویکی‌پدیا مراجعه کرد.

جزئیات عملکرد در زیرآزمون‌های کلیدی

  • τ³-Bench Banking: در سناریوی شبیه‌سازی‌شدهٔ بانکی که عامل‌ها باید ابزارها را به‌کار بگیرند، نسخهٔ max به 52% رسیده و در صدر قرار دارد. نسخهٔ xhigh به 47% رسیده که برابر با Claude Fable 5.1 (max) و GLM-5.3-Flash است. نسخهٔ 1.2 حدوداً 35% ثبت کرده بود.
  • Terminal-Bench 2.1: در تست‌های برنامه‌نویسی در ترمینال، xhigh از 80% به 85% رسید و max به 86% ارتقا یافت؛ با این حال Claude Fable 5.1 همچنان پیشتاز است.
  • GDPval-AA v2: در آزمونی که عملکرد مدل را در مقایسه با کارشناسان انسانی (مقیاس 1000) می‌سنجد، امتیازها برای متا از 1,615 به 1,709 (xhigh) و 1,754 (max) افزایش یافته؛ در حالی که Claude Fable 5.1 (max) روی 1,853 قرار دارد.
نمودار عملکرد Muse Spark 1.3 در بنچ‌مارک‌ها

حوزه‌هایی که مدل هنوز بهبود نیاز دارد

خارج از آزمون‌های عامل‌محور، Muse Spark 1.3 اغلب در میانهٔ جدول قرار می‌گیرد. در GPQA Diamond نمره از 90 به 94 درصد افزایش یافته که در ردهٔ بالا قرار می‌گیرد، اما از مدل‌هایی مانند Gemini و Grok عقب است. در حوزهٔ فیزیک پژوهشی (CritPt) نیز پیشرفت وجود دارد، اما هنوز فاصله‌ای با مدل‌های پیشرو مانند GPT-5.6 Sol و Claude Fable دیده می‌شود.

دو معیار نسبت به نسخهٔ 1.2 کاهش یافته‌اند: AA-LCR از 83 به 79 درصد و دقت حقیقی در AA-Omniscience تا حدود 3 امتیاز افت داشته است؛ بخشی از این کاهش ناشی از تمایل بیشتر مدل به خودداری از پاسخ در شرایط عدم اطمینان است.

نکاتی برای دنبال‌ کردن

متا هنوز قیمت رسمی نسخهٔ max را اعلام نکرده و انتشار نسخهٔ open-weights و مدل‌های بزرگ‌تر را وعده داده است. این تغییرات می‌تواند رقابت قیمتی را تشدید کند و توسعه‌دهندگان و شرکت‌ها را به بازبینی گزینه‌ها و تنظیم معماری‌های کاربردی‌شان ترغیب کند. برای مرور فعالیت‌های متا می‌توان به صفحهٔ Meta Platforms و برای پوشش خبری گسترده‌تر به TechCrunch مراجعه کرد.

چشم‌انداز و جمع‌بندی

Muse Spark 1.3 نشان می‌دهد متا با تمرکز بر بهبود عملکرد در وظایف عامل‌محور و ارائهٔ قیمت رقابتی به دنبال افزایش سهم بازار است؛ با این حال برای رسیدن به صدر بنچ‌مارک‌ها هنوز جای کار باقی است. انتشار نسخهٔ open-weights و اعلام قیمت نهایی tier «max» از مواردی است که باید در هفته‌ها و ماه‌های آینده پیگیری شود.