برای اولین بار، OpenAI یک مدل با دکمه‌های تفکر عرضه نمی‌کند. GPT-5.6 به‌عنوان سه مدل زبانی بزرگ کاملاً مجزا — Sol، Terra و Luna — با آموزش‌های متفاوت، قیمت‌گذاری متفاوت و سقف توانایی‌های متفاوت عرضه می‌شود. مقایسه‌ای که اهمیت دارد، Sol در مقابل Claude Fable 5، قوی‌ترین مدل عمومی Anthropic در حال حاضر است.

هزینه Sol به ازای هر میلیون توکن ورودی ۵ دلار و خروجی ۳۰ دلار است. Fable 5 با قیمت ۱۰ و ۵۰ دلار — دو برابر گران‌تر — در حال حاضر در چندین معیار که توسعه‌دهندگان واقعاً کار خود را از طریق آن هدایت می‌کنند، شکست می‌خورد. Luna، ارزان‌ترین مدل از سه مدل با قیمت ورودی ۱ دلار و خروجی ۶ دلار، از قبل در کدنویسی از Opus 4.8 Anthropic پیشی گرفته است. این جزئیات آخر در ۱۹ ژوئیه به مشکل واقعی تبدیل می‌شود.

ماه پرآشوب Fable 5

Fable 5 ماه سختی را پشت سر گذاشته است. دولت ایالات متحده در ۱۲ ژوئن آن را ممنوع کرد، پس از آنکه محققان آمازون یک Jailbreak پیدا کردند که مدل را به یک اسکنر آسیب‌پذیری ناخواسته تبدیل می‌کرد. Anthropic آن را به مدت ۱۹ روز در سراسر جهان جمع‌آوری کرد، یک طبقه‌بندی‌کننده ایمنی جدید ساخت و در ۱ ژوئیه با یک پنجره دسترسی فشرده بازگرداند.

از زمان بازگشت، این مدل با مهلت‌های قرضی کار می‌کند. Anthropic قصد داشت آن را در ۷ ژوئیه پشت دیوار پرداخت اعتبارهای مصرفی قرار دهد، سپس به ۱۲ ژوئیه و اکنون به ۱۹ ژوئیه موکول کرد. هر تمدید ساعاتی قبل از مهلت اعلام شد، هرگز از طریق یک پست رسمی.

ما دسترسی به Claude Fable 5 را در تمام طرح‌های پولی تمدید می‌کنیم و همچنین محدودیت نرخ هفتگی Claude Code را تا ۵۰٪ بالاتر تا ۱۹ ژوئیه حفظ می‌کنیم.
— Claude (@claudeai) ۱۲ ژوئیه ۲۰۲۶

دلیل آن سخت نیست. اگر Fable پس از ۱۹ ژوئیه از اشتراک‌ها خارج شود، بهترین مدل Anthropic برای مشترکان پولی Opus 4.8 می‌شود — که Luna قبلاً در کدنویسی با کسری از قیمت آن را شکست می‌دهد. نگه داشتن Fable در دسترس، حتی با ۵۰٪ از محدودیت‌های هفتگی، تنها چیزی است که باعث می‌شود رده اشتراک Anthropic روی کاغذ بدتر از رده میانی OpenAI به نظر نرسد.

رقابت در معیارها

رو در رو در معیارها، رقابت نزدیک است. در شاخص عامل کدنویسی تحلیل مصنوعی (Artificial Analysis Coding Agent Index)، Sol امتیاز ۸۰ را در مقابل ۷۷.۲ Fable کسب کرد — با استفاده از تقریباً نصف توکن‌ها، در کمتر از نصف زمان، با حدود یک سوم هزینه. در آخرین آزمون عامل‌ها (Agents' Last Exam) که گردش کار حرفه‌ای را در ۵۵ زمینه اجرا می‌کند، Sol به ۵۳.۶٪ در مقابل ۴۰.۵٪ Fable رسید. در Terminal-Bench 2.1، Sol در حالت فوق‌العاده (چهار زیرعامل به صورت موازی) به ۹۱.۹٪ در مقابل ۸۳.۱٪ Fable دست یافت.

در شاخص هوش گسترده‌تر (Intelligence Index) که ۹ معیار مختلف را جمع‌آوری می‌کند، Fable 5 تنها با یک امتیاز از GPT 5.6 پیشی می‌گیرد، به این معنی که شکاف توانایی به سختی قابل توجه است.

آزمایش مدل‌ها

معیارها و تست‌ها بیش از حد بر توانایی‌های کدنویسی برای اندازه‌گیری توانایی یک مدل تمرکز کرده‌اند. اما ما هکر نیستیم، بنابراین به غیر از یک بازی ساده کدگذاری شده با حس، از پرامپت‌های دیگری استفاده کردیم که کمی از سناریوی معمول کدنویسی فاصله دارند. در اینجا آنچه واقعاً اتفاق افتاد است.

مقایسه GPT-5.6 Sol و Claude Fable 5 در تست نویسندگی خلاق

نوشتن خلاق

ما همان پرامپت (موجود در گیت‌هاب ما) را از طریق هر دو مدل اجرا کردیم: خوزه لانز را از سال ۲۱۵۰ به سال ۱۰۰۰ بفرستید، او را در یک پارادوکس سفر در زمان قرار دهید و نگذارید تا زمانی که به خانه بازگردد، بفهمد چه کرده است.

هر دو مدل چیزی نزدیک‌تر به یک داستان کوتاه بلند تا یک داستان کوتاه تحویل دادند. هر دو همچنین یک قانون مهم را نقض کردند: توجه به پارادوکس زمانی که به آینده بازمی‌گردد.

GPT-5.6 Sol باعث می‌شود خوزه در اواسط داستان بفهمد که 'مسافر ناشناس کسی نبود که برای متوقف کردنش آمده بود. خودش بود.' Fable در این مورد حتی مستقیم‌تر است، با خوزه که در گذشته متوجه می‌شود کل پارادوکس به خاطر او اتفاق افتاده است. 'هیچ رویداد بذری وجود نداشت. او خود رویداد بذر بود.'

ورودی GPT-5.6 Sol، 'The First Fire'، به سراغ علمی-تخیلی ژانر مستقیم می‌رود — خوزه به طور تصادفی کوره‌ای را معرفی می‌کند که فروپاشی آب و هوایی را که برای جلوگیری از آن بازگشته بود، آغاز می‌کند. شروع واقعاً خوب است: 'فقط رعد. فقط حشرات. فقط نفس خیس جهان قبل از ماشین‌ها.'

با این حال، مشکل این است که Sol به آن تصویر اعتماد ندارد که کار خود را انجام دهد. حلقه را توضیح می‌دهد، سپس دوباره توضیح می‌دهد، سپس نسخه قدیمی‌تری از خوزه یک ضبط صوتی باقی می‌گذارد که آن را برای سومین بار توضیح می‌دهد: 'تلاش او برای حل مشکل، مشکل را ایجاد کرده بود. تلاش او برای کاهش آسیب، راه‌حل‌ها را ایجاد کرده بود.' واضح است، اما خسته‌کننده هم هست.

دلایل فنی و استدلال

وقتی نوبت به استدلال پیچیده می‌رسد، Fable 5 برنده واضحی است. توییت 'فکر کردنت را به من نشان بده' را امتحان کردیم: 'چند عدد ۳ رقمی وجود دارد که حاصل ضرب ارقامشان برابر با ۱۸ باشد؟' Sol جواب درست داد (۲۱) اما توضیح میانی آن ناقص بود. Fable نه تنها جواب درست را داد، بلکه یک استدلال گام به گام کامل و بدون نقص ارائه کرد.

در مقابل، برای وظایف خلاقانه یا نوشتن متون بازاریابی، Sol حس طبیعی‌تری دارد. متن‌های Fable گاهی بیش از حد محتاطانه و خسته‌کننده به نظر می‌رسند، در حالی که Sol ریسک‌های خلاقانه می‌پذیرد و نتایج جذاب‌تری ارائه می‌دهد.

نتیجه‌گیری و آینده

انتخاب بین GPT-5.6 Sol و Claude Fable 5 به نیازهای خاص شما بستگی دارد. اگر به دنبال بهترین عملکرد در کدنویسی با هزینه کمتر هستید، Sol انتخاب بهتری است. اگر استدلال دقیق و منطقی برایتان اولویت دارد، Fable 5 همچنان حرفی برای گفتن دارد. اما با نزدیک شدن به ۱۹ ژوئیه و آینده نامشخص Fable، همه چیز می‌تواند تغییر کند.

در هر صورت، رقابت بین OpenAI و Anthropic در حال داغ‌تر شدن است. توسعه‌دهندگان حالا انتخاب‌های بیشتری دارند و قیمت‌ها هم رو به کاهش است. این یک خبر خوب برای همه کسانی است که از هوش مصنوعی استفاده می‌کنند.