برای اولین بار، OpenAI یک مدل با دکمههای تفکر عرضه نمیکند. GPT-5.6 بهعنوان سه مدل زبانی بزرگ کاملاً مجزا — Sol، Terra و Luna — با آموزشهای متفاوت، قیمتگذاری متفاوت و سقف تواناییهای متفاوت عرضه میشود. مقایسهای که اهمیت دارد، Sol در مقابل Claude Fable 5، قویترین مدل عمومی Anthropic در حال حاضر است.
هزینه Sol به ازای هر میلیون توکن ورودی ۵ دلار و خروجی ۳۰ دلار است. Fable 5 با قیمت ۱۰ و ۵۰ دلار — دو برابر گرانتر — در حال حاضر در چندین معیار که توسعهدهندگان واقعاً کار خود را از طریق آن هدایت میکنند، شکست میخورد. Luna، ارزانترین مدل از سه مدل با قیمت ورودی ۱ دلار و خروجی ۶ دلار، از قبل در کدنویسی از Opus 4.8 Anthropic پیشی گرفته است. این جزئیات آخر در ۱۹ ژوئیه به مشکل واقعی تبدیل میشود.
ماه پرآشوب Fable 5
Fable 5 ماه سختی را پشت سر گذاشته است. دولت ایالات متحده در ۱۲ ژوئن آن را ممنوع کرد، پس از آنکه محققان آمازون یک Jailbreak پیدا کردند که مدل را به یک اسکنر آسیبپذیری ناخواسته تبدیل میکرد. Anthropic آن را به مدت ۱۹ روز در سراسر جهان جمعآوری کرد، یک طبقهبندیکننده ایمنی جدید ساخت و در ۱ ژوئیه با یک پنجره دسترسی فشرده بازگرداند.
از زمان بازگشت، این مدل با مهلتهای قرضی کار میکند. Anthropic قصد داشت آن را در ۷ ژوئیه پشت دیوار پرداخت اعتبارهای مصرفی قرار دهد، سپس به ۱۲ ژوئیه و اکنون به ۱۹ ژوئیه موکول کرد. هر تمدید ساعاتی قبل از مهلت اعلام شد، هرگز از طریق یک پست رسمی.
ما دسترسی به Claude Fable 5 را در تمام طرحهای پولی تمدید میکنیم و همچنین محدودیت نرخ هفتگی Claude Code را تا ۵۰٪ بالاتر تا ۱۹ ژوئیه حفظ میکنیم.
— Claude (@claudeai) ۱۲ ژوئیه ۲۰۲۶
دلیل آن سخت نیست. اگر Fable پس از ۱۹ ژوئیه از اشتراکها خارج شود، بهترین مدل Anthropic برای مشترکان پولی Opus 4.8 میشود — که Luna قبلاً در کدنویسی با کسری از قیمت آن را شکست میدهد. نگه داشتن Fable در دسترس، حتی با ۵۰٪ از محدودیتهای هفتگی، تنها چیزی است که باعث میشود رده اشتراک Anthropic روی کاغذ بدتر از رده میانی OpenAI به نظر نرسد.
رقابت در معیارها
رو در رو در معیارها، رقابت نزدیک است. در شاخص عامل کدنویسی تحلیل مصنوعی (Artificial Analysis Coding Agent Index)، Sol امتیاز ۸۰ را در مقابل ۷۷.۲ Fable کسب کرد — با استفاده از تقریباً نصف توکنها، در کمتر از نصف زمان، با حدود یک سوم هزینه. در آخرین آزمون عاملها (Agents' Last Exam) که گردش کار حرفهای را در ۵۵ زمینه اجرا میکند، Sol به ۵۳.۶٪ در مقابل ۴۰.۵٪ Fable رسید. در Terminal-Bench 2.1، Sol در حالت فوقالعاده (چهار زیرعامل به صورت موازی) به ۹۱.۹٪ در مقابل ۸۳.۱٪ Fable دست یافت.
در شاخص هوش گستردهتر (Intelligence Index) که ۹ معیار مختلف را جمعآوری میکند، Fable 5 تنها با یک امتیاز از GPT 5.6 پیشی میگیرد، به این معنی که شکاف توانایی به سختی قابل توجه است.
آزمایش مدلها
معیارها و تستها بیش از حد بر تواناییهای کدنویسی برای اندازهگیری توانایی یک مدل تمرکز کردهاند. اما ما هکر نیستیم، بنابراین به غیر از یک بازی ساده کدگذاری شده با حس، از پرامپتهای دیگری استفاده کردیم که کمی از سناریوی معمول کدنویسی فاصله دارند. در اینجا آنچه واقعاً اتفاق افتاد است.

نوشتن خلاق
ما همان پرامپت (موجود در گیتهاب ما) را از طریق هر دو مدل اجرا کردیم: خوزه لانز را از سال ۲۱۵۰ به سال ۱۰۰۰ بفرستید، او را در یک پارادوکس سفر در زمان قرار دهید و نگذارید تا زمانی که به خانه بازگردد، بفهمد چه کرده است.
هر دو مدل چیزی نزدیکتر به یک داستان کوتاه بلند تا یک داستان کوتاه تحویل دادند. هر دو همچنین یک قانون مهم را نقض کردند: توجه به پارادوکس زمانی که به آینده بازمیگردد.
GPT-5.6 Sol باعث میشود خوزه در اواسط داستان بفهمد که 'مسافر ناشناس کسی نبود که برای متوقف کردنش آمده بود. خودش بود.' Fable در این مورد حتی مستقیمتر است، با خوزه که در گذشته متوجه میشود کل پارادوکس به خاطر او اتفاق افتاده است. 'هیچ رویداد بذری وجود نداشت. او خود رویداد بذر بود.'
ورودی GPT-5.6 Sol، 'The First Fire'، به سراغ علمی-تخیلی ژانر مستقیم میرود — خوزه به طور تصادفی کورهای را معرفی میکند که فروپاشی آب و هوایی را که برای جلوگیری از آن بازگشته بود، آغاز میکند. شروع واقعاً خوب است: 'فقط رعد. فقط حشرات. فقط نفس خیس جهان قبل از ماشینها.'
با این حال، مشکل این است که Sol به آن تصویر اعتماد ندارد که کار خود را انجام دهد. حلقه را توضیح میدهد، سپس دوباره توضیح میدهد، سپس نسخه قدیمیتری از خوزه یک ضبط صوتی باقی میگذارد که آن را برای سومین بار توضیح میدهد: 'تلاش او برای حل مشکل، مشکل را ایجاد کرده بود. تلاش او برای کاهش آسیب، راهحلها را ایجاد کرده بود.' واضح است، اما خستهکننده هم هست.
دلایل فنی و استدلال
وقتی نوبت به استدلال پیچیده میرسد، Fable 5 برنده واضحی است. توییت 'فکر کردنت را به من نشان بده' را امتحان کردیم: 'چند عدد ۳ رقمی وجود دارد که حاصل ضرب ارقامشان برابر با ۱۸ باشد؟' Sol جواب درست داد (۲۱) اما توضیح میانی آن ناقص بود. Fable نه تنها جواب درست را داد، بلکه یک استدلال گام به گام کامل و بدون نقص ارائه کرد.
در مقابل، برای وظایف خلاقانه یا نوشتن متون بازاریابی، Sol حس طبیعیتری دارد. متنهای Fable گاهی بیش از حد محتاطانه و خستهکننده به نظر میرسند، در حالی که Sol ریسکهای خلاقانه میپذیرد و نتایج جذابتری ارائه میدهد.
نتیجهگیری و آینده
انتخاب بین GPT-5.6 Sol و Claude Fable 5 به نیازهای خاص شما بستگی دارد. اگر به دنبال بهترین عملکرد در کدنویسی با هزینه کمتر هستید، Sol انتخاب بهتری است. اگر استدلال دقیق و منطقی برایتان اولویت دارد، Fable 5 همچنان حرفی برای گفتن دارد. اما با نزدیک شدن به ۱۹ ژوئیه و آینده نامشخص Fable، همه چیز میتواند تغییر کند.
در هر صورت، رقابت بین OpenAI و Anthropic در حال داغتر شدن است. توسعهدهندگان حالا انتخابهای بیشتری دارند و قیمتها هم رو به کاهش است. این یک خبر خوب برای همه کسانی است که از هوش مصنوعی استفاده میکنند.





