OpenAI اوایل ژوئیه خانوادهٔ مدلهای GPT‑5.6 را از طریق اپ و API در دسترس گذاشت. نسخهٔ قدرتمند Sol از ابتدا بیشترین توجه توسعهدهندگان را جلب کرد و گزارشهای اولیه حاکی از تفاوتهای قابلتوجه در رفتار و دقت نسبت به رقبای شناختهشده است.
سه گزینه، سه کاربرد
کاربران اکنون بین سه تنظیم میتوانند انتخاب کنند: Sol بهعنوان گزینهٔ توانمند برای وظایف پیچیده، Terra برای استفادهٔ عمومی و تعادل هزینه-دقت، و Luna بهعنوان راهحل سریع و کمهزینه برای وظایف روزمره. در صفحهٔ رسمی OpenAI توضیح داده شده که Sol با پشتهٔ حفاظتی تقویتشده و تمرکز بر استخراج «کار مفید بیشتر از هر توکن» عرضه شده (OpenAI).
واکنش توسعهدهندگان: دیدگاهها و نقدها
راسِل تویلیگیر، رهبر پژوهش و توسعه در BlogBuster، تجربهٔ خود را با Sol «شگفتانگیز» توصیف کرده و میگوید در پروژهای با پایگاهدادهٔ بیش از 3,000,000 رکورد، Sol بارها خطاهایی را که مدل رقیب Anthropic (Claude Opus 5) مرتکب شده بود تشخیص و اصلاح کرده است. در مقابل، پژوهشگران حاکمیت و اعتبارسنجی مدلها تأکید میکنند که چنین مقایسههایی باید با معیارهای حقیقتِ پایهای انجام شوند تا دقت ادعاها قابل استناد باشد.
نقاط قوت گزارششده
- پایداری در جریانهای طولانی استدلالی: Sol در حفظ انسجام و دنبالکردن استدلالهای بلند عملکرد بهتری از خود نشان میدهد.
- توانایی کشف و تصحیح خطا: در پروژههای دارای حجم بزرگِ داده، نمونههایی از کشف و اصلاح خطا توسط Sol گزارش شده است.
- قابلیت تنظیم هزینه-دقت: سطوح استدلال متعددی که معرفی شدهاند امکان تعدیل میان دقت خروجی و هزینهٔ محاسباتی را فراهم میکنند.
موفقیتهای ریاضیاتی: ادعا دربارهٔ شش مسئلهٔ Erdős
شوقیائو وانگ، دانشجوی دکترای مدرسهٔ کسبوکار کلمبیا، گزارش داده با استفاده از Sol در حالت استدلال ultra توانسته شش مسئلهٔ باز پاول اردوش (Erdős) را در پنج روز حل کند. برای زمینهٔ تاریخی این مسئلهها میتوانید صفحهٔ پل Erdős را در ویکیپدیا ببینید. وانگ ترکیب پرامپت و اجرای موازی زیرعاملها در Codex را عامل استمرار جستوجوهای ریاضی طولانی دانسته است.
ویژگی «ultra» در Sol
حالت استدلال ultra چندین عامل فرعی را بهصورت موازی هماهنگ میکند تا بخشهای مختلف مسئله را همزمان حل کند. ترتیب سطوح استدلال شامل low، medium، high، extra high، max و سپس ultra است؛ طراحی بهگونهای است که در ازای مصرف توکن بیشتر، خروجیهای پیچیدهتر و سریعتر تولید شود.
چالشها و توصیههای احتیاطی
تحلیلگران و توسعهدهندگان دو نکتهٔ بنیادین را تکرار میکنند:
- مقایسهٔ مدلها باید بر پایهٔ مجموعههای دادهٔ حقیقتِ پایهای و روشهای سنجش استاندارد انجام شود تا ادعاهای دقت قابل اتکا باشند.
- تمایل به «بیشمهندسی» در Sol میتواند در برخی سناریوها منجر به افزایش هزینهٔ محاسباتی و پیچیدگی اضافی شود؛ انتخاب سطح استدلال باید با توجه به نیاز واقعی کاربرد تنظیم شود.
راهنمای کاربردی برای توسعهدهندگان
- ارزیابی با مجموعههای حقیقتِ پایهای: خروجیها را مقابل دادهٔ معتبر بسنجید و از نتایج صرفاً کیفی پرهیز کنید.
- آزمونهای بدون اطلاع (blind) و کنترلشده انجام دهید تا تعصبات آزمایشی کاهش یابد.
- بودجهٔ محاسباتی را مدیریت کنید: برای وظایف ساده از سطوح پایینتر و برای مسائل ساختاری و پیچیده از سطوح بالاتر استفاده کنید.
- از اجرای موازی زیرعاملها زمانی بهره ببرید که تقسیم مسئله واضح و هزینهٔ همزمانی توجیهپذیر باشد.
- نظارت پیوسته بر خطاها و حالتهای نادر خروجی داشته باشید و مکانیزم بازخورد انسانی برای تصحیح فراهم کنید.
خلاصه
تجربههای اولیه نشان میدهد GPT‑5.6 Sol قابلیتهای قابلتوجهی در حل مسئله و تولید محتوا دارد، اما تعیین برندهٔ قطعی میان مدلها نیازمند آزمایشهای کنترلشده و ارزیابی بر اساس دادهٔ حقیقتِ پایهای است. در ماههای آتی نتایج عملی بیشتری منتشر خواهد شد که چارچوب قابل اتکاتری برای سنجش توانمندیها و محدودیتهای Sol فراهم میکند.





