اوپن‌ای‌آی محدودیت‌های مصرف کاربران ChatGPT Work و Codex را بازنشانی کرد و با بهینه‌سازی بخش استنتاج پس‌زمینه اعلام کرد جلسات معمولی GPT-5.6 Sol حدود ۱۸٪ طولانی‌تر خواهند شد. این تغییر پاسخی عملی به شکایت کاربران حرفه‌ای درباره «سوختن سهمیه در هنگام انتظار» بود.

چه رخ داد

پس از عرضه GPT-5.6 Sol، تعدادی از کاربران حرفه‌ای گزارش دادند سهمیه‌هایشان بسیار سریع‌تر از انتظار کاهش می‌یابد؛ حتی زمانی که مدل بیشتر زمان را صرف انتظار برای تکمیل ابزارها می‌کرد. مهندسان اوپن‌ای‌آی با بررسی رفتار سیستم رسیدند بخش قابل‌توجهی از مصرف اضافی به «حالت فراخوانی برنامه‌ای ابزارها» مربوط می‌شود؛ قابلیتی که به Sol اجازه می‌دهد حین اجرای ابزارها در پس‌زمینه به کار ادامه دهد و گردش‌کارهای پیچیده را بین زیرعامل‌ها هماهنگ کند.

واکنش اوپن‌ای‌آی

تیبو سوتیوکس، سرمهندس اوپن‌ای‌آی، نوشت که شرکت هزینه‌بر بودن اجرای عامل‌های واقعی را دست‌کم گرفته بود: «GPT-5.6 Sol تمایل دارد زمان بیشتری صرف کند، تماس‌های بیشتری با ابزارها برقرار کند و گردش‌کارهای پیچیده را بین ابزارها و زیرعامل‌ها هماهنگ کند. این رفتار در حل مسائل دشوار مفید است، اما در برخی سناریوها مصرف بسیار بیشتر از پیش‌بینی‌های ما شد.»

اوپن‌ای‌آی برای کاهش اثر فوری، محدودیت ۵ ساعته را موقتاً برداشت و هم‌زمان روی بهبود رفتار Sol هنگام انتظار برای فراخوانی ابزارها، ساده‌سازی جستجوهای وب و کارایی کلی استنتاج پس‌زمینه کار کرد. شرکت همچنین سهمیه‌ها را برای کاربران ChatGPT Work و Codex بازنشانی کرد تا کاربران متأثر جبران شوند.

صفحه‌نمایش کد و ابزارهای اتوماتیک GPT-5.6 Sol

علت افزایش سریع مصرف

  • اجرای عاملی: Sol می‌تواند همزمان چندین فراخوانی به ابزارها داشته باشد و زیرعامل‌ها را هماهنگ کند؛ رفتاری که در تست‌های معمول کمتر دیده می‌شود اما در بارهای کاری پیچیده مصرف توکن را افزایش می‌دهد.
  • حالت کدنویسی و انتظار فعال: مدل هنگام انتظار برای نتایج ابزارها همچنان به تولید پاسخ و مدیریت وضعیت ادامه می‌دهد که به سوزاندن توکن اضافی می‌انجامد.
  • دنباله‌های بلند و موارد لبه‌ای: بررسی‌ها نشان داد اوپن‌ای‌آی بیشتر روی میانگین و میانه مصرف متمرکز بوده و موارد دنباله‌بلند را کمتر در نظر گرفته است.

نمونه‌های گزارش‌شده توسط توسعه‌دهندگان

توسعه‌دهندگانی که تجربه‌شان را در مخزن openai/codex در GitHub ثبت کردند، موارد مشخصی منتشر کردند: یکی گزارش داد در یک جلسه ۴۳ دقیقه‌ای نزدیک به ۳۰۰ پاسخ مدل، ۹۶ فراخوانی اجرا و ۱۹۲ فراخوانی انتظار ثبت شد که تقریباً ۴۲٪ از سهمیهٔ یک محدودیت ۵ ساعته را حین انتظار برای نتایج ابزارها مصرف کرد. گزارش دیگری نشان داد وظایفی که ظاهراً مستقل‌اند به‌صورت سریالی اجرا شدند و بیش از ۷۰۰ سلول اجرا، مصرف توکن را بالا بردند.

پیامدها برای توسعه‌دهندگان و ارائه‌دهندگان سرویس

  • سیاست‌های فعلی اشتراک که حول گفت‌وگو و چت طراحی شده‌اند، برای بارهای کاری عاملی مناسب نیستند؛ چون یک کار واحد می‌تواند ۳۰ تا ۴۰ دقیقه یا بیشتر به‌صورت پیوسته ابزارها را صدا بزند و بازنگری انجام دهد.
  • توسعه‌دهندگان باید انتظار رفتارهای غیرخطی در مصرف را داشته باشند و برای برآورد هزینه‌ها از مانیتورینگ دقیق‌تر استفاده کنند.
  • ارائه‌دهندگان سرویس ممکن است ناچار شوند مدل‌های قیمت‌گذاری و سهمیه‌بندی را برای بارهای کاری عاملی بازطراحی کنند تا تجربه‌ای پیش‌بینی‌پذیرتر و پایدارتر فراهم شود.

منابع و مسیر پیش‌رو

برای مرور تاریخچه شرکت و مدل‌ها می‌توانید به صفحه OpenAI در ویکی‌پدیا مراجعه کنید. دنبال‌کردن بحث‌ها در مخزن GitHub و اطلاعیه‌های رسمی اوپن‌ای‌آی بهترین راه برای دریافت به‌روزرسانی‌های فنی و تغییرات سیاست مصرف است.

این اصلاحات مشکل فوری مصرف را برطرف کرده‌اند، اما رویداد نشان داد زمان بازنگری در نحوهٔ تعریف سهمیه‌ها و قیمت‌گذاری برای عامل‌های هوش مصنوعی فرارسیده است؛ موضوعی که توسعه‌دهندگان و کسب‌وکارها باید برای شفافیت هزینه و پایداری پروژه‌های خود به‌صورت فعال برنامه‌ریزی کنند.