اوپنایآی محدودیتهای مصرف کاربران ChatGPT Work و Codex را بازنشانی کرد و با بهینهسازی بخش استنتاج پسزمینه اعلام کرد جلسات معمولی GPT-5.6 Sol حدود ۱۸٪ طولانیتر خواهند شد. این تغییر پاسخی عملی به شکایت کاربران حرفهای درباره «سوختن سهمیه در هنگام انتظار» بود.
چه رخ داد
پس از عرضه GPT-5.6 Sol، تعدادی از کاربران حرفهای گزارش دادند سهمیههایشان بسیار سریعتر از انتظار کاهش مییابد؛ حتی زمانی که مدل بیشتر زمان را صرف انتظار برای تکمیل ابزارها میکرد. مهندسان اوپنایآی با بررسی رفتار سیستم رسیدند بخش قابلتوجهی از مصرف اضافی به «حالت فراخوانی برنامهای ابزارها» مربوط میشود؛ قابلیتی که به Sol اجازه میدهد حین اجرای ابزارها در پسزمینه به کار ادامه دهد و گردشکارهای پیچیده را بین زیرعاملها هماهنگ کند.
واکنش اوپنایآی
تیبو سوتیوکس، سرمهندس اوپنایآی، نوشت که شرکت هزینهبر بودن اجرای عاملهای واقعی را دستکم گرفته بود: «GPT-5.6 Sol تمایل دارد زمان بیشتری صرف کند، تماسهای بیشتری با ابزارها برقرار کند و گردشکارهای پیچیده را بین ابزارها و زیرعاملها هماهنگ کند. این رفتار در حل مسائل دشوار مفید است، اما در برخی سناریوها مصرف بسیار بیشتر از پیشبینیهای ما شد.»
اوپنایآی برای کاهش اثر فوری، محدودیت ۵ ساعته را موقتاً برداشت و همزمان روی بهبود رفتار Sol هنگام انتظار برای فراخوانی ابزارها، سادهسازی جستجوهای وب و کارایی کلی استنتاج پسزمینه کار کرد. شرکت همچنین سهمیهها را برای کاربران ChatGPT Work و Codex بازنشانی کرد تا کاربران متأثر جبران شوند.
علت افزایش سریع مصرف
- اجرای عاملی: Sol میتواند همزمان چندین فراخوانی به ابزارها داشته باشد و زیرعاملها را هماهنگ کند؛ رفتاری که در تستهای معمول کمتر دیده میشود اما در بارهای کاری پیچیده مصرف توکن را افزایش میدهد.
- حالت کدنویسی و انتظار فعال: مدل هنگام انتظار برای نتایج ابزارها همچنان به تولید پاسخ و مدیریت وضعیت ادامه میدهد که به سوزاندن توکن اضافی میانجامد.
- دنبالههای بلند و موارد لبهای: بررسیها نشان داد اوپنایآی بیشتر روی میانگین و میانه مصرف متمرکز بوده و موارد دنبالهبلند را کمتر در نظر گرفته است.
نمونههای گزارششده توسط توسعهدهندگان
توسعهدهندگانی که تجربهشان را در مخزن openai/codex در GitHub ثبت کردند، موارد مشخصی منتشر کردند: یکی گزارش داد در یک جلسه ۴۳ دقیقهای نزدیک به ۳۰۰ پاسخ مدل، ۹۶ فراخوانی اجرا و ۱۹۲ فراخوانی انتظار ثبت شد که تقریباً ۴۲٪ از سهمیهٔ یک محدودیت ۵ ساعته را حین انتظار برای نتایج ابزارها مصرف کرد. گزارش دیگری نشان داد وظایفی که ظاهراً مستقلاند بهصورت سریالی اجرا شدند و بیش از ۷۰۰ سلول اجرا، مصرف توکن را بالا بردند.
پیامدها برای توسعهدهندگان و ارائهدهندگان سرویس
- سیاستهای فعلی اشتراک که حول گفتوگو و چت طراحی شدهاند، برای بارهای کاری عاملی مناسب نیستند؛ چون یک کار واحد میتواند ۳۰ تا ۴۰ دقیقه یا بیشتر بهصورت پیوسته ابزارها را صدا بزند و بازنگری انجام دهد.
- توسعهدهندگان باید انتظار رفتارهای غیرخطی در مصرف را داشته باشند و برای برآورد هزینهها از مانیتورینگ دقیقتر استفاده کنند.
- ارائهدهندگان سرویس ممکن است ناچار شوند مدلهای قیمتگذاری و سهمیهبندی را برای بارهای کاری عاملی بازطراحی کنند تا تجربهای پیشبینیپذیرتر و پایدارتر فراهم شود.
منابع و مسیر پیشرو
برای مرور تاریخچه شرکت و مدلها میتوانید به صفحه OpenAI در ویکیپدیا مراجعه کنید. دنبالکردن بحثها در مخزن GitHub و اطلاعیههای رسمی اوپنایآی بهترین راه برای دریافت بهروزرسانیهای فنی و تغییرات سیاست مصرف است.
این اصلاحات مشکل فوری مصرف را برطرف کردهاند، اما رویداد نشان داد زمان بازنگری در نحوهٔ تعریف سهمیهها و قیمتگذاری برای عاملهای هوش مصنوعی فرارسیده است؛ موضوعی که توسعهدهندگان و کسبوکارها باید برای شفافیت هزینه و پایداری پروژههای خود بهصورت فعال برنامهریزی کنند.





