تیبو سوتیه، رهبر مهندسی Codex در اوپنایآی، در یک پست کوتاه در اکس (X) قاعدهای ساده را برای توسعهدهندگان بازنویسی کرد: «جیپیتی-۶ آسترای در حالت Low، از جیپیتی-۵.۶ سول در حالت High هم هوشمندتر است و هم سریعتر.» این صرفاً یک شعار بازاریابی نیست؛ دادههای Artificial Analysis این ادعا را تایید میکنند. آسترای Low با امتیاز ۴۹ در شاخص هوشمندی، سول High (امتیاز ۴۸) را میپاشد، در حالی که توکن اول را در ۲.۵۳ ثانیه تحویل میدهد — در مقایسه با ۱۱.۸۷ ثانیه برای مدل رقیب.
پارادوکس قیمت: توکن گرانتر، وظیفه ارزانتر
برچسب قیمت روی کاغذ زارد میدهد: آسترای ۱۰ دلار برای میلیون توکن ورودی و ۵۰ دلار برای میلیون توکن خروجی تقاضا میکند، در حالی که سول با ۴ و ۲۰ دلار قیمتگذاری شده است. اما استدلال اوپنایآی این است که «قیمت توکن، قیمت وظیفه نیست.» بنچمارکهای داخلی شرکت این دیدگاه را تقویت میکنند. در Terminal-Bench 4.0، آسترای ۵۷.۹٪ دقت ثبت کرده با هزینه ۹٪ کمتر به ازای هر وظیفه. در تست GPQA Diamond، برتری ۰.۳ درصدی (۹۴.۹٪ در برابر ۹۴.۶٪) با کاهش ۳۷٪ هزینه همراه بوده است.
تستهای دنیای واقعی: مدیم، نه ماکزیمم
توسعهدهنده شینپر (Shinpr) روی یک کدبیس واحد، سه فاز تحلیل، پیادهسازی و بازبینی را با هر دو مدل ارزیابی کرد. نتایج روایتی متفاوت از بنچمارکهای رسمی را نشان میدهند:
- سول High: ۲۳۸ درخواست، ۳۷.۸ میلیون توکن ورودی، ۷۵ دقیقه، ۳۱.۷۹ دلار
- آسترای Medium: ۸۰ درخواست، ۱۱.۱ میلیون توکن ورودی، ۵۱ دقیقه، ۲۵.۶۷ دلار
- آسترای High: ۷۷ دقیقه، ۳۷.۲۳ دلار — با بازبینیای که یک باگ راهاندازی را از دست میدهد
در این سناریو، حالت Medium نقطهی بهینه (Sweet Spot) بوده است. افزایش استدلال نه تنها هزینه را بالا نبرد، بلکه کیفیت خروجی را هم کاهش داد. اما این الگو فراگیر نیست و به شدت به ماهیت وظیفه بستگی دارد.
معیار ARC Prize: استدلال عمیقتر، هزینه نهایی کمتر
ارزیابی ARC Prize روی تست ARC-AGI-3 تصویر معکوسی را ترسیم میکند. با افزایش سطح استدلال، دقت از ۱۷.۵٪ (Low) به ۶۲.۷٪ (Max) جهش مییابد. نکته شگفتانگیز: هزینه کل در سطح Max به ۲۶,۰۹۸ دلار میرسد، در حالی که Medium ۴۸,۰۹۰ دلار هزینه کرده است. دلیل؟ در سطح Max، مدل محاسبهی بیشتری به هر تصمیم اختصاص میدهد، اما اقدامات کمتری برای حل مسئله نیاز دارد. معاملهقطعی (Trade-off) کلاسیک عاملها (Agents): تفکر عمیقتر در لحظه، از تکرار و اصلاح خطا در مراحل بعدی ارزانتر میآید.
«استدلال پایینتر ظاهرا ارزانتر است، اما یک مانع نادرست (Wrong Turn) به سرعت به معنای فراخوانی ابزار دیگر یا تلاش مجدد است — که در مجموع هزینهی استدلال پیشرو را بهشدت بالا میبرد.»
استدلال پویا: تبدیل دایال، نه سوئیچ
اوپنایآی با مکانیزم configuration_update در آسترای، توسعهدهندگان را از انتخاب تکگانه برای کل فرآیند کار (Workflow) آزاد کرده است. یک برنامه میتواند سطح تلاش استدلال را بین پاسخها تغییر دهد، بدون اینکه پیکربندی سطح درخواست (Request-level Configuration) اصلی را دستخوش تغییر دهد. کارهای روتین در Low باقی میمانند، در حالی که یک تست ناموفق یا یک تصمیم حساس، بلافاصله میتواند به High یا Max ارتقا یابد. این انعطافپذیری، معماریهای عاملی (Agentic Architectures) را به سمت بهینهسازی واقعی هزینه هدایت میکند — نه قیمتگذاری بر اساس توکن، بلکه قیمتگذاری بر اساس نتیجه (Outcome-based Pricing).
چه چیزی برای تیمهای مهندسی مهم است
مهاجرت به آسترای تنها به معنی پرداخت بیشتر به ازای توکن نیست. این بدنهی بهینهسازی مجددِ حلقههای تفکر-عمل (Reasoning-Action Loops) در کدبیس است. تیمهایی که:
- از فریمورکهای عاملی (Agent Frameworks) استفاده میکنند (مانند LangChain، AutoGPT، CrewAI)
- وظایف چندمرحلهای با فراخوانیهای ابزار (Tool Calls) فراوان دارند
- حساسیت زمانی (Latency) برایشان بحرانی است
باید استراتژی استدلال را به عنوان یک پارامتر قابل تنظیم در Runtime در نظر بگیرند، نه یک انتخاب استاتیک در زمان Deploy.
آینده قیمتگذاری مدلهای زبانی، مقیاسدهی با نتیجه است، نه توکن. آسترای اولین گام آشکار اوپنایآی در این جهت است — و توسعهدهندگانی که زودتر این پارادایم را درک کنند، پیشرو خواهند بود.





