xAI در 8 ژوئیه از مدل جدید خود به نام Grok 4.5 رونمایی کرد. ادعای بزرگ این شرکت این است که این مدل در حوزه کدنویسی با Claude Opus 4.8 برابری میکند، اما با مصرف حدود 4.2 برابر توکنهای خروجی کمتر. این یعنی هزینه بهطور قابل توجهی پایینتر: Grok برای هر میلیون توکن ورودی 2 دلار و برای هر میلیون توکن خروجی 6 دلار هزینه دارد، در حالی که Opus به ترتیب 5 و 25 دلار قیمت دارد. این ادعاها، بهویژه برای توسعهدهندگانی که نگران هزینههای توکن هستند، بسیار جذاب به نظر میرسد.
اما آیا واقعاً میتوان به این ادعاها اعتماد کرد؟ برای پاسخ به این سوال، یک آزمایش عملی و شفاف طراحی شد. ما Grok 4.5 و Claude Opus 4.8 را در سه سناریوی واقعی کدنویسی در یک پروژه Rust (ابزار محبوب fd) در حالت Agent درون Cursor به صورت رو در رو قرار دادیم. ابزارها و پرامپتها کاملاً یکسان بودند تا تنها متغیر، خود مدل باشد.

آزمایش اول: رفع باگ
اولین آزمایش، رفع یک باگ واقعی در fd (مسئله شماره 907) بود. پرچم —no-ignore-vcs به اشتباه فایلهای ignore را در دایرکتوریهای والد نیز غیرفعال میکرد. هر دو مدل باگ را در یک مکان پیدا کردند و یک راهحل کاملاً یکسان (حذف یک خط از src/main.rs) ارائه دادند. اما در اینجا، Opus برنده میدان بود: 30.43 ثانیه و 174.1 هزار توکن در یک درخواست، در مقابل 46.25 ثانیه و 210.2 هزار توکن در دو درخواست برای Grok. ادعای xAI درباره برابری با توکنهای کمتر در این آزمایش کوچک رد شد.
آزمایش دوم: بازسازی چند فایلی
آزمایش دوم شامل بازسازی ساختاری کد در چندین فایل بود. در اینجا، داستان متفاوت بود. Grok با 192.7 هزار توکن و هزینه 1.20 دلار کار را در 63.1 ثانیه انجام داد، در حالی که Opus با 192.2 هزار توکن و هزینه 1.35 دلار در 33.7 ثانیه به پایان رساند. اگرچه Opus سریعتر بود، اما Grok از نظر تعداد توکن و هزینه عملکرد بهتری داشت. این بار، ادعای xAI تا حدی تایید شد.
آزمایش سوم: ساخت یک ویژگی جدید
در آزمایش سوم، از مدلها خواسته شد تا یک ویژگی جدید به کدبیس اضافه کنند. Grok با 1.01 میلیون توکن و هزینه 6.95 دلار در 229 ثانیه کار را به پایان رساند، در حالی که Opus با 1.25 میلیون توکن و هزینه 9.47 دلار در 202 ثانیه. اگرچه Grok کندتر بود، اما باز هم مصرف توکن و هزینه کمتری داشت. نتیجه نهایی: Grok در دو آزمایش از سه آزمایش از نظر هزینه کارآمدتر بود، اما Opus در سرعت و یک آزمایش کوچک به وضوح برتر بود.

جمعبندی: Grok جایگزین اقتصادی، اما نه کامل
xAI با ارائه Grok 4.5 یک گزینه بسیار جذاب از نظر هزینه برای توسعهدهندگان فراهم کرده است. این مدل در بسیاری از وظایف کدنویسی عملکرد قابل قبولی دارد و برای پروژههای با بودجه محدود یا حجم بالای درخواست، یک انتخاب عالی است. با این حال، Claude Opus 4.8 همچنان در دقت، سرعت و وظایف پیچیده برتری دارد. انتخاب نهایی به نیاز شما بستگی دارد: اگر به دنبال صرفهجویی در هزینه هستید، Grok یک گزینه عالی است. اما اگر بالاترین کیفیت و سرعت برایتان اولویت دارد، Opus همچنان پادشاه بلامنازع است.
برای کسب اطلاعات بیشتر درباره این مدلها، میتوانید به ویکیپدیا کلود و ویکیپدیا گراک مراجعه کنید. همچنین میتوانید آخرین اخبار را از وبسایت رسمی xAI دنبال کنید.





