xAI در 8 ژوئیه از مدل جدید خود به نام Grok 4.5 رونمایی کرد. ادعای بزرگ این شرکت این است که این مدل در حوزه کدنویسی با Claude Opus 4.8 برابری می‌کند، اما با مصرف حدود 4.2 برابر توکن‌های خروجی کمتر. این یعنی هزینه به‌طور قابل توجهی پایین‌تر: Grok برای هر میلیون توکن ورودی 2 دلار و برای هر میلیون توکن خروجی 6 دلار هزینه دارد، در حالی که Opus به ترتیب 5 و 25 دلار قیمت دارد. این ادعاها، به‌ویژه برای توسعه‌دهندگانی که نگران هزینه‌های توکن هستند، بسیار جذاب به نظر می‌رسد.

اما آیا واقعاً می‌توان به این ادعاها اعتماد کرد؟ برای پاسخ به این سوال، یک آزمایش عملی و شفاف طراحی شد. ما Grok 4.5 و Claude Opus 4.8 را در سه سناریوی واقعی کدنویسی در یک پروژه Rust (ابزار محبوب fd) در حالت Agent درون Cursor به صورت رو در رو قرار دادیم. ابزارها و پرامپت‌ها کاملاً یکسان بودند تا تنها متغیر، خود مدل باشد.

مقایسه عملکرد Grok و Claude در کدنویسی

آزمایش اول: رفع باگ

اولین آزمایش، رفع یک باگ واقعی در fd (مسئله شماره 907) بود. پرچم —no-ignore-vcs به اشتباه فایل‌های ignore را در دایرکتوری‌های والد نیز غیرفعال می‌کرد. هر دو مدل باگ را در یک مکان پیدا کردند و یک راه‌حل کاملاً یکسان (حذف یک خط از src/main.rs) ارائه دادند. اما در اینجا، Opus برنده میدان بود: 30.43 ثانیه و 174.1 هزار توکن در یک درخواست، در مقابل 46.25 ثانیه و 210.2 هزار توکن در دو درخواست برای Grok. ادعای xAI درباره برابری با توکن‌های کمتر در این آزمایش کوچک رد شد.

آزمایش دوم: بازسازی چند فایلی

آزمایش دوم شامل بازسازی ساختاری کد در چندین فایل بود. در اینجا، داستان متفاوت بود. Grok با 192.7 هزار توکن و هزینه 1.20 دلار کار را در 63.1 ثانیه انجام داد، در حالی که Opus با 192.2 هزار توکن و هزینه 1.35 دلار در 33.7 ثانیه به پایان رساند. اگرچه Opus سریع‌تر بود، اما Grok از نظر تعداد توکن و هزینه عملکرد بهتری داشت. این بار، ادعای xAI تا حدی تایید شد.

آزمایش سوم: ساخت یک ویژگی جدید

در آزمایش سوم، از مدل‌ها خواسته شد تا یک ویژگی جدید به کدبیس اضافه کنند. Grok با 1.01 میلیون توکن و هزینه 6.95 دلار در 229 ثانیه کار را به پایان رساند، در حالی که Opus با 1.25 میلیون توکن و هزینه 9.47 دلار در 202 ثانیه. اگرچه Grok کندتر بود، اما باز هم مصرف توکن و هزینه کمتری داشت. نتیجه نهایی: Grok در دو آزمایش از سه آزمایش از نظر هزینه کارآمدتر بود، اما Opus در سرعت و یک آزمایش کوچک به وضوح برتر بود.

مقایسه هزینه و سرعت Grok و Claude

جمع‌بندی: Grok جایگزین اقتصادی، اما نه کامل

xAI با ارائه Grok 4.5 یک گزینه بسیار جذاب از نظر هزینه برای توسعه‌دهندگان فراهم کرده است. این مدل در بسیاری از وظایف کدنویسی عملکرد قابل قبولی دارد و برای پروژه‌های با بودجه محدود یا حجم بالای درخواست، یک انتخاب عالی است. با این حال، Claude Opus 4.8 همچنان در دقت، سرعت و وظایف پیچیده برتری دارد. انتخاب نهایی به نیاز شما بستگی دارد: اگر به دنبال صرفه‌جویی در هزینه هستید، Grok یک گزینه عالی است. اما اگر بالاترین کیفیت و سرعت برایتان اولویت دارد، Opus همچنان پادشاه بلامنازع است.

برای کسب اطلاعات بیشتر درباره این مدل‌ها، می‌توانید به ویکی‌پدیا کلود و ویکی‌پدیا گراک مراجعه کنید. همچنین می‌توانید آخرین اخبار را از وبسایت رسمی xAI دنبال کنید.