شرکت Moonshot AI در اواسط ژوئیه مدل متن‌باز Kimi K3 را با ۲.۸ تریلیون پارامتر معرفی کرد؛ بزرگترین مدل چینی که تاکنون منتشر شده است. این مدل به‌عنوان یک ابزار کدنویسی حرفه‌ای با قیمت بسیار پایین‌تر از رقبای اصلی خود یعنی کلود و جی‌پی‌تی عرضه شده است. Moonshot ادعا دارد که Kimi K3 با Opus 4.8 از Anthropic رقابت می‌کند.

API مدل Kimi K3 به ازای هر میلیون توکن ورودی ۳ دلار و به ازای هر میلیون توکن خروجی ۱۵ دلار هزینه دارد. در مقابل، مدل برتر Anthropic یعنی Fable 5 به ازای هر میلیون توکن ورودی ۱۰ دلار و به ازای هر میلیون توکن خروجی ۵۰ دلار هزینه دارد. این یعنی بیش از سه برابر گران‌تر است. اما آیا قیمت پایین‌تر Kimi K3 ارزشش را دارد؟ برای پاسخ، یک روزنامه‌نگار فناوری سه کار واقعی کدنویسی را به هر دو مدل داد و نتایج را دقیقاً ثبت کرد.

آزمایش‌های کدنویسی روی ابزار fd

برای آزمایش‌ها از ابزار fd (فایل‌یاب Rust از sharkdp) استفاده شد. fd جایگزینی سریع و دوستانه‌تر برای دستور Unix find است و به دلیل تاریخچه مستند باگ‌ها، گزینه مناسبی برای ارزیابی دقیق مدل‌ها محسوب می‌شود.

از آنجایی که Kimi K3 هنوز در ابزارهای کدنویسی مانند Cursor در دسترس نیست، تست‌ها با استفاده از CLIهای بومی انجام شد. Kimi K3 در عامل ترمینال جدید Kimi Code (نسخه 0.27.0) و Fable 5 در Claude Code (نسخه 2.1.212) اجرا گردید. پرامپت‌های یکسان برای هر دو مدل به کار رفت تا تنها متغیرهای آزمایش، مدل‌ها و CLIها باشند. سه کار مشخص شامل رفع باگ، بازسازی چندفایلی و ساخت ویژگی، به همان ترتیب انجام شد و هر آزمایش مستقل در یک پوشه مجزا ثبت گردید. برای هر تست، زمان با کرونومتر، تعداد توکن‌ها و هزینه از داشبورد استفاده Cursor ضبط شد.

راه‌اندازی Kimi K3

راه‌اندازی Kimi Code CLI بسیار ساده و با یک دستور curl انجام شد. اما یک نکته مهم وجود داشت: وقتی دستور آزمایشی «say hello» اجرا شد، سیستم برای چند دقیقه بدون پاسخ معلق ماند. علت خطای ۴۲۹ بود: حساب API جدید موجودی نداشت و تا زمانی که کاربر کارت بانکی اضافه و حساب را شارژ نکند، Kimi پاسخ نمی‌دهد. نکته خوشایند اینکه پس از شارژ، Moonshot یک کوپن ثبت‌نام ۵ دلاری ارائه داد.

نتایج آزمایش‌ها

۱. رفع باگ

پرامپت: یک باگ در ابزار fd وجود دارد. وقتی پرچم –no-ignore-vcs عبور داده می‌شود، fd نباید فایل‌های ignore در دایرکتوری‌های والد را نادیده بگیرد. علت اصلی را پیدا کنید و آن را رفع کنید بدون تغییر رفتار دیگر.

پایگاه کد fd دقیقاً قبل از کامیت رفع واقعی باگ (issue #907 در سال ۲۰۲۱) چک‌اوت شد و تاریخچه گیت پاک شد تا مدل‌ها نتوانند جواب را جستجو کنند. هر دو مدل علت اصلی را پیدا کردند و همان خط واحد را از فایل src/main.rs حذف کردند. تفاوت‌ها بایت به بایت یکسان بود: چهار مدل، چهار تفاوت یکسان. هر ۷۰ تست برای هر دو مدل قبول شد. اما تفاوت در اعداد بود: Fable 5 در ۱ دقیقه و ۴ ثانیه با حدود ۳۴۷ هزار توکن و هزینه ۰.۸۵ دلار تمام شد. Kimi K3 در ۳ دقیقه و ۷ ثانیه با ۲۳۸ هزار توکن و هزینه ۶ سنت. آزمایش باگ K3 کمترین هزینه اما بیشترین زمان را داشت.

۲. بازسازی چندفایلی

در این تست، هر دو مدل موفق به بازسازی کامل تابع construct_config در src/main.rs شدند. اما نتایج مشابه بود: Fable 5 در ۲ دقیقه و ۱۵ ثانیه با ۵۰۰ هزار توکن و هزینه ۱.۲ دلار به پایان رساند، در حالی که Kimi K3 در ۱۰ دقیقه و ۳۰ ثانیه با ۴۵۰ هزار توکن و هزینه ۱۵ سنت.

۳. ساخت ویژگی

در کار ساخت ویژگی، نتایج مشابه بود. Fable 5 در ۱ دقیقه و ۵۰ ثانیه با ۴۲۰ هزار توکن و هزینه ۱ دلار، و Kimi K3 در ۸ دقیقه و ۲۰ ثانیه با ۳۸۰ هزار توکن و هزینه ۱۳ سنت. در مجموع، Kimi K3 در هر سه تست نتایجی مشابه Fable 5 از نظر دقت و کیفیت ارائه داد، اما با سرعتی حدود ۴ برابر کندتر و هزینهای حدود یک سوم.

تصویربرداری از نتایج

نمودار مقایسه هزینه و زمان مدل‌های Kimi K3 و Fable 5 در تست‌های کدنویسی

نمودار بالا نشان‌دهنده تفاوت چشمگیر در زمان و هزینه است: Kimi K3 با یک سوم هزینه اما چهار برابر زمان بیشتر، نتایجی مشابه Fable 5 ارائه می‌دهد. این یعنی اگر سرعت برایتان اولویت ندارد و به دنبال راه‌حلی اقتصادی هستید، Kimi K3 گزینه جذابی است. اما برای پروژه‌های حساس به زمان، Fable 5 همچنان گزینه برتری است.

نتیجه‌گیری

Kimi K3 یک مدل متن‌باز قدرتمند است که می‌تواند در وظایف کدنویسی با بهترین مدل‌های انحصاری رقابت کند. با این حال، سرعت پایین‌تر آن می‌تواند برای تیم‌هایی که نیاز به واکنش سریع دارند، یک محدودیت جدی باشد. آینده بازار مدل‌های زبانی حرفه‌ای به سمت تعادل بهتر بین هزینه و سرعت پیش می‌رود، و مدل‌های متن‌باز مانند K3 می‌توانند نقش مهمی در این تحول ایفا کنند.