مدل هوش مصنوعی Kimi K3 شرکت چینی Moonshot این روزها توجه زیادی را در جامعه هوش مصنوعی غرب به خود جلب کرده است. سوال اصلی این است که آیا این مدل چینی واقعاً می‌تواند با بهترین مدل‌های غربی رقابت کند؟ دو داده جدید از بنچمارک‌های معتبر، تصویری متفاوت و جالب از توانایی‌های آن ارائه می‌دهند.

پیروزی قاطع در کدنویسی فرانت‌اند

در بنچمارک Code Arena: Frontend که مدل‌ها را بر اساس رتبه‌بندی ترجیح انسانی ارزیابی می‌کند، Kimi K3 موفق به کسب امتیاز 1,679 شده است. این امتیاز از مدل‌های قدرتمندی مانند Claude Fable 5 (1,631) و GPT-5.6 Sol (1,618) با اختلاف قابل توجهی پیشی گرفته است. این اولین بار است که یک مدل چینی رتبه اول را در این بنچمارک به دست می‌آورد و نشان‌دهنده پیشرفت چشمگیر Moonshot در حوزه کدنویسی فرانت‌اند است.

نمودار مقایسه امتیاز Kimi K3 در بنچمارک فرانت‌اند

شکست در ریاضیات پیچیده

اما تصویر برای ریاضیات سخت کاملاً متفاوت است. طبق داده‌های منتشر شده توسط Epoch AI، دقت مدل Kimi K3 در سطح Tier 4 از بنچمارک FrontierMath که سخت‌ترین مسائل ریاضی در سطح خبره را شامل می‌شود، تنها حدود 39 درصد است. در مقابل، مدل‌های OpenAI و Anthropic در برخی موارد به دقت نزدیک به 90 درصد دست می‌یابند. این اختلاف فاحش نشان می‌دهد که مدل‌های چینی هنوز در استدلال ریاضی عمیق با رقبای غربی فاصله زیادی دارند.

نگاهی به رقابت جهانی

این نتایج نشان می‌دهد که رقابت در حوزه هوش مصنوعی تنها به یک حوزه خاص محدود نیست. هر مدل نقاط قوت و ضعف خاص خود را دارد. Moonshot AI با تمرکز بر کدنویسی فرانت‌اند توانسته است گوی سبقت را از رقبا برباید، اما برای رسیدن به سطح غول‌های غربی در ریاضیات، راه طولانی در پیش دارد. این وضعیت یادآور این نکته است که بنچمارک‌های مختلف، جنبه‌های متفاوتی از هوش مصنوعی را می‌سنجند و نباید با یک معیار واحد قضاوت کرد.

برای مطالعه بیشتر در مورد بنچمارک‌های هوش مصنوعی، می‌توانید به وبسایت Epoch AI مراجعه کنید.