مدل هوش مصنوعی Kimi K3 شرکت چینی Moonshot این روزها توجه زیادی را در جامعه هوش مصنوعی غرب به خود جلب کرده است. سوال اصلی این است که آیا این مدل چینی واقعاً میتواند با بهترین مدلهای غربی رقابت کند؟ دو داده جدید از بنچمارکهای معتبر، تصویری متفاوت و جالب از تواناییهای آن ارائه میدهند.
پیروزی قاطع در کدنویسی فرانتاند
در بنچمارک Code Arena: Frontend که مدلها را بر اساس رتبهبندی ترجیح انسانی ارزیابی میکند، Kimi K3 موفق به کسب امتیاز 1,679 شده است. این امتیاز از مدلهای قدرتمندی مانند Claude Fable 5 (1,631) و GPT-5.6 Sol (1,618) با اختلاف قابل توجهی پیشی گرفته است. این اولین بار است که یک مدل چینی رتبه اول را در این بنچمارک به دست میآورد و نشاندهنده پیشرفت چشمگیر Moonshot در حوزه کدنویسی فرانتاند است.
شکست در ریاضیات پیچیده
اما تصویر برای ریاضیات سخت کاملاً متفاوت است. طبق دادههای منتشر شده توسط Epoch AI، دقت مدل Kimi K3 در سطح Tier 4 از بنچمارک FrontierMath که سختترین مسائل ریاضی در سطح خبره را شامل میشود، تنها حدود 39 درصد است. در مقابل، مدلهای OpenAI و Anthropic در برخی موارد به دقت نزدیک به 90 درصد دست مییابند. این اختلاف فاحش نشان میدهد که مدلهای چینی هنوز در استدلال ریاضی عمیق با رقبای غربی فاصله زیادی دارند.
نگاهی به رقابت جهانی
این نتایج نشان میدهد که رقابت در حوزه هوش مصنوعی تنها به یک حوزه خاص محدود نیست. هر مدل نقاط قوت و ضعف خاص خود را دارد. Moonshot AI با تمرکز بر کدنویسی فرانتاند توانسته است گوی سبقت را از رقبا برباید، اما برای رسیدن به سطح غولهای غربی در ریاضیات، راه طولانی در پیش دارد. این وضعیت یادآور این نکته است که بنچمارکهای مختلف، جنبههای متفاوتی از هوش مصنوعی را میسنجند و نباید با یک معیار واحد قضاوت کرد.
برای مطالعه بیشتر در مورد بنچمارکهای هوش مصنوعی، میتوانید به وبسایت Epoch AI مراجعه کنید.





