DeepSeek‑V4‑Flash‑0731 در بنچمارک‌های کلیدی و کارت قیمت‌گذاری نشان داد مدل تازهٔ مایکروسافت، MAI Code 1.1 Flash، در بسیاری از کاربردهای عملی عقب‌تر است.

ادعای مایکروسافت

مایکروسافت مدل کدنویسی خود را برای GitHub Copilot منتشر کرد و اعلام نمود مصرف توکن تا 25% بهینه شده، هزینهٔ جدید یک‌چهارم نسخهٔ ژوئن است و پذیرش خروجی مدل 4% افزایش یافته است. کارت مدل و مستندات رسمی اشاره می‌کنند آموزش شامل «صدها هزار محیط یادگیری تقویتی در GitHub Copilot» بوده است.

نتایج بنچمارک‌ها

در مقایسه با نسخهٔ قبلی و چند مدل کوچک‌تر از جمله Anthropic و OpenAI، MAI Code 1.1 Flash پیشرفت محدودی نشان می‌دهد. اختلاف ملموس اما در برابر DeepSeek‑V4‑Flash‑0731 قابل‌توجه است:

Benchmark MAI‑Code‑1.1‑Flash MAI‑Code‑1‑Flash Haiku 4.5 GPT‑5.4 mini DeepSeek‑V4‑Flash‑0731
SWE‑bench Verified 72.6% 71.6% 69.8% 69.2% منتشر نشده
Terminal Bench 2.1 62.9% 51.7% 49.4% 60.7% 82.7%

هزینه‌ها: ارزان‌تر از قبل، اما گران‌تر از رقبا

کارت قیمت‌گذاری نشان می‌دهد هرچند MAI Code 1.1 Flash نسبت به نسخه‌های پیشین کاهش قیمت داشته، در مقایسهٔ مستقیم با DeepSeek هزینهٔ عملیاتی بالاتری ارائه می‌دهد. نمونهٔ قیمت‌ها در کارت مدل:

Model Input Input with Cache Output
DeepSeek‑V4‑Flash $0.14 $0.0028 $0.28
MAI Code 1.1 Flash $0.20 $0.02 $1.20
Claude Haiku 4.5 $1.00 $0.10 $5.00

قیمت هر توکن تنها یکی از مولفه‌هاست؛ بهره‌وری واقعی به توانایی مدل در حل مسئله و تعداد توکن لازم برای رسیدن به پاسخ درست وابسته است. بر مبنای معیارهای عملکرد و هزینه، DeepSeek برتری قابل‌توجهی دارد.

تناقض میان شعار «هوش مصنوعی باز» و استراتژی محصول

اگرچه مایکروسافت بارها از حمایت از اکوسیستم متن‌‌باز سخن گفته، شواهد نشان می‌دهد منابع قابل‌توجهی صرف توسعهٔ مدل‌های اختصاصی MAI شده که احتمالاً به‌صورت اوپن‌ویِیت منتشر نخواهند شد. تغییر اخیر Copilot که مدل‌های OpenAI و Anthropic را با مدل‌های داخلی MAI جایگزین کرده، هزینه‌ها را کاهش داده اما هم‌زمان نشانه‌هایی از افت عملکرد نیز دارد. برای مرور نقش‌آفرینان اصلی این حوزه می‌توان به صفحات Microsoft، OpenAI و Anthropic مراجعه کرد.

پیام برای توسعه‌دهندگان و سازمان‌ها

  • اگر هزینه و کارایی اولویت شماست، بنچمارک‌های مستقل و محاسبات هزینهٔ عملیاتی را ملاک قرار دهید؛ انتخاب پیش‌فرض ارائه‌دهنده همیشه بهینه نیست.
  • استفادهٔ گسترده از مدل‌های اختصاصی می‌تواند به قفل‌شدن تأمین‌کننده (vendor lock-in) بینجامد؛ سازمان‌ها باید امکان تغییر مدل را در سطح اپلیکیشن حفظ کنند.
  • مدل‌های متن‌‌باز و بهینه‌سازی بر مبنای بار کاری واقعی هنوز فرصت رقابت فراهم می‌کنند.

گام‌های بعدی

در هفته‌ها و ماه‌های آینده انتظار بررسی‌های مستقل بیشتر، مقایسهٔ دقیق هزینهٔ عملیاتی و روشن‌شدن سیاست‌های مایکروسافت دربارهٔ پیش‌فرض‌سازی مدل‌ها در سرویس‌هایی مانند Copilot را داریم. تصمیم‌های مایکروسافت می‌تواند سهم بزرگی از بازار توسعه‌دهندگان را تغییر دهد، به‌خصوص اگر بسیاری از کاربران بدون بررسی مدل پیش‌فرض را قبول کنند.

پیوست: برای آشنایی با مفهوم کارت مدل و شفافیت بنچمارک‌ها، صفحهٔ Model card قابل‌مطالعه است.