DeepSeek‑V4‑Flash‑0731 در بنچمارکهای کلیدی و کارت قیمتگذاری نشان داد مدل تازهٔ مایکروسافت، MAI Code 1.1 Flash، در بسیاری از کاربردهای عملی عقبتر است.
ادعای مایکروسافت
مایکروسافت مدل کدنویسی خود را برای GitHub Copilot منتشر کرد و اعلام نمود مصرف توکن تا 25% بهینه شده، هزینهٔ جدید یکچهارم نسخهٔ ژوئن است و پذیرش خروجی مدل 4% افزایش یافته است. کارت مدل و مستندات رسمی اشاره میکنند آموزش شامل «صدها هزار محیط یادگیری تقویتی در GitHub Copilot» بوده است.
نتایج بنچمارکها
در مقایسه با نسخهٔ قبلی و چند مدل کوچکتر از جمله Anthropic و OpenAI، MAI Code 1.1 Flash پیشرفت محدودی نشان میدهد. اختلاف ملموس اما در برابر DeepSeek‑V4‑Flash‑0731 قابلتوجه است:
| Benchmark | MAI‑Code‑1.1‑Flash | MAI‑Code‑1‑Flash | Haiku 4.5 | GPT‑5.4 mini | DeepSeek‑V4‑Flash‑0731 |
|---|---|---|---|---|---|
| SWE‑bench Verified | 72.6% | 71.6% | 69.8% | 69.2% | منتشر نشده |
| Terminal Bench 2.1 | 62.9% | 51.7% | 49.4% | 60.7% | 82.7% |
هزینهها: ارزانتر از قبل، اما گرانتر از رقبا
کارت قیمتگذاری نشان میدهد هرچند MAI Code 1.1 Flash نسبت به نسخههای پیشین کاهش قیمت داشته، در مقایسهٔ مستقیم با DeepSeek هزینهٔ عملیاتی بالاتری ارائه میدهد. نمونهٔ قیمتها در کارت مدل:
| Model | Input | Input with Cache | Output |
|---|---|---|---|
| DeepSeek‑V4‑Flash | $0.14 | $0.0028 | $0.28 |
| MAI Code 1.1 Flash | $0.20 | $0.02 | $1.20 |
| Claude Haiku 4.5 | $1.00 | $0.10 | $5.00 |
قیمت هر توکن تنها یکی از مولفههاست؛ بهرهوری واقعی به توانایی مدل در حل مسئله و تعداد توکن لازم برای رسیدن به پاسخ درست وابسته است. بر مبنای معیارهای عملکرد و هزینه، DeepSeek برتری قابلتوجهی دارد.
تناقض میان شعار «هوش مصنوعی باز» و استراتژی محصول
اگرچه مایکروسافت بارها از حمایت از اکوسیستم متنباز سخن گفته، شواهد نشان میدهد منابع قابلتوجهی صرف توسعهٔ مدلهای اختصاصی MAI شده که احتمالاً بهصورت اوپنویِیت منتشر نخواهند شد. تغییر اخیر Copilot که مدلهای OpenAI و Anthropic را با مدلهای داخلی MAI جایگزین کرده، هزینهها را کاهش داده اما همزمان نشانههایی از افت عملکرد نیز دارد. برای مرور نقشآفرینان اصلی این حوزه میتوان به صفحات Microsoft، OpenAI و Anthropic مراجعه کرد.
پیام برای توسعهدهندگان و سازمانها
- اگر هزینه و کارایی اولویت شماست، بنچمارکهای مستقل و محاسبات هزینهٔ عملیاتی را ملاک قرار دهید؛ انتخاب پیشفرض ارائهدهنده همیشه بهینه نیست.
- استفادهٔ گسترده از مدلهای اختصاصی میتواند به قفلشدن تأمینکننده (vendor lock-in) بینجامد؛ سازمانها باید امکان تغییر مدل را در سطح اپلیکیشن حفظ کنند.
- مدلهای متنباز و بهینهسازی بر مبنای بار کاری واقعی هنوز فرصت رقابت فراهم میکنند.
گامهای بعدی
در هفتهها و ماههای آینده انتظار بررسیهای مستقل بیشتر، مقایسهٔ دقیق هزینهٔ عملیاتی و روشنشدن سیاستهای مایکروسافت دربارهٔ پیشفرضسازی مدلها در سرویسهایی مانند Copilot را داریم. تصمیمهای مایکروسافت میتواند سهم بزرگی از بازار توسعهدهندگان را تغییر دهد، بهخصوص اگر بسیاری از کاربران بدون بررسی مدل پیشفرض را قبول کنند.
پیوست: برای آشنایی با مفهوم کارت مدل و شفافیت بنچمارکها، صفحهٔ Model card قابلمطالعه است.





