یک معیار جدید در اقتصاد مدلهای هوش مصنوعی شکل گرفته است. بنچمارک OpenDesign Arena نشان میدهد مدل DeepSeek V4.1 Flash با امتیاز ۸۱.۲ از ۱۰۰، تنها ۱.۵ واحد از رهبر جدول GPT-6 Astra (امتیاز ۸۲.۷) عقب مانده، در حالی که هزینه هر طراحی تمامشده از ۱.۶۱ دلار به ۰.۰۲۳ دلار کاهش یافته — تقریبا ۱.۴ درصد قیمت رقیب.
چرا این بنچمارک از لیدربوردهای رایج متفاوت است؟
برخلاف لیدربوردهای عمومی که بر استدلال انتزاعی یا کدنویسی الگوریتمی تمرکز دارند، OpenDesign Arena سناریوهای واقعی طراحی وب را به چالش میکشد: ساخت اپلیکیشنهای تحت وب، داشبوردهای تحلیلی، صفحات موبایل و لندینگ پیجهای تجاری.
- ۳۰٪ امتیاز: اختصاص دارد به «عملکرد طبق بریف» (دقت در پیروی از دستورالعملها).
- ۷۰٪ امتیاز: مختص کیفیت بصری است — چیدمان، سلسلهمرتبه دیداری، نظام رنگ و انطباق سبک برند.
خروجی تنها زمانی امتیاز کسب میکند که به عنوان یک صفحه وب کارآمد رندر شود. خروجیهای خالی، معیوب یا بریدهشده، صفر امتیاز دریافت میکنند و مجدداً تست نمیشوند. این به معنای سنجش موثریت روزمره است، نه صرفاً قابلیت تئوریک.
مقایسه کمی: امتیاز، سرعت و هزینه
| مدل | امتیاز | زمان (دقیقه) | هزینه (دلار) | نرخ تحویل |
|---|---|---|---|---|
| GPT-6 Astra | ۸۲.۷ | ۱۱.۱ | ۱.۶۱ | ۶۰٪ |
| DeepSeek V4.1 Flash | ۸۱.۲ | ۵.۳ | ۰.۰۲۳ | ۵۷.۷٪ |
| Claude Fable 5.1 | ۸۰.۳ | ۱۲.۸ | ۳.۶۶ | ۵۶.۷٪ |
منبع: OpenDesign Arena، تست ۱۳ مدل در سپتامبر ۲۰۲۶
معماری «رمزگذار-رمزگشای علی»: موتور ارزانی
گزارش فنی دیپسیک آشکار میکند: V4.1 Flash در مجموع ۵۵۲ میلیارد پارامتر دارد، اما برای خواندن پرامپت تنها ۸ میلیارد و برای تولید پاسخ ۱۶ میلیارد پارامتر را فعال میکند. این معماری Encoder-Decoder علی، حجم محاسبه را به شدت کاهش میدهد و مستقیماً بر زمان استنتاج و هزینه نهایی اثر میگذارد.
این استراتژی تازگی ندارد؛ همان روش هفتهها پیش در مدل V4 Pro هم اثرگذار بود: آن مدل در فاصله ۵ درصدی Claude Fable 5 قرار گرفت، با کسری قابل توجه از هزینه.
رقبای دیگر: گرانتر، کندتر و ضعیفتر
۱۱ مدل از ۱۳ مدل تستشده — از جمله Grok 4.6، Qwen 3.8-Max، Kimi K3، GLM-5.3 Flash و Gemini 3.8 Flash — هم امتیاز پایینتر از V4.1 Flash داشتند و هم هزینه اجرایی بالاتر. تنها GPT-6 Astra توانست برآمد کند، با تفاوتی جزئی در امتیاز اما ۷۰ برابر هزینه.
استراتژی کلان دیپسیک: مالکیت پشته عاملگرا (Agentic Stack)
دیپسیک تنها با عرضه مدلِ وزندار بسنده نمیکند. شرکت در حال استخدام مهندس در پکن برای ساخت Code Harness اختصاصی است — هدف: کنترل کامل پشته عاملگرا (agentic stack) به جای وابستگی به فریمورکهای شخص ثالث. این حرکت نشاندهنده چشاندازی است که در آن مدل، تنها یک لایه از محصول نهایی است.
GPT-6 Astra: جنرالنیست، نه متخصص طراحی
اپنایآی GPT-6 Astra را در ۳ سپتامبر انتشار داد. مدل ماهیت «همهکاره» دارد — از چیدمان برد مدار تا تدوین اظهارنامه مالیات و رندر صحنههای سهبعدی. اما تستکنندگان اولیه در وظایف نوشتن خلاقانه، ردهبندی پایینتری نسبت به مدل پیشین را گزارش کردهاند. در بنچمارک طراحی نیز همین الگو تکرار میشود: پرهزینه، کندتر، اما همچنان بالاترین امتیاز را در آنسوی میز میگذارد.
پایانی: جایگاه طراحان فردا
برای یک تیم طراحی وب که هفتههاست با محدودیت بودجه و ددلاینِ تنگ روبروست، V4.1 Flash گزینهای است که نمیتوان نادیده گرفت. نرخ تحویل ۵۷.۷ درصد یعنی بیش از نیمی از خروجیها بدون بازبینیِ سنگین قابل استقرار هستند — در حالی که هزینهِ هر تلاش، طیف وسیعی از آزمایش و خطا را امکانپذیر میسازد. پرسش بیپاسخ مانده: تا کی این شکاف قیمتی دوام میآورد؟





