DeepSeek بیسروصدا مدل V4 Pro را به بیلد 0813 ارتقا داد
DeepSeek این هفته نسخهٔ نهایی «DeepSeek‑V4‑Pro‑0813» را در صفحهٔ قیمتگذاری API ثبت کرد، بدون اطلاعرسانی رسمی. تغییرات در جدول قیمت نشان میدهد زیرساخت وزنهای مدل بهروزرسانی شده، اما نرخ محاسبه هزینه برای استفاده همچنان ثابت مانده است.
اعلام رسمی شرکت
قیمتهای درجشده برای V4 Pro حدود $0.435 برای هر یک میلیون توکن ورودی و $0.87 برای هر یک میلیون توکن خروجی اعلام شده است. برای آشنایی با مفهوم توکن به صفحهٔ Wikipedia مراجعه کنید. به بیان ساده، ساختار قیمتگذاری تغییر نکرده اما وزنها و بهینهسازیهای زیرین بهروزرسانی شدهاند.
نتایج بنچمارکها
مجموعهٔ مقایسهٔ DeepSeek شامل 10 بنچمارک است. در 9 بنچمارکی که هر دو مدل امتیازدهی شدهاند، میانگین برتری Claude Fable 5 حدود 5.3% گزارش شده است؛ با حذف یک مورد پرت که اختلاف 10.6% نشان میدهد، میانگین به 2.8% کاهش مییابد. در دو بنچمارک از این مجموعه DeepSeek برتر بوده است.
بسیاری از سنجشهای قبلی روی بیلدهای پیشنمایش V4 انجام شدهاند و خود DeepSeek پیشتر سری V4 را «نسخهٔ پیشنمایش» معرفی کرده بود. کارت مدل روی Hugging Face نیز به برخی نسخهها بهعنوان پیشنمایش اشاره میکند؛ بنابراین نتایج گذشته لزوماً نشاندهندهٔ عملکرد بیلد 0813 نیست.
قیمت؛ محل تمایز واقعی
در مقایسهٔ هزینهها اختلافها برجسته میشود. Claude Fable 5 با قیمت $10 برای هر یک میلیون توکن ورودی و $50 برای هر یک میلیون توکن خروجی عرضه میشود، در حالی که V4 Pro با نرخهای $0.435 و $0.87 قیمتگذاری شده است. محاسبهٔ هزینهٔ ترکیبی حدوداً مقایسهای نزدیک به $30 در برابر $0.65 نشان میدهد؛ یعنی Fable 5 بهطور قابلتوجهی گرانتر است (حدود 4,600%).
هزینه به ازای هر تسک تکمیلشده نیز تفاوت فاحشی دارد، زیرا مدلهای گرانتر معمولاً پاسخهای طولانیتر تولید کرده و زمان پردازش بیشتری نیاز دارند. اندازهگیریهای مختلف هزینهٔ هر تسک را بین $0.03 تا $3.15 برای نسخههای متفاوت گزارش کردهاند؛ اما رقم رسمی برای بیلد 0813 هنوز منتشر نشده است.
مقایسه با دیگر محصولات Anthropic و امکان اعتبارسنجی
محصولات Anthropic تصویر رقابت را پیچیدهتر میکنند: برای مثال Claude Opus 5 در بسیاری از بنچمارکها نسبت به Fable 5 عملکرد بهتری نشان داده و با قیمت کمتری عرضه میشود. همچنین وزنهای DeepSeek تحت مجوز MIT روی Hugging Face منتشر شدهاند که امکان بررسی مستقل را فراهم میآورد؛ اما تا زمانی که محققان مستقل بیلد 0813 را در آزمونهای عمومی بنچمارک نکنند، نتیجهگیری قاطع دشوار است.
نکات نامشخص
- بیلد 0813 هنوز توسط مراکز مستقل مورد سنجش قرار نگرفته؛ بنابراین ادعاهای عملکرد نیاز به تأیید ثالث دارد.
- دو بنچمارک از مجموعهٔ مقایسه DeepSeek بهصورت داخلی اجرا شدهاند (DSBench‑FullStack و DSBench‑Hard) و نتایج آنها در لیدربورد عمومی قابلبررسی نیست.
- رقابت قیمتی در اکوسیستم وزنهای باز (open‑weights) و رشد آزمایشگاههای چینی میتواند بازار را به سمت انتخابهای اقتصادیتر هدایت کند، اما پیامدهای بلندمدت بر کیفیت و قابلیت اعتماد همچنان محل بحث است.
اهمیت موضوع
مسأله تنها برندهشدن در بنچمارک نیست؛ وقتی شرکتها و استارتاپها مدلها را در مقیاس تولید بهکار میگیرند، هزینهها نقش تعیینکنندهای پیدا میکنند. آزمایشگاههایی که هزینهها را به شکل چشمگیری کاهش دادهاند نشان دادهاند میتوان به عملکرد نزدیک به پیشروها دست یافت بدون هزینههای نجومی. اگر عملکرد اعلامشدهٔ بیلد 0813 تأیید شود، کاربران تجاری احتمالاً مدلهای کمهزینهتر را بهعنوان گزینهای عملیتر انتخاب خواهند کرد.
گام بعدی
بنچمارکهای مستقل روی بیلد 0813 لازم است. دانلود وزنهای دارای مجوز MIT و اجرای آزمونهای عمومی بهترین راه برای سنجش ادعاهاست. برای مقایسهٔ دقیقتر محصولات Anthropic میتوان به منابع رسمی این شرکت مراجعه کرد: Anthropic. بازار مدلهای زبانی در حال تغییر سریع است و دور بعدی رقابت احتمالاً حولِ ترکیب هزینه، قابلیت اعتماد و عملکرد واقعی در پروژههای عملی خواهد چرخید.





