DeepSeek بی‌سروصدا مدل V4 Pro را به بیلد 0813 ارتقا داد

DeepSeek این هفته نسخهٔ نهایی «DeepSeek‑V4‑Pro‑0813» را در صفحهٔ قیمت‌گذاری API ثبت کرد، بدون اطلاع‌رسانی رسمی. تغییرات در جدول قیمت نشان می‌دهد زیرساخت وزن‌های مدل به‌روزرسانی شده، اما نرخ محاسبه هزینه برای استفاده همچنان ثابت مانده است.

اعلام رسمی شرکت

قیمت‌های درج‌شده برای V4 Pro حدود $0.435 برای هر یک میلیون توکن ورودی و $0.87 برای هر یک میلیون توکن خروجی اعلام شده است. برای آشنایی با مفهوم توکن به صفحهٔ Wikipedia مراجعه کنید. به بیان ساده، ساختار قیمت‌گذاری تغییر نکرده اما وزن‌ها و بهینه‌سازی‌های زیرین به‌روزرسانی شده‌اند.

نمایشگر جدول قیمت DeepSeek و مدل V4 Pro

نتایج بنچمارک‌ها

مجموعهٔ مقایسهٔ DeepSeek شامل 10 بنچمارک است. در 9 بنچمارکی که هر دو مدل امتیازدهی شده‌اند، میانگین برتری Claude Fable 5 حدود 5.3% گزارش شده است؛ با حذف یک مورد پرت که اختلاف 10.6% نشان می‌دهد، میانگین به 2.8% کاهش می‌یابد. در دو بنچمارک از این مجموعه DeepSeek برتر بوده است.

بسیاری از سنجش‌های قبلی روی بیلدهای پیش‌نمایش V4 انجام شده‌اند و خود DeepSeek پیش‌تر سری V4 را «نسخهٔ پیش‌نمایش» معرفی کرده بود. کارت مدل روی Hugging Face نیز به برخی نسخه‌ها به‌عنوان پیش‌نمایش اشاره می‌کند؛ بنابراین نتایج گذشته لزوماً نشان‌دهندهٔ عملکرد بیلد 0813 نیست.

مقایسه هزینه و عملکرد مدل‌های تولیدی زبان

قیمت؛ محل تمایز واقعی

در مقایسهٔ هزینه‌ها اختلاف‌ها برجسته می‌شود. Claude Fable 5 با قیمت $10 برای هر یک میلیون توکن ورودی و $50 برای هر یک میلیون توکن خروجی عرضه می‌شود، در حالی که V4 Pro با نرخ‌های $0.435 و $0.87 قیمت‌گذاری شده است. محاسبهٔ هزینهٔ ترکیبی حدوداً مقایسه‌ای نزدیک به $30 در برابر $0.65 نشان می‌دهد؛ یعنی Fable 5 به‌طور قابل‌توجهی گران‌تر است (حدود 4,600%).

هزینه به ازای هر تسک تکمیل‌شده نیز تفاوت فاحشی دارد، زیرا مدل‌های گران‌تر معمولاً پاسخ‌های طولانی‌تر تولید کرده و زمان پردازش بیشتری نیاز دارند. اندازه‌گیری‌های مختلف هزینهٔ هر تسک را بین $0.03 تا $3.15 برای نسخه‌های متفاوت گزارش کرده‌اند؛ اما رقم رسمی برای بیلد 0813 هنوز منتشر نشده است.

مقایسه با دیگر محصولات Anthropic و امکان اعتبارسنجی

محصولات Anthropic تصویر رقابت را پیچیده‌تر می‌کنند: برای مثال Claude Opus 5 در بسیاری از بنچمارک‌ها نسبت به Fable 5 عملکرد بهتری نشان داده و با قیمت کمتری عرضه می‌شود. همچنین وزن‌های DeepSeek تحت مجوز MIT روی Hugging Face منتشر شده‌اند که امکان بررسی مستقل را فراهم می‌آورد؛ اما تا زمانی که محققان مستقل بیلد 0813 را در آزمون‌های عمومی بنچمارک نکنند، نتیجه‌گیری قاطع دشوار است.

نکات نامشخص

  • بیلد 0813 هنوز توسط مراکز مستقل مورد سنجش قرار نگرفته؛ بنابراین ادعاهای عملکرد نیاز به تأیید ثالث دارد.
  • دو بنچمارک از مجموعهٔ مقایسه DeepSeek به‌صورت داخلی اجرا شده‌اند (DSBench‑FullStack و DSBench‑Hard) و نتایج آن‌ها در لیدربورد عمومی قابل‌بررسی نیست.
  • رقابت قیمتی در اکوسیستم وزن‌های باز (open‑weights) و رشد آزمایشگاه‌های چینی می‌تواند بازار را به سمت انتخاب‌های اقتصادی‌تر هدایت کند، اما پیامدهای بلندمدت بر کیفیت و قابلیت اعتماد همچنان محل بحث است.

اهمیت موضوع

مسأله تنها برنده‌شدن در بنچمارک نیست؛ وقتی شرکت‌ها و استارتاپ‌ها مدل‌ها را در مقیاس تولید به‌کار می‌گیرند، هزینه‌ها نقش تعیین‌کننده‌ای پیدا می‌کنند. آزمایشگاه‌هایی که هزینه‌ها را به شکل چشمگیری کاهش داده‌اند نشان داده‌اند می‌توان به عملکرد نزدیک به پیشروها دست یافت بدون هزینه‌های نجومی. اگر عملکرد اعلام‌شدهٔ بیلد 0813 تأیید شود، کاربران تجاری احتمالاً مدل‌های کم‌هزینه‌تر را به‌عنوان گزینه‌ای عملی‌تر انتخاب خواهند کرد.

گام بعدی

بنچمارک‌های مستقل روی بیلد 0813 لازم است. دانلود وزن‌های دارای مجوز MIT و اجرای آزمون‌های عمومی بهترین راه برای سنجش ادعاهاست. برای مقایسهٔ دقیق‌تر محصولات Anthropic می‌توان به منابع رسمی این شرکت مراجعه کرد: Anthropic. بازار مدل‌های زبانی در حال تغییر سریع است و دور بعدی رقابت احتمالاً حولِ ترکیب هزینه، قابلیت اعتماد و عملکرد واقعی در پروژه‌های عملی خواهد چرخید.