DeepSeek V4 Flash Vision Exp وارد میدان شد

DeepSeek در 21 اوت مدل V4 Flash Vision Exp را منتشر کرد (عنوان تجاری: DeepSeek V4 Vision)؛ نخستین مدل این شرکت با ورودی تصویری که نمودار، اسکرین‌شات یا عکس از سند را مانند متن تحلیل می‌کند. از 27 اوت این مدل از طریق دروازه‌های API مانند OpenRouter در دسترس قرار گرفت. تعرفهٔ اعلام‌شده 0.22 دلار به ازای هر میلیون توکن ورودی و 0.66 دلار به ازای هر میلیون توکن خروجی است (در ساعات اوج کاری قیمت ممکن است افزایش یابد).

مقایسهٔ مستقیم با Gemini 3.7 Flash

گوگل دو هفته زودتر، در 13 اوت، Gemini 3.7 Flash را معرفی کرد؛ مدلی که به‌عنوان گزینهٔ اقتصادی برای کارهای بینایی مطرح شده است و در OpenRouter تعرفهٔ 0.75 دلار ورودی و 3.75 دلار خروجی به ازای هر میلیون توکن دارد. برای مرجع فنی می‌توانید صفحهٔ Google Gemini در ویکی‌پدیا را مرور کنید.

روش آزمایش: سه سناریوی واقعی

سه سناریوی عملی طراحی شد تا کارایی و هزینهٔ دو مدل در مواردی مشابه با وظایف اداری و فنی روزمره سنجیده شود:

  • خواندن نمودار دومحوری (stacked bar + secondary axis line).
  • حسابرسی فاکتور با سه خطای کاشته‌شده (خطای جمع خطی، زیرجمع نامطابق، تاریخ سررسید قبل از تاریخ فاکتور).
  • تشخیص علت ریشه‌ای در مجموعهٔ لاگ تولید که علت اصلی چند دقیقه قبل از کرش رخ‌داده است.

همان تصاویر و پرامپت‌ها از طریق OpenRouter به هر دو مدل ارسال شد و دقت، توکِن‌ها، هزینهٔ نهایی و زمان پاسخ ثبت گردید.

خلاصهٔ تعرفه و توکِن‌بندی

  • تعرفه‌ها: DeepSeek: $0.22 ورودی / $0.66 خروجی. Gemini (OpenRouter): $0.75 ورودی / $3.75 خروجی.
  • نحوهٔ شمارش توکن تصاویر: ارائه‌دهندگان روش‌های متفاوتی برای توکِن‌بندی تصاویر دارند؛ اختلاف در شمارش توکن می‌تواند هزینه و سرعت را به‌طور قابل‌توجهی تغییر دهد.

تست 1 — نمودار دومحوری

پرامپت از مدل‌ها خواست سه سوال را پاسخ دهند: 1) در کدام سه‌ماهه هزینه‌ها از درآمد کل پیشی گرفته‌اند؟ 2) کدام بخش درآمدی در همهٔ فصل‌ها رشد داشته است؟ 3) تخمین کل درآمد سالانه به میلیون دلار.

نمودار دومحوری مورد آزمایش

هر دو مدل ساختار دومحور نمودار را تشخیص دادند و پاسخ‌های صحیح ارائه دادند: سه‌ماههٔ اول، بخش Subscriptions و مجموع سالانه حدود 36.1 میلیون دلار. تفاوت اصلی در سبک ارائه بود: DeepSeek پاسخ کوتاه و مستقیم داد و Gemini پاسخ تفصیلی همراه با خوانش هر ستون ارائه کرد. در این سناریو دقت برابر بود؛ تفاوت در طول و قالب خروجی بود.

تست 2 — فاکتور معیوب

پرامپت شامل سه درخواست مشخص برای حسابرسی ردیف‌ها، محاسبهٔ مجموع صحیح و بررسی خطاهای غیرعددی بود. هر دو مدل هر سه خطای کاشته‌شده را یافتند؛ از جمله سطر مانیتور که 10 دستگاه با قیمت 45.99 به‌اشتباه 505.89 گزارش شده بود (مقدار صحیح 459.90) و ثبت تاریخ سررسید قبل از تاریخ فاکتور.

نمونه فاکتور مورد آزمون

اما اختلاف بزرگی در زمان و حجم خروجی مشاهده شد: DeepSeek در 30.5 ثانیه پاسخ داد و 3,467 توکن خروجی ثبت کرد؛ نشان‌دهندهٔ متن استدلال گسترده که به‌عنوان خروجی محاسبه شد. Gemini در 7.9 ثانیه با 944 توکن خروجی پاسخ داد. این تفاوت، هزینهٔ نهایی و تجربهٔ کاربری در سامانه‌های بلادرنگ را به‌شدت تحت‌تأثیر قرار می‌دهد.

تست 3 — علت ریشه‌ای در لاگ

در سناریوی لاگ، کرش سرویس پرداخت در انتها رخ داد اما علت اصلی—a batch job که کانکشن‌های دیتابیس را مصرف کرده بود—چند دقیقه قبل بروز کرده بود. هر دو مدل علت را شناسایی، بازهٔ شروع مشکل را مشخص و اقدام پیشنهادی برای متوقف‌سازی کار دسته‌ای ارائه کردند. Gemini علاوه بر این، نمونهٔ دستورات PostgreSQL برای متوقف‌سازی کار دسته‌ای پیشنهاد داد.

نمونه لاگ تولید برای تشخیص علت ریشه‌ای

در این تست DeepSeek با 1,636 توکن خروجی و زمان 11.9 ثانیه هزینهٔ حدود $0.00088 به‌ازای پاسخ ثبت کرد؛ در مقابل Gemini با 1,854 توکن و 7.6 ثانیه هزینهٔ حدود $0.00351 داشت. در این مورد Gemini سریع‌تر بود اما هزینهٔ هر پاسخ بیشتر شد.

نتیجه‌گیری عملی برای توسعه‌دهندگان و تیم‌های فنی

انتخاب بین DeepSeek V4 Vision و Gemini 3.7 Flash عمدتاً بر اساس دو معیار تعیین می‌شود:

  • بودجه و مقیاس‌پذیری هزینه: اگر بار پردازش تصویر بالا است و کنترل هزینه حیاتی است، تعرفهٔ پایهٔ پایین‌تر DeepSeek در حجم‌های بالا صرفه‌جویی قابل‌توجهی ایجاد می‌کند.
  • تاخیر و تجربهٔ بلادرنگ: اگر نیاز به پاسخ سریع با کمترین تأخیر دارید، Gemini در اغلب سناریوها سریع‌تر عمل کرد و گاهی خروجیِ کمتری تولید نمود؛ اما هزینهٔ توکن‌های آن بالاتر است.

نکات عملی:

  • توکِن‌بندی تصاویر را پیش از تصمیم‌گیری بررسی کنید؛ یک تصویر می‌تواند در یک مدل معادل 500 توکن و در مدل دیگر 1,150 توکن محاسبه شود که اختلاف هزینه قابل‌توجهی ایجاد می‌کند.
  • برای کاربردهای بلادرنگ یا سیستم‌های حساس به تأخیر، آزمون‌های تأخیر (latency) را در شرایط واقعی شبکه و بار انجام دهید.
  • نوع خروجی مطلوب (خلاصه کوتاه در مقابل پاسخ تفصیلی) می‌تواند هزینه و تجربهٔ کاربری را تغییر دهد؛ در بسیاری از موارد می‌توان با تنظیم پرامپت حجم خروجی را کاهش داد.

پرامپت‌ها و فایل‌های تصویری آزمایش (برای بازتولید)

برای بازتولید آزمایش‌ها، پرامپت‌های اصلی و آدرس تصاویر در ادامه آمده است:

تست 1 (نمودار):
"این نمودار را با دقت ببینید و به هر سه سوال پاسخ دهید. پاسخ‌ها را شماره‌گذاری کنید. 1. در کدام سه‌ماهه هزینه‌های عملیاتی بیشتر از کل درآمد شد؟ 2. کدام بخش درآمدی در هر سه‌ماهه رشد کرد؟ 3. کل درآمد سالانهٔ شرکت را به میلیون دلار تخمین بزنید."

تست 2 (فاکتور):
"شما این فاکتور را حسابرسی می‌کنید. به هر سه سوال پاسخ دهید. پاسخ‌ها را شماره‌گذاری کنید. 1. هر ردیف را بررسی کنید: آیا مقدار برابر است با تعداد ضربدر قیمت واحد؟ هر ردیف اشتباه را نام ببرید و مقدار درست را بدهید. 2. مجموع صحیح بدهی چقدر باید باشد؟ محاسبهٔ خود را نشان دهید. 3. غیر از محاسبات، آیا چیز دیگری در این فاکتور اشتباه است؟"

تست 3 (لاگ):
"این‌ها لاگ‌های تولید از یک قطعی هستند. به هر سه سوال پاسخ دهید. پاسخ‌ها را شماره‌گذاری کنید. 1. علت ریشه‌ای این قطعی چیست؟ 2. مشکل واقعاً از چه زمانی شروع شد؟ 3. اولین اقدام واحدی که برای بازیابی سرویس انجام می‌دهید چیست؟"

تصاویر مورد استفاده:
- https://cdn.negatech.ir/negatech-media/20260831_162918_b7b19ce4c00f4b99932051aeb7c27060.png
- https://cdn.negatech.ir/negatech-media/20260831_162919_af809b9c508f4219bb35f21f379c5cfd.png
- https://cdn.negatech.ir/negatech-media/20260831_162919_9c2de68706004f03847cfaf79c705655.png

جمع‌بندی: اگر مصرف تصویر بالا و کنترل هزینه برایتان اولویت است، DeepSeek V4 Vision گزینهٔ جذابی است. اگر تأخیر پایین و تجربهٔ بلادرنگ مهم است، Gemini 3.7 Flash معمولاً سریع‌تر پاسخ می‌دهد اما هزینهٔ هر میلیون توکن بالاتری دارد. هر دو مدل در خواندن نمودارها، اسناد و تحلیل لاگ‌ها کارآمد بودند؛ انتخاب نهایی بستگی به ترکیب معیارهای هزینه، تاخیر و نحوهٔ توکِن‌بندی دارد.

برای مطالعهٔ بیشتر دربارهٔ روش‌های توکِن‌بندی داده‌ها به صفحهٔ Tokenization در ویکی‌پدیا مراجعه کنید.