DeepSeek V4 Flash Vision Exp وارد میدان شد
DeepSeek در 21 اوت مدل V4 Flash Vision Exp را منتشر کرد (عنوان تجاری: DeepSeek V4 Vision)؛ نخستین مدل این شرکت با ورودی تصویری که نمودار، اسکرینشات یا عکس از سند را مانند متن تحلیل میکند. از 27 اوت این مدل از طریق دروازههای API مانند OpenRouter در دسترس قرار گرفت. تعرفهٔ اعلامشده 0.22 دلار به ازای هر میلیون توکن ورودی و 0.66 دلار به ازای هر میلیون توکن خروجی است (در ساعات اوج کاری قیمت ممکن است افزایش یابد).
مقایسهٔ مستقیم با Gemini 3.7 Flash
گوگل دو هفته زودتر، در 13 اوت، Gemini 3.7 Flash را معرفی کرد؛ مدلی که بهعنوان گزینهٔ اقتصادی برای کارهای بینایی مطرح شده است و در OpenRouter تعرفهٔ 0.75 دلار ورودی و 3.75 دلار خروجی به ازای هر میلیون توکن دارد. برای مرجع فنی میتوانید صفحهٔ Google Gemini در ویکیپدیا را مرور کنید.
روش آزمایش: سه سناریوی واقعی
سه سناریوی عملی طراحی شد تا کارایی و هزینهٔ دو مدل در مواردی مشابه با وظایف اداری و فنی روزمره سنجیده شود:
- خواندن نمودار دومحوری (stacked bar + secondary axis line).
- حسابرسی فاکتور با سه خطای کاشتهشده (خطای جمع خطی، زیرجمع نامطابق، تاریخ سررسید قبل از تاریخ فاکتور).
- تشخیص علت ریشهای در مجموعهٔ لاگ تولید که علت اصلی چند دقیقه قبل از کرش رخداده است.
همان تصاویر و پرامپتها از طریق OpenRouter به هر دو مدل ارسال شد و دقت، توکِنها، هزینهٔ نهایی و زمان پاسخ ثبت گردید.
خلاصهٔ تعرفه و توکِنبندی
- تعرفهها: DeepSeek: $0.22 ورودی / $0.66 خروجی. Gemini (OpenRouter): $0.75 ورودی / $3.75 خروجی.
- نحوهٔ شمارش توکن تصاویر: ارائهدهندگان روشهای متفاوتی برای توکِنبندی تصاویر دارند؛ اختلاف در شمارش توکن میتواند هزینه و سرعت را بهطور قابلتوجهی تغییر دهد.
تست 1 — نمودار دومحوری
پرامپت از مدلها خواست سه سوال را پاسخ دهند: 1) در کدام سهماهه هزینهها از درآمد کل پیشی گرفتهاند؟ 2) کدام بخش درآمدی در همهٔ فصلها رشد داشته است؟ 3) تخمین کل درآمد سالانه به میلیون دلار.
هر دو مدل ساختار دومحور نمودار را تشخیص دادند و پاسخهای صحیح ارائه دادند: سهماههٔ اول، بخش Subscriptions و مجموع سالانه حدود 36.1 میلیون دلار. تفاوت اصلی در سبک ارائه بود: DeepSeek پاسخ کوتاه و مستقیم داد و Gemini پاسخ تفصیلی همراه با خوانش هر ستون ارائه کرد. در این سناریو دقت برابر بود؛ تفاوت در طول و قالب خروجی بود.
تست 2 — فاکتور معیوب
پرامپت شامل سه درخواست مشخص برای حسابرسی ردیفها، محاسبهٔ مجموع صحیح و بررسی خطاهای غیرعددی بود. هر دو مدل هر سه خطای کاشتهشده را یافتند؛ از جمله سطر مانیتور که 10 دستگاه با قیمت 45.99 بهاشتباه 505.89 گزارش شده بود (مقدار صحیح 459.90) و ثبت تاریخ سررسید قبل از تاریخ فاکتور.
اما اختلاف بزرگی در زمان و حجم خروجی مشاهده شد: DeepSeek در 30.5 ثانیه پاسخ داد و 3,467 توکن خروجی ثبت کرد؛ نشاندهندهٔ متن استدلال گسترده که بهعنوان خروجی محاسبه شد. Gemini در 7.9 ثانیه با 944 توکن خروجی پاسخ داد. این تفاوت، هزینهٔ نهایی و تجربهٔ کاربری در سامانههای بلادرنگ را بهشدت تحتتأثیر قرار میدهد.
تست 3 — علت ریشهای در لاگ
در سناریوی لاگ، کرش سرویس پرداخت در انتها رخ داد اما علت اصلی—a batch job که کانکشنهای دیتابیس را مصرف کرده بود—چند دقیقه قبل بروز کرده بود. هر دو مدل علت را شناسایی، بازهٔ شروع مشکل را مشخص و اقدام پیشنهادی برای متوقفسازی کار دستهای ارائه کردند. Gemini علاوه بر این، نمونهٔ دستورات PostgreSQL برای متوقفسازی کار دستهای پیشنهاد داد.
در این تست DeepSeek با 1,636 توکن خروجی و زمان 11.9 ثانیه هزینهٔ حدود $0.00088 بهازای پاسخ ثبت کرد؛ در مقابل Gemini با 1,854 توکن و 7.6 ثانیه هزینهٔ حدود $0.00351 داشت. در این مورد Gemini سریعتر بود اما هزینهٔ هر پاسخ بیشتر شد.
نتیجهگیری عملی برای توسعهدهندگان و تیمهای فنی
انتخاب بین DeepSeek V4 Vision و Gemini 3.7 Flash عمدتاً بر اساس دو معیار تعیین میشود:
- بودجه و مقیاسپذیری هزینه: اگر بار پردازش تصویر بالا است و کنترل هزینه حیاتی است، تعرفهٔ پایهٔ پایینتر DeepSeek در حجمهای بالا صرفهجویی قابلتوجهی ایجاد میکند.
- تاخیر و تجربهٔ بلادرنگ: اگر نیاز به پاسخ سریع با کمترین تأخیر دارید، Gemini در اغلب سناریوها سریعتر عمل کرد و گاهی خروجیِ کمتری تولید نمود؛ اما هزینهٔ توکنهای آن بالاتر است.
نکات عملی:
- توکِنبندی تصاویر را پیش از تصمیمگیری بررسی کنید؛ یک تصویر میتواند در یک مدل معادل 500 توکن و در مدل دیگر 1,150 توکن محاسبه شود که اختلاف هزینه قابلتوجهی ایجاد میکند.
- برای کاربردهای بلادرنگ یا سیستمهای حساس به تأخیر، آزمونهای تأخیر (latency) را در شرایط واقعی شبکه و بار انجام دهید.
- نوع خروجی مطلوب (خلاصه کوتاه در مقابل پاسخ تفصیلی) میتواند هزینه و تجربهٔ کاربری را تغییر دهد؛ در بسیاری از موارد میتوان با تنظیم پرامپت حجم خروجی را کاهش داد.
پرامپتها و فایلهای تصویری آزمایش (برای بازتولید)
برای بازتولید آزمایشها، پرامپتهای اصلی و آدرس تصاویر در ادامه آمده است:
تست 1 (نمودار): "این نمودار را با دقت ببینید و به هر سه سوال پاسخ دهید. پاسخها را شمارهگذاری کنید. 1. در کدام سهماهه هزینههای عملیاتی بیشتر از کل درآمد شد؟ 2. کدام بخش درآمدی در هر سهماهه رشد کرد؟ 3. کل درآمد سالانهٔ شرکت را به میلیون دلار تخمین بزنید." تست 2 (فاکتور): "شما این فاکتور را حسابرسی میکنید. به هر سه سوال پاسخ دهید. پاسخها را شمارهگذاری کنید. 1. هر ردیف را بررسی کنید: آیا مقدار برابر است با تعداد ضربدر قیمت واحد؟ هر ردیف اشتباه را نام ببرید و مقدار درست را بدهید. 2. مجموع صحیح بدهی چقدر باید باشد؟ محاسبهٔ خود را نشان دهید. 3. غیر از محاسبات، آیا چیز دیگری در این فاکتور اشتباه است؟" تست 3 (لاگ): "اینها لاگهای تولید از یک قطعی هستند. به هر سه سوال پاسخ دهید. پاسخها را شمارهگذاری کنید. 1. علت ریشهای این قطعی چیست؟ 2. مشکل واقعاً از چه زمانی شروع شد؟ 3. اولین اقدام واحدی که برای بازیابی سرویس انجام میدهید چیست؟" تصاویر مورد استفاده: - https://cdn.negatech.ir/negatech-media/20260831_162918_b7b19ce4c00f4b99932051aeb7c27060.png - https://cdn.negatech.ir/negatech-media/20260831_162919_af809b9c508f4219bb35f21f379c5cfd.png - https://cdn.negatech.ir/negatech-media/20260831_162919_9c2de68706004f03847cfaf79c705655.png
جمعبندی: اگر مصرف تصویر بالا و کنترل هزینه برایتان اولویت است، DeepSeek V4 Vision گزینهٔ جذابی است. اگر تأخیر پایین و تجربهٔ بلادرنگ مهم است، Gemini 3.7 Flash معمولاً سریعتر پاسخ میدهد اما هزینهٔ هر میلیون توکن بالاتری دارد. هر دو مدل در خواندن نمودارها، اسناد و تحلیل لاگها کارآمد بودند؛ انتخاب نهایی بستگی به ترکیب معیارهای هزینه، تاخیر و نحوهٔ توکِنبندی دارد.
برای مطالعهٔ بیشتر دربارهٔ روشهای توکِنبندی دادهها به صفحهٔ Tokenization در ویکیپدیا مراجعه کنید.





