Deepseek مدل تجربی چندرسانهای V4-Flash-Vision-Exp را معرفی کرد. این نسخه، قابلیت فهم تصویر را به تواناییهای متنی V4-Flash میافزاید و در بنچمارکهای عامل داخلی شرکت عملکردی نزدیک به Opus 4.8 از خود نشان میدهد.
ویژگیهای کلیدی
- حفظ عملکرد متنی پایه همراه با افزودن لایههای بینایی برای تحلیل، توصیف و استخراج متن از تصاویر.
- طراحیشده برای گردشکارهای مبتنی بر عامل: امکان ترکیب فهم بصری با استفاده از ابزارها (tool use) برای وظایف چندمرحلهای.
- قابلیت تحلیل انواع ورودیهای بصری از اسکرینشاتها تا نمودارها و دیاگرامها.
پشتیبانی فرمتها و روشهای ارسال تصویر
- فرمتهای سازگار: JPEG، PNG، GIF و WebP. مدل فرمت را از محتوای فایل تشخیص میدهد و به نام فایل یا MIME type اعلامشده وابسته نیست.
- روشهای ارسال تصویر: قرار دادن مستقیم با Base64، اشاره به URLهای عمومی تا 32 MiB، یا استفاده از Files API (امکان آپلود یکبار برای ارجاع چندباره، تا 64 MiB).
محدودیتها، هزینهها و بهینهسازی
- هزینه پردازش هر تصویر تا 384 توکن است، مستقل از رزولوشن اصلی.
- هر درخواست میتواند تا 600 تصویر شامل شود. بیشترین طول ضلع تا 8,192 پیکسل است؛ در صورتی که درخواست شامل 15 تصویر یا بیشتر باشد، این حد به 4,096 پیکسل کاهش مییابد.
- فیلد اختیاری detail امکان مقیاسپایین کردن تصاویر تا 512×512 پیکسل را فراهم میکند تا در مواقعی که جزئیات بصری دقیق لازم نیست، توکنها صرفهجویی شوند. پیش از پردازش، مدل تصاویر را بسته به نسبت به حدود 800×800 پیکسل نرمالسازی میکند.
یکپارچهسازی با چارچوبها و APIها
V4-Flash-Vision-Exp با APIهای رایج سازگار است، از جمله Chat Completions و Responses از OpenAI و نقطهٔ پایانی Messages از Anthropic. همچنین Deepseek نسخهٔ 0.1.1 چارچوب Harness را منتشر کرده که پشتیبانی از مدل جدید را بهصورت آماده فراهم میکند.
موارد کاربرد
- دستیارهای تصویری که باید محتوای عکس و اسکرینشات را تحلیل و توضیح دهند.
- ابزارهای پشتیبانی فنی که از اسکرینشاتها برای تشخیص و راهنمایی عیبیابی استفاده میکنند.
- سیستمهایی که نیاز به تفسیر و خلاصهسازی نمودارها، دیاگرامها و دادههای تصویری دارند.
نکات فنی و نتایج داخلی
Deepseek اعلام کرده تلاش شده پایهٔ متنی مدل بدون افت عملکرد حفظ شود و همزمان تواناییهای استدلالی و دانش دنیایی تقویت شود. ارزیابیهای داخلی شرکت نشان میدهد نسخه بینایی در بنچمارکهای عامل امتیازی نزدیک به Opus 4.8 کسب کرده است؛ این بنچمارکها ترکیبی از وظایف فهم تصویر، تصمیمگیری مبتنی بر ابزار و تعامل چندمرحلهای را شامل میشوند.
منابع برای توسعهدهندگان
- آشنایی با یادگیری چندرسانهای: Multimodal learning در ویکیپدیا.
- مستندات ارسال تصاویر و استفاده از Files API در مستندات Deepseek موجود است؛ برای نمونههای مشابه میتوان مستندات OpenAI و Anthropic را نیز مرور کرد.
چشمانداز عملیاتی
رقابت در حوزهٔ مدلهای چندرسانهای ادامه دارد و نسخههای تجربی مانند V4-Flash-Vision-Exp نشاندهندهٔ تمرکز شرکتها روی ترکیب فهم بصری با تعامل عاملمحور است. برای انتخاب این مدل در پروژهها، بررسی نتایج بنچمارکهای مستقل، نحوهٔ ادغام با ابزارها و محدودیتهای عملیاتی (هزینه، اندازه تصویر و نرخ پردازش) اهمیت دارد. در صورتی که نسخهٔ تجربی در ارزیابیهای مستقل نیز عملکردی نزدیک به Opus 4.8 نشان دهد، میتواند گزینهای جذاب برای توسعهٔ عاملهای چندرسانهای باشد.





