Deepseek مدل تجربی چندرسانه‌ای V4-Flash-Vision-Exp را معرفی کرد. این نسخه، قابلیت فهم تصویر را به توانایی‌های متنی V4-Flash می‌افزاید و در بنچ‌مارک‌های عامل داخلی شرکت عملکردی نزدیک به Opus 4.8 از خود نشان می‌دهد.

ویژگی‌های کلیدی

  • حفظ عملکرد متنی پایه همراه با افزودن لایه‌های بینایی برای تحلیل، توصیف و استخراج متن از تصاویر.
  • طراحی‌شده برای گردش‌کارهای مبتنی بر عامل: امکان ترکیب فهم بصری با استفاده از ابزارها (tool use) برای وظایف چندمرحله‌ای.
  • قابلیت تحلیل انواع ورودی‌های بصری از اسکرین‌شات‌ها تا نمودارها و دیاگرام‌ها.

پشتیبانی فرمت‌ها و روش‌های ارسال تصویر

  • فرمت‌های سازگار: JPEG، PNG، GIF و WebP. مدل فرمت را از محتوای فایل تشخیص می‌دهد و به نام فایل یا MIME type اعلام‌شده وابسته نیست.
  • روش‌های ارسال تصویر: قرار دادن مستقیم با Base64، اشاره به URLهای عمومی تا 32 MiB، یا استفاده از Files API (امکان آپلود یک‌بار برای ارجاع چندباره، تا 64 MiB).

محدودیت‌ها، هزینه‌ها و بهینه‌سازی

  • هزینه پردازش هر تصویر تا 384 توکن است، مستقل از رزولوشن اصلی.
  • هر درخواست می‌تواند تا 600 تصویر شامل شود. بیشترین طول ضلع تا 8,192 پیکسل است؛ در صورتی که درخواست شامل 15 تصویر یا بیشتر باشد، این حد به 4,096 پیکسل کاهش می‌یابد.
  • فیلد اختیاری detail امکان مقیاس‌پایین کردن تصاویر تا 512×512 پیکسل را فراهم می‌کند تا در مواقعی که جزئیات بصری دقیق لازم نیست، توکن‌ها صرفه‌جویی شوند. پیش از پردازش، مدل تصاویر را بسته به نسبت به حدود 800×800 پیکسل نرمال‌سازی می‌کند.

یکپارچه‌سازی با چارچوب‌ها و APIها

V4-Flash-Vision-Exp با APIهای رایج سازگار است، از جمله Chat Completions و Responses از OpenAI و نقطهٔ پایانی Messages از Anthropic. همچنین Deepseek نسخهٔ 0.1.1 چارچوب Harness را منتشر کرده که پشتیبانی از مدل جدید را به‌صورت آماده فراهم می‌کند.

موارد کاربرد

  • دستیارهای تصویری که باید محتوای عکس و اسکرین‌شات را تحلیل و توضیح دهند.
  • ابزارهای پشتیبانی فنی که از اسکرین‌شات‌ها برای تشخیص و راهنمایی عیب‌یابی استفاده می‌کنند.
  • سیستم‌هایی که نیاز به تفسیر و خلاصه‌سازی نمودارها، دیاگرام‌ها و داده‌های تصویری دارند.
نمایی از مستندسازی V4-Flash-Vision-Exp و نمونه‌های پردازش تصویر

نکات فنی و نتایج داخلی

Deepseek اعلام کرده تلاش شده پایهٔ متنی مدل بدون افت عملکرد حفظ شود و هم‌زمان توانایی‌های استدلالی و دانش دنیایی تقویت شود. ارزیابی‌های داخلی شرکت نشان می‌دهد نسخه بینایی در بنچ‌مارک‌های عامل امتیازی نزدیک به Opus 4.8 کسب کرده است؛ این بنچ‌مارک‌ها ترکیبی از وظایف فهم تصویر، تصمیم‌گیری مبتنی بر ابزار و تعامل چندمرحله‌ای را شامل می‌شوند.

منابع برای توسعه‌دهندگان

  • آشنایی با یادگیری چندرسانه‌ای: Multimodal learning در ویکی‌پدیا.
  • مستندات ارسال تصاویر و استفاده از Files API در مستندات Deepseek موجود است؛ برای نمونه‌های مشابه می‌توان مستندات OpenAI و Anthropic را نیز مرور کرد.

چشم‌انداز عملیاتی

رقابت در حوزهٔ مدل‌های چندرسانه‌ای ادامه دارد و نسخه‌های تجربی مانند V4-Flash-Vision-Exp نشان‌دهندهٔ تمرکز شرکت‌ها روی ترکیب فهم بصری با تعامل عامل‌محور است. برای انتخاب این مدل در پروژه‌ها، بررسی نتایج بنچ‌مارک‌های مستقل، نحوهٔ ادغام با ابزارها و محدودیت‌های عملیاتی (هزینه، اندازه تصویر و نرخ پردازش) اهمیت دارد. در صورتی که نسخهٔ تجربی در ارزیابی‌های مستقل نیز عملکردی نزدیک به Opus 4.8 نشان دهد، می‌تواند گزینه‌ای جذاب برای توسعهٔ عامل‌های چندرسانه‌ای باشد.