محققان گوگل دیپ‌مایند (Google DeepMind) با معرفی مدل جدیدی به نام GenCeption، نظریه‌ای جسورانه را به اثبات رسانده‌اند: مولدهای ویدئو می‌توانند به عنوان پایه‌ای برای "مدل‌های جهانی" (World Models) در بینایی کامپیوتر عمل کنند، چیزی که سال‌ها این حوزه فاقد آن بوده است. این مدل با استفاده از یک مولد ویدئوی از پیش‌آموزش‌دیده، قادر به انجام وظایف کلاسیکی مانند تخمین عمق، بخش‌بندی اشیاء و تخمین ژست سه‌بعدی با دقتی بی‌سابقه و با حداقل داده‌های آموزشی است.

چالش گمشده: چرا بینایی کامپیوتر به "مدل جهانی" نیاز دارد؟

مدل‌های زبانی بزرگ (LLMs) مانند GPT، توانایی‌های همه‌کاره خود را به‌عنوان محصول جانبی یادگیری پیش‌بینی کلمه بعدی به دست آوردند. این فرآیند ساده آن‌ها را مجبور به درک دستور زبان، دانش عمومی و روابط متنی کرد. اما در بینایی کامپیوتر، این روش آموزشی مشابه وجود نداشت. تاکنون، برای هر وظیفه خاص مانند بخش‌بندی تصویر یا تخمین عمق، مجبور به طراحی مدل‌های تخصصی با معماری‌های جداگانه بودیم. این رویکرد نه تنها زمان‌بر است، بلکه مقیاس‌پذیری را نیز دشوار می‌کند.

گوگل دیپ‌مایند استدلال می‌کند که مدل‌های بزرگ متن به ویدئو (Text-to-Video) می‌توانند این شکاف را پر کنند. تولید یک ویدئوی واقع‌گرایانه نیاز به درک عمیق از هندسه فضایی یک صحنه، قوانین فیزیک و نحوه حرکت اشیاء دارد. این مدل‌ها همچنین با استفاده از توضیحات متنی آموزش می‌بینند، که زبان را به محتوای بصری پیوند می‌دهد و آن‌ها را به یک "مدل جهانی" بالقوه تبدیل می‌کند.

معماری مدل GenCeption گوگل دیپ‌مایند

GenCeption: چگونه یک مولد ویدئو به یک ابزار بینایی همه‌کاره تبدیل می‌شود؟

مدل GenCeption بر روی مدل متن‌باز Wan2.1 شرکت علی‌بابا ساخته شده است. اما تفاوت کلیدی در معماری آن است. مدل‌های پخش (Diffusion Models) معمولاً برای تولید ویدئو به صدها مرحله نیاز دارند، اما GenCeption خروجی نهایی را در یک گذر مستقیم (Single Forward Pass) تولید می‌کند. این سرعت بالا، آن را برای وظایف عملی بینایی کامپیوتر مناسب می‌سازد.

نکته جالب دیگر، نمایش خروجی‌ها است. GenCeption تمام نتایج خود، از جمله نقشه عمق، نقشه نرمال سطح و ماسک‌های بخش‌بندی را به‌صورت تصاویر استاندارد RGB سه‌کاناله تولید می‌کند. حتی حرکت دوربین نیز به یک نمایش تصویری تبدیل می‌شود. یک اعلان متنی ساده (Text Prompt) به مدل می‌گوید که کدام وظیفه را انجام دهد، درست مانند دستور دادن به یک چت‌بات.

مقایسه خروجی GenCeption با مدل‌های تخصصی

عملکرد شگفت‌انگیز با داده‌های اندک

شاید چشمگیرترین جنبه این مدل، نیاز حداقلی آن به داده باشد. بیشتر داده‌های آموزشی از یک مجموعه داده مصنوعی (Synthetic Dataset) شامل تنها 7,500 ویدئو به دست آمده است. محققان با ترکیب 800 مدل دیجیتال انسان و 200 توالی حرکتی از یک پایگاه داده ضبط حرکت (MoCap)، صحنه‌های متنوعی را در نرم‌افزار Blender رندر کردند. این یعنی GenCeption با کسری از داده‌های مورد نیاز رقبا به نتایجی در سطح مدل‌های تخصصی دست یافته است.

نتایج مقایسه‌ای

  • تخمین عمق: عملکرد GenCeption با مدل DepthAnything 3 برابری می‌کند.
  • تخمین نرمال سطح: از مدل‌های NormalCrafter و Lotus-2 بهتر عمل می‌کند.
  • تشخیص ژست سه‌بعدی: از مدل‌های Genmo و TRAM پیشی می‌گیرد.
  • بخش‌بندی پیچیده: با مدل قدرتمند SAM 3 متا در ترکیب با Gemini 3.5 Flash رقابت می‌کند.
جدول مقایسه عملکرد GenCeption با سایر مدل‌ها

جالب‌تر اینکه، GenCeption توانایی‌های خود را به فیلم‌های واقعی و حتی دسته‌بندی‌های آموزشی‌ندیده مانند حیوانات نیز تعمیم می‌دهد. این نشان‌دهنده قدرت تعمیم‌پذیری بالای "مدل‌های جهانی" است.

نتیجه‌گیری: آیا این پایان دوران مدل‌های تخصصی است؟

نتایج پژوهش گوگل دیپ‌مایند نشان می‌دهد که سرمایه‌گذاری عظیم روی مدل‌های تولید ویدئو، مزایای جانبی غیرمنتظره‌ای برای کل حوزه بینایی کامپیوتر دارد. اگرچه مدل GenCeption در برخی وظایف هنوز با مدل‌های اختصاصی برابری می‌کند و نه لزوماً از آن‌ها بهتر است، اما رویکرد آن می‌تواند مسیر تحقیقات را برای سال‌های آینده تغییر دهد. به نظر می‌رسد که آینده بینایی کامپیوتر، به جای مدل‌های تخصصی متعدد، به سمت مدل‌های بنیادین (Foundation Models) و همه‌کاره‌ای حرکت می‌کند که از قدرت "مدل‌های جهانی" بهره می‌برند.

تصویری از مدل‌های سه‌بعدی و جغرافیای دیجیتال