محققان گوگل دیپمایند (Google DeepMind) با معرفی مدل جدیدی به نام GenCeption، نظریهای جسورانه را به اثبات رساندهاند: مولدهای ویدئو میتوانند به عنوان پایهای برای "مدلهای جهانی" (World Models) در بینایی کامپیوتر عمل کنند، چیزی که سالها این حوزه فاقد آن بوده است. این مدل با استفاده از یک مولد ویدئوی از پیشآموزشدیده، قادر به انجام وظایف کلاسیکی مانند تخمین عمق، بخشبندی اشیاء و تخمین ژست سهبعدی با دقتی بیسابقه و با حداقل دادههای آموزشی است.
چالش گمشده: چرا بینایی کامپیوتر به "مدل جهانی" نیاز دارد؟
مدلهای زبانی بزرگ (LLMs) مانند GPT، تواناییهای همهکاره خود را بهعنوان محصول جانبی یادگیری پیشبینی کلمه بعدی به دست آوردند. این فرآیند ساده آنها را مجبور به درک دستور زبان، دانش عمومی و روابط متنی کرد. اما در بینایی کامپیوتر، این روش آموزشی مشابه وجود نداشت. تاکنون، برای هر وظیفه خاص مانند بخشبندی تصویر یا تخمین عمق، مجبور به طراحی مدلهای تخصصی با معماریهای جداگانه بودیم. این رویکرد نه تنها زمانبر است، بلکه مقیاسپذیری را نیز دشوار میکند.
گوگل دیپمایند استدلال میکند که مدلهای بزرگ متن به ویدئو (Text-to-Video) میتوانند این شکاف را پر کنند. تولید یک ویدئوی واقعگرایانه نیاز به درک عمیق از هندسه فضایی یک صحنه، قوانین فیزیک و نحوه حرکت اشیاء دارد. این مدلها همچنین با استفاده از توضیحات متنی آموزش میبینند، که زبان را به محتوای بصری پیوند میدهد و آنها را به یک "مدل جهانی" بالقوه تبدیل میکند.
GenCeption: چگونه یک مولد ویدئو به یک ابزار بینایی همهکاره تبدیل میشود؟
مدل GenCeption بر روی مدل متنباز Wan2.1 شرکت علیبابا ساخته شده است. اما تفاوت کلیدی در معماری آن است. مدلهای پخش (Diffusion Models) معمولاً برای تولید ویدئو به صدها مرحله نیاز دارند، اما GenCeption خروجی نهایی را در یک گذر مستقیم (Single Forward Pass) تولید میکند. این سرعت بالا، آن را برای وظایف عملی بینایی کامپیوتر مناسب میسازد.
نکته جالب دیگر، نمایش خروجیها است. GenCeption تمام نتایج خود، از جمله نقشه عمق، نقشه نرمال سطح و ماسکهای بخشبندی را بهصورت تصاویر استاندارد RGB سهکاناله تولید میکند. حتی حرکت دوربین نیز به یک نمایش تصویری تبدیل میشود. یک اعلان متنی ساده (Text Prompt) به مدل میگوید که کدام وظیفه را انجام دهد، درست مانند دستور دادن به یک چتبات.
عملکرد شگفتانگیز با دادههای اندک
شاید چشمگیرترین جنبه این مدل، نیاز حداقلی آن به داده باشد. بیشتر دادههای آموزشی از یک مجموعه داده مصنوعی (Synthetic Dataset) شامل تنها 7,500 ویدئو به دست آمده است. محققان با ترکیب 800 مدل دیجیتال انسان و 200 توالی حرکتی از یک پایگاه داده ضبط حرکت (MoCap)، صحنههای متنوعی را در نرمافزار Blender رندر کردند. این یعنی GenCeption با کسری از دادههای مورد نیاز رقبا به نتایجی در سطح مدلهای تخصصی دست یافته است.
نتایج مقایسهای
- تخمین عمق: عملکرد GenCeption با مدل DepthAnything 3 برابری میکند.
- تخمین نرمال سطح: از مدلهای NormalCrafter و Lotus-2 بهتر عمل میکند.
- تشخیص ژست سهبعدی: از مدلهای Genmo و TRAM پیشی میگیرد.
- بخشبندی پیچیده: با مدل قدرتمند SAM 3 متا در ترکیب با Gemini 3.5 Flash رقابت میکند.
جالبتر اینکه، GenCeption تواناییهای خود را به فیلمهای واقعی و حتی دستهبندیهای آموزشیندیده مانند حیوانات نیز تعمیم میدهد. این نشاندهنده قدرت تعمیمپذیری بالای "مدلهای جهانی" است.
نتیجهگیری: آیا این پایان دوران مدلهای تخصصی است؟
نتایج پژوهش گوگل دیپمایند نشان میدهد که سرمایهگذاری عظیم روی مدلهای تولید ویدئو، مزایای جانبی غیرمنتظرهای برای کل حوزه بینایی کامپیوتر دارد. اگرچه مدل GenCeption در برخی وظایف هنوز با مدلهای اختصاصی برابری میکند و نه لزوماً از آنها بهتر است، اما رویکرد آن میتواند مسیر تحقیقات را برای سالهای آینده تغییر دهد. به نظر میرسد که آینده بینایی کامپیوتر، به جای مدلهای تخصصی متعدد، به سمت مدلهای بنیادین (Foundation Models) و همهکارهای حرکت میکند که از قدرت "مدلهای جهانی" بهره میبرند.






