گوگل قابلیت تحلیل ویدیویی عامل‌محور (agentic) را به خانواده مدل‌های Gemini Flash اضافه کرده است. این رویکرد باعث کاهش تا ۸۸٪ در مصرف توکن، کاهش حدود ۶۶٪ در هزینه‌های پردازش و افزایش دقت در تشخیص صحنه‌ها می‌شود.

نحوه عملکرد فناوری

به‌جای نمونه‌برداری با نرخ ثابت فریم به فریم، مدل‌های Gemini مانند Gemini 3.7 Flash، 3.6 Flash و 3.5 Flash‑Lite به‌صورت پویا تصمیم می‌گیرند کدام بخش‌های ویدیو، با چه نرخ نمونه‌برداری و از چه مدالیته‌ای (فریم، صوت یا رونویس) نیاز به تحلیل دارند. مدل تنها بخش‌های مرتبط با وظیفهٔ مشخص را بارگذاری می‌کند و بازه‌های مشکوک را با نرخ فریم بالاتر پردازش می‌کند تا برش‌های سریع، تغییر وضعیت‌های کوتاه‌تر از یک ثانیه و ناهنجاری‌ها از دست نروند.

مزایا و نتایج عملکردی

  • صرفه‌جویی در توکن: کاهش تا ۸۸٪ در مصرف توکن با تحلیل عامل‌محور.
  • کاهش هزینه: کاهش تا حدود ۶۶٪ در هزینه‌های پردازش ویدیویی.
  • افزایش دقت: بهبود تشخیص لحظات کوتاه‌تر از یک ثانیه و دقت در شمارش حرکات تکراری و اشیاء در طول زمان.
  • مقیاس‌پذیری: امکان پردازش ویدیوهای طولانی از آموزش‌های ۱۰ دقیقه‌ای تا سخنرانی‌های ۹۰ دقیقه‌ای و ضبط‌های چندساعته بدون افزایش نامتناسب مصرف توکن.

پایهٔ فناوری

این تکنیک بر مبنای مفهوم «بینایی عاملی» است که در Gemini 3 Flash معرفی شد؛ قابلیتی که به مدل اجازه می‌داد کد پایتون اجرا کند و تصاویر را برش، بزرگ‌نمایی یا حاشیه‌نویسی کند و نتایج را در چرخهٔ فکر-عمل-مشاهده ارزیابی نماید. اکنون همین رویکرد برای ویدیوها توسعه یافته تا مدل بتواند ابزارهای ویدیویی بومی را فراخوانی کرده و فقط بخش‌های مرتبط را بارگذاری کند.

نمایی از واسط کاربری پردازش ویدیویی Gemini و تحلیل صحنه‌ها

کاربردهای عملی

نمونه‌های کاربردی شامل موارد زیر است:

  • جستجوی دقیق صحنه‌ها در ویدیوهای طولانی و بازیابی سریع محتوا.
  • ویرایش خودکار ویدیو با دقت بالاتر و کاهش نیاز به پردازش کل فایل.
  • شمارش اشیاء یا حرکات در بازه‌های زمانی طولانی با دقت بیشتر.
  • شناسایی ناهنجاری‌ها و رویدادهای کم‌فرکانس در ضبط‌های طولانی.

در معیارهای آزمایشی مانند LongVideoBench، Gemini 3.7 Flash با تحلیل عامل‌محور ترکیبی از دقت بالا و کارایی هزینه را نشان داد که نسبت به روش‌های ایستا بهبود دارد.

نمونه‌برداری هوشمند از بازه‌های زمانی ویدیو توسط مدل

نحوه دسترسی و هزینه‌ها

قابلیت عامل‌محور از طریق Google AI و Gemini API در Google AI Studio و پلتفرم Gemini Enterprise Agent در دسترس توسعه‌دهندگان قرار گرفته است. توسعه‌دهندگان با تنظیم حالت پردازش به «agentic» در پیکربندی API می‌توانند از این ویژگی بهره‌مند شوند. هزینه‌ها براساس نرخ استاندارد توکن‌های Gemini API محاسبه می‌شود و گوگل اعلام کرده برای فعال‌سازی این حالت هزینهٔ اضافی دریافت نمی‌کند.

پلن‌های عرضه به کاربران نهایی

گوگل برنامه دارد در ماه‌های آتی قابلیت عامل‌محور را به اپلیکیشن Gemini برای کاربران Flash و Flash Lite اضافه کند و آن را در ویژگی «Ask YouTube» روی صفحهٔ پخش YouTube نیز به‌کار گیرد تا پاسخ‌ها بهتر با محتوای قابل مشاهده مطابقت یابند.

یک فریم ویدیویی که مدل آن را برای تحلیل انتخاب کرده

ملاحظات و چشم‌انداز

کاهش محسوس مصرف توکن و افزایش دقت می‌تواند تغییرات قابل‌توجهی در سرویس‌های تحلیل محتوای ویدیویی، ابزارهای ویرایش و محصولات آموزشی ایجاد کند. هم‌زمان باید به حریم خصوصی، کنترل دسترسی به ویدیوها و شفافیت در فرایند تصمیم‌گیری مدل توجه شود. سازمان‌ها و توسعه‌دهندگان هنگام پیاده‌سازی این سیستم‌ها باید سیاست‌های محافظت از داده و مدیریت دسترسی را تعریف کنند و جزئیات فنی را از منابع رسمی گوگل دنبال نمایند.

عمومی شدن تحلیل ویدیویی عامل‌محور احتمالاً روند تولید محتوای هوشمند و واکنش‌محور را تسریع خواهد کرد و در ماه‌های پیش‌رو ابزارهای جدیدی برای ویرایش، جستجو و پاسخ‌دهی مبتنی بر محتوای ویدیو ظهور خواهند کرد.