گوگل دیپمایند مجموعهٔ جِمینی رباتیکس ۲ را معرفی کرد؛ سه مدل که هدفشان فراهمکردن کنترل تمامبدنی و مهارتهای ظریفتر برای اجرای وظایف چندمرحلهای در محیط واقعی است.
معرفی مدلها
این مجموعه شامل سه بخش اصلی است که هر کدام نقش مشخصی در زنجیرهٔ ادراک تا اقدام ایفا میکنند:
مدل بینایی-زبان-کنش (VLA)
ورودیهای بینایی و زبان را به فرمانهای حرکتی تبدیل میکند تا رباتها بتوانند از پا تا نوک انگشتان عمل کنند و وظایف پیچیدهٔ چندمرحلهای را دنبال نمایند.
جِمینی رباتیکس آن-دیوایس ۲ (نسخهٔ سبک)
نسخهٔ سبک VLA که روی دستگاه اجرا میشود و اجازه میدهد عملکردهای حیاتی ربات بدون اتصال به اینترنت ادامه یابند؛ برای تصمیمهای فوری و واکنشهای لحظهای مناسب است.
جِمینی رباتیکس ER 2 — استدلال متجسد
نقشی مشابه «مغز سطحبالا» دارد: پردازش دستورها، برنامهریزی بلندمدت، تقسیم وظایف به اهداف میانی و هماهنگی با VLA برای اجرای زنجیرههای تصمیم و حرکت.
کنترل تمامبدن و مهارتهای ظریف
نسخههای پیشین بیشتر روی کنترل بالاتنه و کارهای روی میز متمرکز بودند؛ جِمینی رباتیکس ۲ گسترهٔ حرکتی را به کل بدن انساننما گسترش میدهد: راهرفتن، نشستن، خمشدن، کشش و دستکاری اشیاء در ارتفاعات مختلف. ترکیب VLA و ER امکان اجرای فرمانهایی مانند «کتاب را از طبقهٔ بالا بیاور» را با زنجیرهٔ تصمیمگیری و حرکتی واقعی فراهم میکند.
گوگل به کاربرد روی دستهای پیچیده اشاره کرده است؛ برای نمونه، دست پنجانگشتی SharpaWave با 22 درجهٔ آزادی روی ربات آپولو 2 از Apptronik نمونهای از سختافزار است که میتواند مهارتهای ظریف مثل گرهزدن را با دقت نزدیک به عملکرد انسانی اجرا کند.
استدلال متجسد: برنامهریزی بلندمدت و خوداصلاحی
محیطهای واقعی پیوسته تغییر میکنند و نیاز به بازبرنامهریزی دارند. ER وظیفهٔ تبدیل دستورها به اهداف میانی، هماهنگی بلندمدت و مدیریت خطا را برعهده دارد. توانایی تشخیص خطا و اصلاح مسیر عملکرد در حین اجرا، گامی مهم برای خودگردانی بلندمدت است.
تطبیق سریع و همکاری میان رباتها
جِمینی رباتیکس ۲ قابلیت انتقال مهارتها بین بدنههای سختافزاری متفاوت را بهبود بخشیده است: گوگل گزارش میدهد تطبیق یک مهارت با یک ربات دو-دستی جدید ممکن است تنها به حدود 200 نمونه و چند ساعت زمان نیاز داشته باشد. بدین ترتیب توسعهدهندگان میتوانند مهارتها را بین پیکربندیهای مختلف با اشکال و درجات آزادی متفاوت منتقل کنند.
علاوه بر این، معماری مجموعه برای همکاری میان چند ربات طراحی شده تا تقسیم کار، هماهنگی فیزیکی و اجرای جریانهای کاری پیچیده در فضای مشترک ممکن شود.
عملگر محلی، حریم خصوصی و ایمنی
اجرای نسخهٔ سبک VLA روی دستگاه مزیتهای مهمی در زمینهٔ حریم خصوصی و پایداری عملکرد فراهم میآورد: واکنشهای فوری مانند توقف یا کنار رفتن از مسیر انسان نباید به پاسخ سرور وابسته باشند. رویکردهای ترکیبی که پردازش ادراک و تصمیمات ایمنی را در لبه (edge) نگه میدارند و از مدلهای ابری برای استدلال عمیقتر و یادگیری بلندمدت استفاده میکنند، محتملتر بهنظر میرسند.
برای مدیریت ناوگان انساننماها، گوگل ابزارها و معیارهایی معرفی کرده که اهداف ایمنی عاملمحور را دنبال میکنند تا هماهنگی میان رباتها قابلنظارت و قابلقضاوت بماند.
چالشها و چشمانداز
- تعامل با انسانها و محیطهای غیرقابلپیشبینی هنوز بزرگترین مانع است و نیازمند سنسورها و بازخورد پیوستهٔ بیشتر است. (منابع مرجع دربارهٔ رباتها).
- انتقال مهارت میان پلتفرمهای سختافزاری پیشرفت کرده، اما نیاز به استانداردها، مجموعههای آموزشی دقیق و آزمایشهای میدانی بیشتر دارد.
- قوانین و مقررات ایمنی و آزمایش میدانی نقش تعیینکننده در مسیر تجاریسازی انساننماهای مجهز به این مدلها خواهند داشت.
جِمینی رباتیکس ۲ پیشرفتهای فنی قابلتوجهی را در ترکیب استدلال بلندمدت و ادراک پیوسته نشان میدهد، اما رسیدن به بلوغ کامل مستلزم پیشرفت در سختافزار، استانداردهای ایمنی و چارچوبهای نظارتی است. توسعهدهندگان و تیمهای رباتیک اکنون فرصت دارند ترکیب این قابلیتها را در میدان آزمایش کنند و ارزیابی نمایند که چگونه این سیستمها در مقیاس عملیاتی کارآمد و ایمن عمل میکنند.
برای جزئیات فنی و اخبار بیشتر میتوانید به وبسایتهای رسمی و منابع تحلیلی مراجعه کنید: DeepMind و TechCrunch.





