گوگل دیپ‌مایند مجموعهٔ جِمینی رباتیکس ۲ را معرفی کرد؛ سه مدل که هدفشان فراهم‌کردن کنترل تمام‌بدنی و مهارت‌های ظریف‌تر برای اجرای وظایف چندمرحله‌ای در محیط واقعی است.

معرفی مدل‌ها

این مجموعه شامل سه بخش اصلی است که هر کدام نقش مشخصی در زنجیرهٔ ادراک تا اقدام ایفا می‌کنند:

  • مدل بینایی-زبان-کنش (VLA)

    ورودی‌های بینایی و زبان را به فرمان‌های حرکتی تبدیل می‌کند تا ربات‌ها بتوانند از پا تا نوک انگشتان عمل کنند و وظایف پیچیدهٔ چندمرحله‌ای را دنبال نمایند.

  • جِمینی رباتیکس آن-دیوایس ۲ (نسخهٔ سبک)

    نسخهٔ سبک VLA که روی دستگاه اجرا می‌شود و اجازه می‌دهد عملکردهای حیاتی ربات بدون اتصال به اینترنت ادامه یابند؛ برای تصمیم‌های فوری و واکنش‌های لحظه‌ای مناسب است.

  • جِمینی رباتیکس ER 2 — استدلال متجسد

    نقشی مشابه «مغز سطح‌بالا» دارد: پردازش دستورها، برنامه‌ریزی بلندمدت، تقسیم وظایف به اهداف میانی و هماهنگی با VLA برای اجرای زنجیره‌های تصمیم و حرکت.

کنترل تمام‌بدن و مهارت‌های ظریف

نسخه‌های پیشین بیشتر روی کنترل بالاتنه و کارهای روی میز متمرکز بودند؛ جِمینی رباتیکس ۲ گسترهٔ حرکتی را به کل بدن انسان‌نما گسترش می‌دهد: راه‌رفتن، نشستن، خم‌شدن، کشش و دست‌کاری اشیاء در ارتفاعات مختلف. ترکیب VLA و ER امکان اجرای فرمان‌هایی مانند «کتاب را از طبقهٔ بالا بیاور» را با زنجیرهٔ تصمیم‌گیری و حرکتی واقعی فراهم می‌کند.

گوگل به کاربرد روی دست‌های پیچیده اشاره کرده است؛ برای نمونه، دست پنج‌انگشتی SharpaWave با 22 درجهٔ آزادی روی ربات آپولو 2 از Apptronik نمونه‌ای از سخت‌افزار است که می‌تواند مهارت‌های ظریف مثل گره‌زدن را با دقت نزدیک به عملکرد انسانی اجرا کند.

استدلال متجسد: برنامه‌ریزی بلندمدت و خوداصلاحی

محیط‌های واقعی پیوسته تغییر می‌کنند و نیاز به بازبرنامه‌ریزی دارند. ER وظیفهٔ تبدیل دستورها به اهداف میانی، هماهنگی بلندمدت و مدیریت خطا را برعهده دارد. توانایی تشخیص خطا و اصلاح مسیر عملکرد در حین اجرا، گامی مهم برای خودگردانی بلندمدت است.

تطبیق سریع و همکاری میان ربات‌ها

جِمینی رباتیکس ۲ قابلیت انتقال مهارت‌ها بین بدنه‌های سخت‌افزاری متفاوت را بهبود بخشیده است: گوگل گزارش می‌دهد تطبیق یک مهارت با یک ربات دو-دستی جدید ممکن است تنها به حدود 200 نمونه و چند ساعت زمان نیاز داشته باشد. بدین ترتیب توسعه‌دهندگان می‌توانند مهارت‌ها را بین پیکربندی‌های مختلف با اشکال و درجات آزادی متفاوت منتقل کنند.

علاوه بر این، معماری مجموعه برای همکاری میان چند ربات طراحی شده تا تقسیم کار، هماهنگی فیزیکی و اجرای جریان‌های کاری پیچیده در فضای مشترک ممکن شود.

نمایشی از معماری جِمینی رباتیکس ۲؛ ترکیب مدل بینایی-زبان-کنش و استدلال متجسد

عملگر محلی، حریم خصوصی و ایمنی

اجرای نسخهٔ سبک VLA روی دستگاه مزیت‌های مهمی در زمینهٔ حریم خصوصی و پایداری عملکرد فراهم می‌آورد: واکنش‌های فوری مانند توقف یا کنار رفتن از مسیر انسان نباید به پاسخ سرور وابسته باشند. رویکردهای ترکیبی که پردازش ادراک و تصمیمات ایمنی را در لبه (edge) نگه می‌دارند و از مدل‌های ابری برای استدلال عمیق‌تر و یادگیری بلندمدت استفاده می‌کنند، محتمل‌تر به‌نظر می‌رسند.

برای مدیریت ناوگان انسان‌نماها، گوگل ابزارها و معیارهایی معرفی کرده که اهداف ایمنی عامل‌محور را دنبال می‌کنند تا هماهنگی میان ربات‌ها قابل‌نظارت و قابل‌قضاوت بماند.

چالش‌ها و چشم‌انداز

  • تعامل با انسان‌ها و محیط‌های غیرقابل‌پیش‌بینی هنوز بزرگ‌ترین مانع است و نیازمند سنسورها و بازخورد پیوستهٔ بیشتر است. (منابع مرجع دربارهٔ ربات‌ها).
  • انتقال مهارت میان پلتفرم‌های سخت‌افزاری پیشرفت کرده، اما نیاز به استانداردها، مجموعه‌های آموزشی دقیق و آزمایش‌های میدانی بیشتر دارد.
  • قوانین و مقررات ایمنی و آزمایش میدانی نقش تعیین‌کننده در مسیر تجاری‌سازی انسان‌نماهای مجهز به این مدل‌ها خواهند داشت.

جِمینی رباتیکس ۲ پیشرفت‌های فنی قابل‌توجهی را در ترکیب استدلال بلندمدت و ادراک پیوسته نشان می‌دهد، اما رسیدن به بلوغ کامل مستلزم پیشرفت در سخت‌افزار، استانداردهای ایمنی و چارچوب‌های نظارتی است. توسعه‌دهندگان و تیم‌های رباتیک اکنون فرصت دارند ترکیب این قابلیت‌ها را در میدان آزمایش کنند و ارزیابی نمایند که چگونه این سیستم‌ها در مقیاس عملیاتی کارآمد و ایمن عمل می‌کنند.

برای جزئیات فنی و اخبار بیشتر می‌توانید به وب‌سایت‌های رسمی و منابع تحلیلی مراجعه کنید: DeepMind و TechCrunch.