شرکت Inherent می‌گوید عامل هوش مصنوعی آن‌ها، «فارادی»، در بازتولید مستقل نتایج مقالات علمی از مدل‌های مرزی مانند Claude Opus 4.8 و GPT-5.5 جلو زده؛ در حالی که روی مدلی نسبتاً کوچک‌تر با حدود 27 میلیارد پارامتر اجرا می‌شود.

فارادی چه کاری انجام داد؟

فارادی توانست بدون دریافت پاسخ‌های از پیش آماده، یافته‌های منتشرشده در مقالات علمی را بازتولید کند. بازتولید (replication) یکی از روش‌های پایه‌ای برای سنجش اعتبار پژوهش‌هاست و به‌عنوان آزمونی برای تصمیم‌گیری درباره ارزش و صحت نتایج به‌کار می‌رود.

چگونه با مدل کوچک‌تر بهتر عمل شد؟

فارادی روی نسخه‌ای از مدل Qwen 3.6 اجرا می‌شود که حدود 27 میلیارد پارامتر دارد؛ در مقابل، سیستم‌هایی مانند Anthropic و OpenAI معمولاً از مدل‌های بسیار بزرگ‌تر استفاده می‌کنند. تیم Inherent می‌گوید معیار موفقیت صرفاً دقت عددی نبوده؛ آن‌ها خواسته‌اند فارادی همانند یک پژوهشگر انسانی «سلیقه پژوهشی» نشان دهد — یعنی بتواند تشخیص دهد کدام آزمایش ارزش اجرا دارد و چگونه آن را طراحی کند.

رویکرد آموزشی: یادگیری تقویتی و پرورش «سلیقه پژوهشی»

برای آموزش ویژگی‌های نرم و نامحسوسی مثل سلیقه، Inherent از روش‌های مبتنی بر یادگیری تقویتی استفاده کرده است. به‌جای تعریف قواعد صریح، این شیوه رفتارهای منجر به نتایج مطلوب را پاداش می‌دهد؛ رویکردی که می‌تواند به تعمیم بهتر توانایی‌ها در رشته‌های مختلف علمی کمک کند.

چرا از ابزارهای موجود بهره بردند؟

تیم توسعه از ساختن تمام ابزارهای جانبی اجتناب کرده و به فارادی اجازه داده برای کدنویسی از ابزارهای مبتنی بر Codex و GPT-5.5ِ OpenAI استفاده کند؛ همان‌طور که پژوهشگران انسانی اغلب از ابزارهای آماده بهره می‌گیرند. این تصمیم نشان می‌دهد تمرکز شرکت روی طراحی عامل پژوهشی و استراتژی آموزش بوده، نه بازآفرینی مجموعه ابزارها از صفر.

ساختار تیم و برنامه توسعه نیرو

تیم Inherent حدود 12 نفر است و همه به‌صورت حضوری در دفترشان در کینگز کراس لندن کار می‌کنند؛ منطقه‌ای که حضور DeepMind آن را به یکی از هاب‌های هوش مصنوعی تبدیل کرده است. بنیان‌گذاران شامل ادوارد هیوز، لوئیس کیرش، کالویان الکسیف و تنتوم کالینز هستند. شرکت قصد دارد تا پایان سال تعداد کارکنان را به حدود 20 تا 25 نفر افزایش دهد.

جنبه‌های حقوقی و رقابتی: مسئله garden leave

هیوز به تجربه محدودیت «garden leave» اشاره کرده؛ رویه‌ای در بریتانیا که کارکنان جداشده را برای چند ماه از پیوستن به رقیب منع می‌کند. او این محدودیت را به‌عنوان یکی از چالش‌هایی توصیف کرده که می‌تواند به مزیت رقابتی شرکت‌های آمریکایی در جذب استعدادها منجر شود.

نکات کلیدی برای سرمایه‌گذاران و پژوهشگران

  • راندمان نسبت به اندازه: طراحی آموزشی مناسب می‌تواند عملکرد مدل‌های کوچک‌تر را به سطح رقابتی برساند.
  • تمرکز بر «سلیقه پژوهشی»: تعریف معیارهای کیفی برای ارزش‌سنجی آزمایش‌ها می‌تواند عامل‌ها را شبیه همکاران پژوهشی کند.
  • ترکیب ابزارها: بهره‌گیری از ابزارهای قدرتمند موجود به‌جای توسعه کامل از پایه، منابع را برای نوآوری اصلی آزاد می‌کند.

پرسش‌های باقی‌مانده

نتایج اعلام‌شده امیدوارکننده‌اند، اما سوالاتی درباره دامنه تعمیم‌پذیری و شفافیت متدولوژی مطرح است: فارادی روی چه مجموعه‌ای از مقالات آزمایش شده؟ معیارهای «سلیقه پژوهشی» چگونه تعریف و کمی‌سازی شده‌اند؟ چه تضمینی وجود دارد که عامل‌ها در موقعیت‌های واقعی پژوهشی رفتارهای اخلاقی و قابل‌اتکا از خود نشان دهند؟ پاسخ دقیق به این پرسش‌ها نیازمند ارزیابی مستقل و آزمایش‌های گسترده است.

چشم‌انداز

در صورت تایید نتایج در آزمون‌های مستقل و گسترده‌تر، رویکرد Inherent می‌تواند راه را برای توسعه عامل‌های پژوهشی ارزان‌تر و کاربردی‌تر هموار کند؛ عامل‌هایی که علاوه بر تأیید نتایج، در طراحی و تولید علم نقش مشارکتی ایفا کنند.

برای مطالعه بیشتر درباره یادگیری تقویتی و کاربردهای آن در هوش مصنوعی پژوهشی می‌توانید به منابع مرجع و گزارش‌های تحلیلی مانند TechCrunch مراجعه کنید.