هر فروشنده نرم‌افزار سازمانی ادعا می‌کند که عامل هوش مصنوعی آن برای تولید آماده است، اما سوال اینجاست: این ادعا بر اساس کدام معیار سنجیده می‌شود؟ پلتفرم هوش مصنوعی سازمانی DevRev به رهبری دیراج پاندی، یکی از بنیان‌گذاران Nutanix، معتقد است که معیارهای موجود مانند TAU-Bench و Agent's Last Exam هرگز کار واقعی کارمندان را شبیه‌سازی نمی‌کنند؛ جایی که توانایی کار با پنجره‌های زمینه‌ای (context windows) بزرگ، اغلب از قدرت استدلال محض مهم‌تر است.

معیار جدید DevRev برای هوش مصنوعی سازمانی

این هفته، DevRev اولین نسخه از معیار عامل هوش مصنوعی سازمانی خود را به صورت متن‌باز منتشر کرد. این معیار شامل مجموعه داده، مهار ارزیابی، معیارهای داوری، نتایج و ردپاهای خام است تا هر سازمانی بتواند آن را روی سیستم‌های خود اجرا کند. این انتشار در حال حاضر فقط دو سطح پایین‌تر (L1 و L2) از یک چارچوب چهارسطحی را پوشش می‌دهد و DevRev روی جامعه متخصصان حساب کرده است تا سطوح پیشرفته‌تر را تکمیل کنند.

نمودار سطوح معیار هوش مصنوعی سازمانی DevRev

این معیار بر پایه Terminal Bench ساخته شده است؛ مهار ارزیابی از Laude Institute که محققان آن با UC Berkeley و Stanford همکاری دارند. همچنین روش‌شناسی آن توسط الکساندروس دیماکیس، استاد UC Berkeley و بنیان‌گذار Bespoke Labs، بررسی شده است.

داده‌ها، بخش سخت ماجرا

تیم DevRev استدلال می‌کند که معیارهای فعلی عمدتاً به استدلال‌های پیچیده و عجیب پاداش می‌دهند، در حالی که کار سازمانی معمولاً چنین نیست. احمد بشیر، مدیر فناوری DevRev، می‌گوید:

«ما با ایجاد وظایف پیچیده‌تر به معیارهای نیازهای سازمان نزدیک‌تر نخواهیم شد. کاری که باید انجام می‌دادیم ترکیب یک سطح متوسط از پیچیدگی وظیفه با مقدار زیادی از پیچیدگی در سازماندهی داده‌ها بود.»

بیشتر وظایف سازمانی به سختی یک مسئله شیمی نیستند؛ آنها وظایف متوسطی هستند که به دلیل پراکندگی داده‌ها در سیستم‌های مختلف، ناهماهنگی شکل‌دهی و محدودیت‌های دسترسی، زمان‌بر می‌شوند. این همان سیلوهای داده‌ای است که هرگز از بین نرفتند. بشیر می‌گوید پیچیدگی داده «کاملاً جدید» به عنوان یک معیار است:

«خود داده می‌تواند به گونه‌ای سازماندهی، شکل‌دهی و کنترل دسترسی شود که دسترسی به آن را پیچیده می‌کند.»

رویکرد حقیقت پایه‌ای مستقل از مقیاس

برای تبدیل این چالش به یک معیار، DevRev مفهوم حقیقت پایه‌ای مستقل از مقیاس (scale-invariant ground truth) را معرفی کرده است. مجموعه داده یک شرکت نرم‌افزاری متوسط را در چهار اندازه (1x، 4x، 16x و 64x) مدل‌سازی می‌کند. پاسخ صحیح به هر وظیفه در همه اندازه‌ها یکسان است و داده‌های اضافی به عنوان نویز عمل می‌کنند. در اندازه 1x حدود ۴۰٪ از بلیط‌ها به یک سوال مرتبط هستند، اما در 16x فقط ۲.۵٪. این طراحی میانبری را هدف می‌گیرد که بسیاری از سیستم‌ها از آن استفاده می‌کنند: پیدا کردن سوزن در انبار کاه در پنجره‌های کوچک خوب کار می‌کند، اما در حجم تولید شکست می‌خورد.

مقایسه عملکرد عامل‌های هوش مصنوعی در معیار جدید

سه محور ارزیابی: دقت، کارایی و ایمنی

این معیار عامل‌ها را در سه محور اصلی امتیازدهی می‌کند:

  • دقت: آیا عامل با یک منبع قابل تأیید و یک مسیر قابل حسابرسی به پاسخ درست می‌رسد؟
  • کارایی: آیا هزینه اجرا با سوال یا اندازه داده متناسب است؟
  • ایمنی: آیا مرزهای مجوز رعایت می‌شود و هر عملی قابل ردیابی است؟

یک داور LLM مستقل نتایج را در برابر معیارهای منتشر شده تأیید می‌کند و هر اجرا باید ردپاهای خود را همراه با امتیاز ارسال کند. چهار سطح این معیار از سطوح خودران خودروها الهام گرفته شده است (L1 تا L4) که نشان‌دهنده میزان پیچیدگی و خودکارسازی است.

نتیجه‌گیری: فراخوان برای مشارکت جامعه

DevRev این معیار را به عنوان یک چارچوب باز منتشر کرده است و از محققان و توسعه‌دهندگان دعوت می‌کند تا با افزودن سطوح بالاتر (L3 و L4) و بهبود داده‌ها، به تکامل آن کمک کنند. در دنیایی که صدها معیار برای هوش مصنوعی وجود دارد، اما هیچ‌کدام واقعاً نیازهای سازمانی را پوشش نمی‌دهند، این تلاش می‌تواند گامی مهم به سوی شفافیت و قابلیت اطمینان در ارزیابی عوامل هوش مصنوعی سازمانی باشد.