هر فروشنده نرمافزار سازمانی ادعا میکند که عامل هوش مصنوعی آن برای تولید آماده است، اما سوال اینجاست: این ادعا بر اساس کدام معیار سنجیده میشود؟ پلتفرم هوش مصنوعی سازمانی DevRev به رهبری دیراج پاندی، یکی از بنیانگذاران Nutanix، معتقد است که معیارهای موجود مانند TAU-Bench و Agent's Last Exam هرگز کار واقعی کارمندان را شبیهسازی نمیکنند؛ جایی که توانایی کار با پنجرههای زمینهای (context windows) بزرگ، اغلب از قدرت استدلال محض مهمتر است.
معیار جدید DevRev برای هوش مصنوعی سازمانی
این هفته، DevRev اولین نسخه از معیار عامل هوش مصنوعی سازمانی خود را به صورت متنباز منتشر کرد. این معیار شامل مجموعه داده، مهار ارزیابی، معیارهای داوری، نتایج و ردپاهای خام است تا هر سازمانی بتواند آن را روی سیستمهای خود اجرا کند. این انتشار در حال حاضر فقط دو سطح پایینتر (L1 و L2) از یک چارچوب چهارسطحی را پوشش میدهد و DevRev روی جامعه متخصصان حساب کرده است تا سطوح پیشرفتهتر را تکمیل کنند.

این معیار بر پایه Terminal Bench ساخته شده است؛ مهار ارزیابی از Laude Institute که محققان آن با UC Berkeley و Stanford همکاری دارند. همچنین روششناسی آن توسط الکساندروس دیماکیس، استاد UC Berkeley و بنیانگذار Bespoke Labs، بررسی شده است.
دادهها، بخش سخت ماجرا
تیم DevRev استدلال میکند که معیارهای فعلی عمدتاً به استدلالهای پیچیده و عجیب پاداش میدهند، در حالی که کار سازمانی معمولاً چنین نیست. احمد بشیر، مدیر فناوری DevRev، میگوید:
«ما با ایجاد وظایف پیچیدهتر به معیارهای نیازهای سازمان نزدیکتر نخواهیم شد. کاری که باید انجام میدادیم ترکیب یک سطح متوسط از پیچیدگی وظیفه با مقدار زیادی از پیچیدگی در سازماندهی دادهها بود.»
بیشتر وظایف سازمانی به سختی یک مسئله شیمی نیستند؛ آنها وظایف متوسطی هستند که به دلیل پراکندگی دادهها در سیستمهای مختلف، ناهماهنگی شکلدهی و محدودیتهای دسترسی، زمانبر میشوند. این همان سیلوهای دادهای است که هرگز از بین نرفتند. بشیر میگوید پیچیدگی داده «کاملاً جدید» به عنوان یک معیار است:
«خود داده میتواند به گونهای سازماندهی، شکلدهی و کنترل دسترسی شود که دسترسی به آن را پیچیده میکند.»
رویکرد حقیقت پایهای مستقل از مقیاس
برای تبدیل این چالش به یک معیار، DevRev مفهوم حقیقت پایهای مستقل از مقیاس (scale-invariant ground truth) را معرفی کرده است. مجموعه داده یک شرکت نرمافزاری متوسط را در چهار اندازه (1x، 4x، 16x و 64x) مدلسازی میکند. پاسخ صحیح به هر وظیفه در همه اندازهها یکسان است و دادههای اضافی به عنوان نویز عمل میکنند. در اندازه 1x حدود ۴۰٪ از بلیطها به یک سوال مرتبط هستند، اما در 16x فقط ۲.۵٪. این طراحی میانبری را هدف میگیرد که بسیاری از سیستمها از آن استفاده میکنند: پیدا کردن سوزن در انبار کاه در پنجرههای کوچک خوب کار میکند، اما در حجم تولید شکست میخورد.

سه محور ارزیابی: دقت، کارایی و ایمنی
این معیار عاملها را در سه محور اصلی امتیازدهی میکند:
- دقت: آیا عامل با یک منبع قابل تأیید و یک مسیر قابل حسابرسی به پاسخ درست میرسد؟
- کارایی: آیا هزینه اجرا با سوال یا اندازه داده متناسب است؟
- ایمنی: آیا مرزهای مجوز رعایت میشود و هر عملی قابل ردیابی است؟
یک داور LLM مستقل نتایج را در برابر معیارهای منتشر شده تأیید میکند و هر اجرا باید ردپاهای خود را همراه با امتیاز ارسال کند. چهار سطح این معیار از سطوح خودران خودروها الهام گرفته شده است (L1 تا L4) که نشاندهنده میزان پیچیدگی و خودکارسازی است.
نتیجهگیری: فراخوان برای مشارکت جامعه
DevRev این معیار را به عنوان یک چارچوب باز منتشر کرده است و از محققان و توسعهدهندگان دعوت میکند تا با افزودن سطوح بالاتر (L3 و L4) و بهبود دادهها، به تکامل آن کمک کنند. در دنیایی که صدها معیار برای هوش مصنوعی وجود دارد، اما هیچکدام واقعاً نیازهای سازمانی را پوشش نمیدهند، این تلاش میتواند گامی مهم به سوی شفافیت و قابلیت اطمینان در ارزیابی عوامل هوش مصنوعی سازمانی باشد.





