شرکت Artificial Analysis پلتفرم جدیدی به نام Optima معرفی کرده که به سازمان‌ها و توسعه‌دهندگان امکان می‌دهد بنچمارک‌های هوش مصنوعی را دقیقاً بر اساس داده‌ها و جریان کاری خود بسازند و مدل‌ها را علاوه بر کیفیت، از منظر هزینه و زمان به ازای هر وظیفه نیز مقایسه کنند.

چرا بنچمارک‌های عمومی ناکامل‌اند

بنچمارک‌های عمومی معمولاً مجموعه‌ای از وظایف و معیارهای از پیش‌تعریف‌شده دارند که لزوماً با نیازهای کسب‌وکار تطابق ندارند. نتایج چنین بنچمارک‌هایی می‌تواند به جزئیات پیاده‌سازی—مانند نگارش پرامپت یا تنظیمات دما—وابسته باشد و بنابراین برای کاربردهای مشخص قابل اتکا نباشد. برای مروری کوتاه بر مفاهیم پایه می‌توانید به صفحه Benchmark (computing) در ویکی‌پدیا مراجعه کنید.

سه مسیر برای ساخت بنچمارک سفارشی

Optima سه روش اصلی برای تهیه داده‌های ارزیابی و ساخت بنچمارک ارائه می‌دهد:

  • بارگذاری مجموعه‌داده: کاربران می‌توانند فایل‌های ارزیابی خود یا مجموعه‌هایی از منابعی مانند Hugging Face را آپلود کنند.
  • ارسال ردپاهای عامل: پلتفرم از ردپاهای عامل‌هایی که توسط ابزارهایی مانند Arize، Braintrust یا Langfuse تولید شده‌اند پشتیبانی می‌کند تا رفتار واقعی عامل‌ها بازسازی شود.
  • توصیف سناریو و نمونه‌ها: در صورت نداشتن دادهٔ آماده، کافی است مورد استفاده را توصیف و نمونه‌های ورودی/خروجی ارائه کنید؛ Optima سپس ورودی‌های آزمایشی، معیارهای ارزیابی و مثال‌های کار را تولید و برای بازبینی پیشنهاد می‌دهد.

روش‌های امتیازدهی

روبریک (Rubric)

در روش روبریک، نتایج بر اساس مجموعه‌ای از معیارهای عینی و قابل سنجش ارزیابی می‌شوند. این چارچوب برای سنجش جنبه‌های مشخصی از خروجی مانند دقت، کامل بودن یا رعایت سبک مناسب است.

مقایسه زوجی

در روش مقایسه زوجی، جفت پاسخ‌ها به قضاوت انسان سپرده می‌شوند و با جمع‌آوری ترجیحات میان جفت‌ها رتبه‌بندی کلی استخراج می‌گردد. این روش برای مواردی که معیارهای آشکار سخت تعریف نمی‌شوند، مناسب است. سازنده اشاره کرده از این دو روش در بنچمارک‌هایی مانند GDPval-AA و AA-Briefcase نیز استفاده شده است.

هزینه و زمان؛ معیارهای برابر با کیفیت

یکی از ویژگی‌های بارز Optima، تبدیل هزینه و زمان به معیارهای اصلی مقایسه است. به جای تمرکز صرف روی قیمت توکن، پلتفرم هزینهٔ واقعی به ازای هر وظیفهٔ تکمیل‌شده و زمان صرف‌شده را گزارش می‌کند تا بتوان بررسی کرد افزایش کیفیت آیا هزینه یا تأخیر بیشتری را توجیه می‌کند یا خیر. برای نمونه، یک مدل ارزان‌تر ممکن است نیاز به تلاش یا پردازش بیشتر داشته باشد و در عمل هزینهٔ نهایی را افزایش دهد.

قیمت‌گذاری Optima به این صورت است: هزینهٔ توکن‌ها بدون حاشیهٔ سود محاسبه می‌شود؛ ارزیابی مبتنی بر روبریک برای هر معیار در هر مدل 0.125 دلار و ارزیابی زوجی برای هر مقایسه 0.375 دلار هزینه دارد. پلتفرم پیش از اجرای هر بنچمارک یک موجودی برآوردی اعلام می‌کند و صورتحساب نهایی براساس مصرف واقعی صادر می‌شود.

نمونه‌های کاربردی اولیه

تیم‌های آزمایشی از Optima برای ساخت بنچمارک‌های مربوط به عامل‌های مالی و حسابداری استفاده کردند و توانستند مدل‌هایی بیابند که در برخی موارد هزینه‌ها را تا ده برابر کاهش می‌دادند بدون افت قابل‌توجه در کیفیت. گروه‌های دیگر نیز بررسی کردند کدام مدل‌ها بهترین تطابق را با سبک نگارش حقوقی دارند یا دقیق‌ترین تشخیص عناصر را در مجموعه‌تصاویر اختصاصی ارائه می‌دهند.

ملاحظات روش‌شناختی

Optima ابزارها و امکاناتی برای طراحی بنچمارک فراهم می‌کند، اما اعتبار نتایج وابسته به کیفیت طراحی آزمون است. بسیاری از بنچمارک‌ها با ضعف‌هایی مانند نمونه‌برداری نامناسب یا فقدان اعتبارسنجی آماری روبه‌رو هستند؛ بنابراین تیم‌ها باید هنگام تعریف معیارها، انتخاب نمونه‌ها و تدوین پروتکل ارزیابی، دقت علمی لازم را به کار گیرند.

جمع‌بندی و چشم‌انداز

Optima گامی رو به جلو در جهت بنچمارکینگ کاربردمحور است: وقتی معیارها، داده‌ها و سناریوها منطبق بر نیازهای واقعی باشند، انتخاب مدل معنادارتر و قابل‌اعتمادتر خواهد شد. با این حال، ابزار تنها بخشی از فرایند است و مسئولیت طراحی منصفانه و علمی بنچمارک همچنان بر عهدهٔ تیم‌های محصول و پژوهش قرار دارد. برای دنبال‌کردن گزارش‌ها و تحلیل‌های جدید در زمینه ارزیابی مدل‌ها می‌توانید منابعی مانند TechCrunch را بررسی کنید.