شرکت Artificial Analysis پلتفرم جدیدی به نام Optima معرفی کرده که به سازمانها و توسعهدهندگان امکان میدهد بنچمارکهای هوش مصنوعی را دقیقاً بر اساس دادهها و جریان کاری خود بسازند و مدلها را علاوه بر کیفیت، از منظر هزینه و زمان به ازای هر وظیفه نیز مقایسه کنند.
چرا بنچمارکهای عمومی ناکاملاند
بنچمارکهای عمومی معمولاً مجموعهای از وظایف و معیارهای از پیشتعریفشده دارند که لزوماً با نیازهای کسبوکار تطابق ندارند. نتایج چنین بنچمارکهایی میتواند به جزئیات پیادهسازی—مانند نگارش پرامپت یا تنظیمات دما—وابسته باشد و بنابراین برای کاربردهای مشخص قابل اتکا نباشد. برای مروری کوتاه بر مفاهیم پایه میتوانید به صفحه Benchmark (computing) در ویکیپدیا مراجعه کنید.
سه مسیر برای ساخت بنچمارک سفارشی
Optima سه روش اصلی برای تهیه دادههای ارزیابی و ساخت بنچمارک ارائه میدهد:
- بارگذاری مجموعهداده: کاربران میتوانند فایلهای ارزیابی خود یا مجموعههایی از منابعی مانند Hugging Face را آپلود کنند.
- ارسال ردپاهای عامل: پلتفرم از ردپاهای عاملهایی که توسط ابزارهایی مانند Arize، Braintrust یا Langfuse تولید شدهاند پشتیبانی میکند تا رفتار واقعی عاملها بازسازی شود.
- توصیف سناریو و نمونهها: در صورت نداشتن دادهٔ آماده، کافی است مورد استفاده را توصیف و نمونههای ورودی/خروجی ارائه کنید؛ Optima سپس ورودیهای آزمایشی، معیارهای ارزیابی و مثالهای کار را تولید و برای بازبینی پیشنهاد میدهد.
روشهای امتیازدهی
روبریک (Rubric)
در روش روبریک، نتایج بر اساس مجموعهای از معیارهای عینی و قابل سنجش ارزیابی میشوند. این چارچوب برای سنجش جنبههای مشخصی از خروجی مانند دقت، کامل بودن یا رعایت سبک مناسب است.
مقایسه زوجی
در روش مقایسه زوجی، جفت پاسخها به قضاوت انسان سپرده میشوند و با جمعآوری ترجیحات میان جفتها رتبهبندی کلی استخراج میگردد. این روش برای مواردی که معیارهای آشکار سخت تعریف نمیشوند، مناسب است. سازنده اشاره کرده از این دو روش در بنچمارکهایی مانند GDPval-AA و AA-Briefcase نیز استفاده شده است.
هزینه و زمان؛ معیارهای برابر با کیفیت
یکی از ویژگیهای بارز Optima، تبدیل هزینه و زمان به معیارهای اصلی مقایسه است. به جای تمرکز صرف روی قیمت توکن، پلتفرم هزینهٔ واقعی به ازای هر وظیفهٔ تکمیلشده و زمان صرفشده را گزارش میکند تا بتوان بررسی کرد افزایش کیفیت آیا هزینه یا تأخیر بیشتری را توجیه میکند یا خیر. برای نمونه، یک مدل ارزانتر ممکن است نیاز به تلاش یا پردازش بیشتر داشته باشد و در عمل هزینهٔ نهایی را افزایش دهد.
قیمتگذاری Optima به این صورت است: هزینهٔ توکنها بدون حاشیهٔ سود محاسبه میشود؛ ارزیابی مبتنی بر روبریک برای هر معیار در هر مدل 0.125 دلار و ارزیابی زوجی برای هر مقایسه 0.375 دلار هزینه دارد. پلتفرم پیش از اجرای هر بنچمارک یک موجودی برآوردی اعلام میکند و صورتحساب نهایی براساس مصرف واقعی صادر میشود.
نمونههای کاربردی اولیه
تیمهای آزمایشی از Optima برای ساخت بنچمارکهای مربوط به عاملهای مالی و حسابداری استفاده کردند و توانستند مدلهایی بیابند که در برخی موارد هزینهها را تا ده برابر کاهش میدادند بدون افت قابلتوجه در کیفیت. گروههای دیگر نیز بررسی کردند کدام مدلها بهترین تطابق را با سبک نگارش حقوقی دارند یا دقیقترین تشخیص عناصر را در مجموعهتصاویر اختصاصی ارائه میدهند.
ملاحظات روششناختی
Optima ابزارها و امکاناتی برای طراحی بنچمارک فراهم میکند، اما اعتبار نتایج وابسته به کیفیت طراحی آزمون است. بسیاری از بنچمارکها با ضعفهایی مانند نمونهبرداری نامناسب یا فقدان اعتبارسنجی آماری روبهرو هستند؛ بنابراین تیمها باید هنگام تعریف معیارها، انتخاب نمونهها و تدوین پروتکل ارزیابی، دقت علمی لازم را به کار گیرند.
جمعبندی و چشمانداز
Optima گامی رو به جلو در جهت بنچمارکینگ کاربردمحور است: وقتی معیارها، دادهها و سناریوها منطبق بر نیازهای واقعی باشند، انتخاب مدل معنادارتر و قابلاعتمادتر خواهد شد. با این حال، ابزار تنها بخشی از فرایند است و مسئولیت طراحی منصفانه و علمی بنچمارک همچنان بر عهدهٔ تیمهای محصول و پژوهش قرار دارد. برای دنبالکردن گزارشها و تحلیلهای جدید در زمینه ارزیابی مدلها میتوانید منابعی مانند TechCrunch را بررسی کنید.





