آمازون وب‌سرویس (AWS) بنچمارک متن‌باز aws-bench را منتشر کرده است. این ابزار عملکرد عامل‌های هوش مصنوعی را در انجام وظایف واقعی ابری می‌سنجد؛ از تشخیص پیکربندی‌های نادرست تا فراهم‌سازی زیرساخت و مدیریت محیط‌های زنده.

نکات کلیدی درباره aws-bench

  • اجرای سناریوها در حساب‌های واقعی AWS به‌جای سازه‌های ایستا برای نزدیک‌تر شدن به شرایط عملی
  • استفاده از استک‌های CDK برای تعریف منابع و اجرای عامل‌ها در کانتینرهای ایزوله با اعتبارنامه‌های محدود
  • امتیازدهی با تأییدکنندهٔ خودکار؛ شامل قاضی مبتنی بر مدل زبان بزرگ یا بررسی وضعیت زندهٔ AWS

رویکرد و نحوهٔ عملکرد

برخلاف بنچمارک‌های سنتی که در محیط‌های شبیه‌سازی اجرا می‌شوند، aws-bench سناریوها را مستقیماً در حساب‌های AWS مستقر و پس از اجرا حذف یا مدیریت می‌کند. هر سناریو به‌صورت مجموعه‌ای از منابع تعریف‌شده در استک‌های CDK پیاده‌سازی می‌شود و عامل تحت ارزیابی با دسترسی محدود در یک کانتینر ایزوله وظایف را انجام می‌دهد. نتیجه‌ها توسط یک تأییدکنندهٔ خودکار ارزیابی می‌شوند؛ این تأییدکننده ممکن است یک قاضی مبتنی بر مدل زبان بزرگ (LLM judge) یا یک مکانیزم برنامه‌محور برای بازبینی وضعیت زنده AWS باشد.

مجموعه‌داده‌ها و حوزه‌های پوشش

پکیج aws-bench شامل مجموعه‌داده‌هایی از پیش تعریف‌شده است که وظایف پایه و پیشرفته را در بر می‌گیرد. حوزه‌های تحت پوشش شامل موارد زیر است:

  • رصدپذیری (observability)
  • محاسبه و پردازش داده
  • پایگاه‌داده و ذخیره‌سازی
  • استقرار EC2 در چند منطقه
  • محیط‌های بدون‌سرور (serverless)
  • استریمینگ و اینترنت اشیاء
  • معماری‌های مرجع و اشکال‌زدایی چندخدمتی
نمونه استقرار سناریو aws-bench در حساب AWS

بنیان فنی و سازگاری

پروژه بر پایه فریم‌ورک متن‌باز Harbor توسعه یافته و قابلیت‌هایی برای فراهم‌سازی منابع AWS، مدیریت سناریوها و اجرای تأییدکننده‌ها اضافه شده‌اند. آداپتورهای داخلی از مجموعه‌ای از عامل‌ها و مدل‌های عمومی پشتیبانی می‌کنند، از جمله Claude Code، Codex، Kiro CLI و Mini-SWE-Agent، و سایر عامل‌هایی که Harbor پشتیبانی می‌کند.

پیش‌نیازها، محدودیت‌ها و هزینه‌ها

اجرای کامل این بنچمارک فراتر از نصب محلی است و نیاز به اعتبارنامه‌هایی با دسترسی مدیریت سازمان دارد؛ از جمله مجوز مدیریت حساب‌های عضو و واحدهای سازمانی. در حال حاضر راه‌اندازی محدود به منطقه us-east-1 است و ایجاد منابع ماندگار می‌تواند حتی بدون استفاده فعال، هزینه‌بر باشد. برای جزئیات فنی و مجوزها به مخزن پروژه در GitHub مراجعه کنید.

مسائل سنجش و اعتمادپذیری

تا این لحظه AWS جدول رتبه‌بندی یا نتایج مرجع عمومی منتشر نکرده است و انتشار aws-bench در زمانی صورت گرفته که پرسش‌هایی دربارهٔ قابلیت اعتماد بنچمارک‌های عامل‌ها مطرح است. گروهی از پژوهشگران مرکز CRDI در UC Berkeley نشان داده‌اند که در برخی بنچمارک‌ها می‌توان امتیازات بالا کسب کرد بدون آنکه عملاً وظایف حل شده باشند؛ این موضوع نشان‌دهنده آسیب‌پذیری برخی معیارها در برابر شیوه‌های دورزدن است.

از آنجا که بسیاری از ارزیابی‌ها در aws-bench با قاضی مبتنی بر مدل زبان بزرگ انجام می‌شوند، مقاومت در برابر سوءاستفاده و مدیریت وضعیت‌های باقیمانده (leftover state) در سناریوها اهمیت زیادی دارد. AWS مستند کرده که وضعیت باقیمانده گاهی منجر به پاس‌های ناخواسته یا شکست‌های تصادفی می‌شود؛ بنابراین پژوهشگران و مهندسان باید در تفسیر نتایج احتیاط کنند و روی افزایش سخت‌گیری تأییدکننده‌ها و پاک‌سازی منابع تمرکز داشته باشند.

دسترسی و مجوز

کد منبع و مجموعه‌داده‌ها تحت مجوز Apache-2.0 در گیت‌هاب منتشر شده‌اند. مخاطبان اصلی پژوهشگران و توسعه‌دهندگان مدل‌اند، اما تیم‌های مهندسی می‌توانند سناریوها را گسترش داده و آنها را برای موارد کاربردی خود سفارشی کنند.

پیوندهای مرتبط

جمع‌بندی

aws-bench گامی مهم برای حرکت از شبیه‌سازی به آزمون‌های عملی است و امکان سنجش عامل‌ها در شرایط نزدیک‌تر به واقعیت را فراهم می‌کند. با این حال، تا زمانی که معیارهای مرجع و جدول‌های رتبه‌بندی شفاف منتشر نشوند و سازوکارهای تأیید و پاک‌سازی وضعیت بهبود نیافته باشند، نتایج نیاز به تفسیر محتاطانه دارند.