شرکت Artificial Analysis شاخص Search Index را منتشر کرد

Artificial Analysis شاخص «Search Index» را منتشر کرده است که عملکرد ارائه‌دهندگان API جستجو را برای عامل‌های هوش مصنوعی بر اساس سه معیار اصلی — کیفیت، هزینه و سرعت — مقایسه می‌کند.

پرسش و محیط آزمایش

خط اصلی آزمون شامل Parallel، Exa، Firecrawl، You.com، Tavily، Keenable و Brave بود. همه ارائه‌دهندگان با مدل پایه GPT-5.6 Luna و در پیکربندی یکسان روی چارچوب متن‌باز Stirrup اجرا شدند؛ برای هر وظیفه عامل، 25 بار جستجو و واکشی صفحه وب انجام گرفت تا نوسان‌ها کاهش یابد و نتایج قابل اتکا باشند.

نمایش نتایج بنچمارک Search Index و مقایسه ارائه‌دهندگان API جستجو

روش‌شناسی و مجموعه داده‌ها

شاخص از ترکیب سه معیار با وزن برابر استفاده کرده است:

  • DeepSearchQA: 900 پرسش پژوهشی که هر یک نیازمند چند پرس‌وجو و تحلیل نتایج است.
  • BrowseComp (زیرمجموعه): 200 واقعیت سخت برای یافتن که مرور چندمرحله‌ای می‌طلبد.
  • AA-Omniscience: 600 سوال پراکنده در شش حوزه دانش.

علاوه بر این، یک بنچمارک پایه بدون استفاده از ابزارها به‌عنوان نقطهٔ مقایسه لحاظ شد تا عملکرد جستجو در مقابل توانایی صرف مدل بررسی شود. جزئیات کامل روش‌شناسی به‌صورت عمومی منتشر شده و قابل بازبینی است (بیشتر درباره بنچمارک‌ها).

کیفیت جستجو و تأثیر آن بر هزینه

نتایج نشان داد کیفیت بهتر جستجو می‌تواند مصرف توکن و در نتیجه هزینهٔ کلی را کاهش دهد. برای مثال Parallel Search (advanced) مصرف توکن را بیش از 40% نسبت به نسخهٔ Basic کاهش داد. با وجود آن که هزینهٔ هر فراخوانی جستجو در برخی پیکربندی‌ها بالاتر است، هزینهٔ نهایی هر وظیفه در عمل کمتر بود: $0.084 در برابر $0.11.

سرعت پاسخ‌دهی؛ پرس‌وجو به‌تنهایی معیار کامل نیست

Parallel Search (turbo) پایین‌ترین زمان پاسخ به ازای هر پرس‌وجو را ثبت کرد (0.51 ثانیه در برابر 1.03 ثانیه برای Basic)، اما کیفیت پایین‌تر (امتیاز 67 در برابر 73) باعث شد عامل مجبور به اجرای دورهای بیشتری شود. بنابراین زمان کلی برای رسیدن به پاسخ نهایی در عمل تقریباً مشابه باقی ماند.

برندگان و راهنمای انتخاب برای توسعه‌دهندگان

ترکیب بهترین هزینه و عملکرد در این ارزیابی به Parallel، Firecrawl و نسخهٔ turbo از Parallel تعلق گرفت. برای توسعه‌دهندگانی که عامل‌های مبتنی بر وب می‌سازند، پیام اصلی روشن است: انتخاب سرویس جستجو تنها بر تأخیر تأثیر نمی‌گذارد؛ کیفیت نتایج، مصرف توکن و تجربهٔ کاربری نهایی را نیز تعیین می‌کند. این گزارش می‌تواند نقطهٔ شروعی برای تصمیم‌گیری در معماری عامل‌ها و مدیریت هزینه‌های عملیاتی باشد.

نکات عملی برای انتخاب API جستجو

  • کیفیت نتایج را بر اساس وظایف واقعی خود بسنجید، نه فقط زمان پاسخ هر فراخوان.
  • هزینهٔ هر فراخوان را در کنار تعداد دورهای لازم برای رسیدن به پاسخ نهایی محاسبه کنید.
  • برای وظایفی که نیاز به مرور چندمرحله‌ای دارند، تست‌های چندمرحله‌ای را در اولویت قرار دهید.

دسترسی، شفافیت و رقابت آینده

روش‌شناسی کامل Search Index به‌صورت عمومی در دسترس است و سایر ارائه‌دهندگان می‌توانند برای پیوستن به بنچمارک درخواست بدهند. دسترسی به داده‌ها و شفاف‌سازی روش‌ها احتمالاً رقابت مستدل‌تر و ارتقای کیفیت سرویس‌ها را موجب خواهد شد. برای مطالعهٔ مفاهیم پایه دربارهٔ موتورهای جستجو می‌توانید به صفحهٔ Search engine در ویکی‌پدیا مراجعه کنید.

چشم‌انداز کوتاه‌مدت

با رشد سریع ابزارهای عامل‌محور و نیاز به کاهش هزینه و تأخیر، انتظار می‌رود ارائه‌دهندگان جستجو بهینه‌سازی‌هایی در رتبه‌بندی نتایج و پشتیبانی از واکاوی چندمرحله‌ای اعمال کنند. انتشار عمومی روش‌شناسی می‌تواند به شکل‌گیری استانداردهایی برای اندازه‌گیری عملکرد APIهای جستجو کمک کند و در نتیجه انتخاب آگاهانه‌تر برای توسعه‌دهندگان و کاربران نهایی فراهم آورد.