شرکت Artificial Analysis شاخص Search Index را منتشر کرد
Artificial Analysis شاخص «Search Index» را منتشر کرده است که عملکرد ارائهدهندگان API جستجو را برای عاملهای هوش مصنوعی بر اساس سه معیار اصلی — کیفیت، هزینه و سرعت — مقایسه میکند.
پرسش و محیط آزمایش
خط اصلی آزمون شامل Parallel، Exa، Firecrawl، You.com، Tavily، Keenable و Brave بود. همه ارائهدهندگان با مدل پایه GPT-5.6 Luna و در پیکربندی یکسان روی چارچوب متنباز Stirrup اجرا شدند؛ برای هر وظیفه عامل، 25 بار جستجو و واکشی صفحه وب انجام گرفت تا نوسانها کاهش یابد و نتایج قابل اتکا باشند.
روششناسی و مجموعه دادهها
شاخص از ترکیب سه معیار با وزن برابر استفاده کرده است:
- DeepSearchQA: 900 پرسش پژوهشی که هر یک نیازمند چند پرسوجو و تحلیل نتایج است.
- BrowseComp (زیرمجموعه): 200 واقعیت سخت برای یافتن که مرور چندمرحلهای میطلبد.
- AA-Omniscience: 600 سوال پراکنده در شش حوزه دانش.
علاوه بر این، یک بنچمارک پایه بدون استفاده از ابزارها بهعنوان نقطهٔ مقایسه لحاظ شد تا عملکرد جستجو در مقابل توانایی صرف مدل بررسی شود. جزئیات کامل روششناسی بهصورت عمومی منتشر شده و قابل بازبینی است (بیشتر درباره بنچمارکها).
کیفیت جستجو و تأثیر آن بر هزینه
نتایج نشان داد کیفیت بهتر جستجو میتواند مصرف توکن و در نتیجه هزینهٔ کلی را کاهش دهد. برای مثال Parallel Search (advanced) مصرف توکن را بیش از 40% نسبت به نسخهٔ Basic کاهش داد. با وجود آن که هزینهٔ هر فراخوانی جستجو در برخی پیکربندیها بالاتر است، هزینهٔ نهایی هر وظیفه در عمل کمتر بود: $0.084 در برابر $0.11.
سرعت پاسخدهی؛ پرسوجو بهتنهایی معیار کامل نیست
Parallel Search (turbo) پایینترین زمان پاسخ به ازای هر پرسوجو را ثبت کرد (0.51 ثانیه در برابر 1.03 ثانیه برای Basic)، اما کیفیت پایینتر (امتیاز 67 در برابر 73) باعث شد عامل مجبور به اجرای دورهای بیشتری شود. بنابراین زمان کلی برای رسیدن به پاسخ نهایی در عمل تقریباً مشابه باقی ماند.
برندگان و راهنمای انتخاب برای توسعهدهندگان
ترکیب بهترین هزینه و عملکرد در این ارزیابی به Parallel، Firecrawl و نسخهٔ turbo از Parallel تعلق گرفت. برای توسعهدهندگانی که عاملهای مبتنی بر وب میسازند، پیام اصلی روشن است: انتخاب سرویس جستجو تنها بر تأخیر تأثیر نمیگذارد؛ کیفیت نتایج، مصرف توکن و تجربهٔ کاربری نهایی را نیز تعیین میکند. این گزارش میتواند نقطهٔ شروعی برای تصمیمگیری در معماری عاملها و مدیریت هزینههای عملیاتی باشد.
نکات عملی برای انتخاب API جستجو
- کیفیت نتایج را بر اساس وظایف واقعی خود بسنجید، نه فقط زمان پاسخ هر فراخوان.
- هزینهٔ هر فراخوان را در کنار تعداد دورهای لازم برای رسیدن به پاسخ نهایی محاسبه کنید.
- برای وظایفی که نیاز به مرور چندمرحلهای دارند، تستهای چندمرحلهای را در اولویت قرار دهید.
دسترسی، شفافیت و رقابت آینده
روششناسی کامل Search Index بهصورت عمومی در دسترس است و سایر ارائهدهندگان میتوانند برای پیوستن به بنچمارک درخواست بدهند. دسترسی به دادهها و شفافسازی روشها احتمالاً رقابت مستدلتر و ارتقای کیفیت سرویسها را موجب خواهد شد. برای مطالعهٔ مفاهیم پایه دربارهٔ موتورهای جستجو میتوانید به صفحهٔ Search engine در ویکیپدیا مراجعه کنید.
چشمانداز کوتاهمدت
با رشد سریع ابزارهای عاملمحور و نیاز به کاهش هزینه و تأخیر، انتظار میرود ارائهدهندگان جستجو بهینهسازیهایی در رتبهبندی نتایج و پشتیبانی از واکاوی چندمرحلهای اعمال کنند. انتشار عمومی روششناسی میتواند به شکلگیری استانداردهایی برای اندازهگیری عملکرد APIهای جستجو کمک کند و در نتیجه انتخاب آگاهانهتر برای توسعهدهندگان و کاربران نهایی فراهم آورد.





