تحقیقاتی از مدرسه وارتون دانشگاه پنسیلوانیا نشان می‌دهد عوامل خرید هوش مصنوعی هنگام تغییرات کوچک در فرایند جست‌وجو انتخاب‌های محصول را به‌طور چشمگیری جابه‌جا می‌کنند و بنابراین هنوز نمی‌توان به آن‌ها برای انجام خرید خودکار به نمایندگی از کاربر اعتماد کرد. گزارش کامل شامل آزمون‌های مختلف و تحلیل رفتار مدل‌ها است؛ نتایج نکات قابل‌تأملی برای خریداران، فروشندگان و طراحان سیستم‌های خودکار دارد.

روش آزمایش و شبیه‌ساز ACES

تیم تحقیقاتی شش مدل مختلف، از نسخه‌های کوچک تا مدل‌های پیشرو، را موظف کرد که در نقش دستیار خرید، یک ساعت هوشمند را از میان یک جدول ثابت محصولات انتخاب کنند. آزمایش با شبیه‌ساز ACES (Agentic e-Commerce Simulator) انجام شد. در این شبیه‌ساز به عامل تصویر صفحهٔ محصول نشان داده می‌شود؛ عامل آن تصویر را تحلیل، در صورت نیاز منابع توصیه را می‌خواند و سپس یک محصول را انتخاب می‌کند.

نمونه صفحه محصول در شبیه‌ساز ACES

اثر یک منبع بیرونی

حتی بدون منابع خارجی، مدل‌ها گرایش‌های اولیهٔ متفاوتی داشتند. اما وقتی عامل پیش از دیدن صفحهٔ محصول یک منبع بیرونی را می‌خواند، در موارد زیادی توصیه‌ها تغییرات اساسی نشان دادند. پژوهشگران سه منبع را آزمودند: یک تاپیک Reddit که Garmin Forerunner 55 را پیشنهاد می‌کرد، بررسی Wirecutter برای Fitbit Inspire 3 و مقاله‌ای در The Strategist دربارهٔ WHOOP 5.0. اثر Wirecutter در بسیاری از مدل‌ها قوی‌تر بود؛ برای نمونه احتمال انتخاب Fitbit Inspire 3 برای Claude Opus 4.8 تا 90 واحد درصد و برای Gemini 3.5 Flash تا 99 واحد درصد افزایش یافت.

نکات کلیدی از آزمایش یک منبعی

  • تأثیر یک منبع: یک منبع مستقل قادر است جهت انتخاب مدل را به‌طور بنیادین تغییر دهد.
  • قدرت منابع معتبر: منابع با اعتبار و نفوذ مانند Wirecutter در ترکیب ورودی‌ها غالب می‌شوند و اثر قوی‌تری بر نتایج دارند.
نمونه ترکیب منابع توصیه‌گر

ترکیب منابع و ترتیب ارائه تعیین‌کننده‌اند

وقتی عوامل چند منبع را می‌دیدند، منابع بیشتر لزوماً به تعادل ترجیحات نمی‌انجامید و در بسیاری از موارد ناپایداری را افزایش می‌داد. علاوه بر این، ترتیب ارائهٔ همان مجموعه منابع می‌توانست نتایج متفاوتی تولید کند. برای نمونه، Gemini 3.1 Flash Lite به‌قدری حساس بود که احتمال انتخاب Fitbit Inspire 3 بین 2 تا 56 واحد درصد بالاتر از حالت کنترل تغییر می‌کرد، در حالی که Claude Haiku 4.5 در بازهٔ 41 تا 42 واحد درصد نسبتاً پایدار ماند.

نحوهٔ ارسال اطلاعات نیز اهمیت داشت: GPT-5.5 در حالت ارسال دسته‌ای (بسته‌ای) 53 واحد درصد بیشتر از حالت کنترل Fitbit Inspire 3 را انتخاب کرد، اما در حالت ارسال ترتیبی تنها 6 واحد درصد افزایش نشان داد.

یادداشت‌های کوتاه کاربر می‌توانند بر انتخاب غلبه کنند

در یک سناریوی آزمایشی جدول محصولات طوری تنظیم شد که یک گزینه از نظر قیمت و امتیاز عینی برتر باشد: یک ساعت هوشمند با الکسا به قیمت 29.99 دلار، امتیاز 5.0 و 430 نقد، در حالی که سایر محصولات حداقل 359 دلار قیمت داشتند. سپس عباراتی کوتاه به‌عنوان «یادداشت حافظه» کاربر اضافه کردند؛ مثلاً «من عاشق پیاده‌روی هستم!». در چند مدل این یادداشت‌ها باعث شدند مدل‌ها به سمت محصولات گران‌تر گرایش پیدا کنند، حتی با وجود گزینهٔ عینی برتر.

  • نرخ انتخاب Garmin Vivoactive 5 برای Claude Opus 4.8 تا 75 واحد درصد افزایش یافت.
  • در GPT-5.5 این افزایش حدود 37 واحد درصد و در Gemini 3.1 Flash Lite حدود 36 واحد درصد بود.
  • برخی مدل‌ها مانند Gemini 3.5 Flash مقاوم‌تر ظاهر شدند و در 86 تا 92 درصد اجراها محصول عینی برتر را انتخاب کردند.
تأثیر یادداشت‌های کاربر بر انتخاب محصول

پیام برای خریداران و فروشندگان

نتایج این مطالعه دو پیام عملی و روشن دارد:

  1. برای خریداران: سپردن تصمیم‌گیری خرید به یک عامل هوش مصنوعی تضمین‌کنندهٔ پایداری یا بهینگی تصمیم نیست؛ همان پرس‌وجو می‌تواند در تنظیمات یا زمان‌های مختلف به نتایج متفاوتی منجر شود.
  2. برای فروشندگان: بهینه‌سازی برای انتخاب توسط عوامل هوش مصنوعی پیچیده‌تر از سئوی سنتی است؛ نمی‌دانید کدام مدل خریدار را نمایندگی می‌کند، چه منابعی پیش از انتخاب خوانده شده‌اند یا ترتیب و قالب نمایش اطلاعات چگونه پردازش می‌شود.

پژوهشگران تأکید می‌کنند که قبل از واگذاری خریدها به عامل‌های خودکار باید شفافیت، معیارهای آزمایشی و استانداردهای رفتاری قوی‌تری تدوین شود. در غیر این صورت رفتارهای غیرقابل‌پیش‌بینی هم به تجربهٔ کاربری آسیب می‌زند و هم چالش‌های جدیدی برای تجارت آنلاین ایجاد می‌کند.

آینده عوامل خرید هوش مصنوعی نیازمند استانداردهاست

برای مطالعهٔ بیشتر

منابع مرتبط: صفحهٔ مدرسه وارتون در ویکی‌پدیا و منابعی که در آزمایش نقش داشتند: Reddit، Wirecutter و The Strategist.

نتایج این مطالعه نشان می‌دهد ابزارهای خرید خودکار مبتنی بر هوش مصنوعی هنوز به استانداردهای قابل‌اعتماد برای تصمیم‌گیری مستقل نرسیده‌اند و به شفافیت، آزمون‌های گسترده و تنظیمات کاربردی نیاز دارند.