گزارش تازه: تصویر شرکتها از استفاده کاربران کامل نیست
گزارشی از AI Observatory نشان میدهد آنچه شرکتهای بزرگ هوش مصنوعی دربارهٔ کاربردهای محصولاتشان منتشر میکنند بخشی از واقعیت را پنهان میکند؛ استفادههای شخصی و موضوعات حساس در گزارشهای شرکتها کمتر بازتاب یافتهاند.
منبع مستقل و روششناسی
آنکا روئل، دانشجوی دکترای علوم کامپیوتر در آزمایشگاه Stanford Trustworthy AI Research (STAIR) میگوید رصدخانه با گردآوری و تحلیل مکالمات واقعی از هفت مجموعهداده—با رضایت کاربران—سعی دارد شکاف شفافیت را پر کند و دادهٔ مستقل برای پژوهشگران و سیاستگذاران فراهم آورد.
نتایج کلیدی مطالعه
- استفاده از هوش مصنوعی بین مدلها متفاوت است؛ موضوعات، سبک تعامل و احتمال بروز محتوای حساس بسته به ابزار تغییر میکند.
- زمانی که تیم رصدخانه روششناسی شاخص اقتصادی Anthropic را روی دادههای خود اعمال کرد، مشخص شد 48% از مکالمات فیلتر میشدند، یعنی تقریباً نیمی از گفتگوها در گزارش Anthropic ظاهر نمیشدند.
- مکالمات فیلترشده بیشتر شامل موضوعات سلامت و روابط (44.2% در مقابل 31.2%)، موضوعات بزرگسالانه یا غیرقانونی (7.9% در مقابل 2.1%)، آزار و نفرتپراکنی (27.5% در مقابل 5.66%) و محتوای جنسی (16.7% در مقابل 2.4%) بودند.
- گزارش 2025 OpenAI نیز نشان میداد حدود 30% از استفادهٔ مصرفکنندگان مربوط به کار بوده است؛ این رقم با یافتههای مستقل رصدخانه سازگاری دارد.
تغییرات زمانی و ساختار گفتگوها
مجموعهدادهٔ WildChat که یکی از بزرگترین منابع رصدخانه بود نشان داد مکالمات بین 2023 و 2025 طولانیتر و پرجزییاتتر شدهاند: تعداد توکنها، طول پاسخها و نوبتهای گفتگو رشد کرده است. در کنار این، گفتوگوهای غیررسمی و گپهای کوتاه افزایش یافته که نشاندهندهٔ تقویت نقشهای همدمانه و اجتماعی مدلهاست. همزمان میزان خودافشایی دستیارهای هوش مصنوعی (اعلام اینکه آنها چتبات هستند) کاهش یافته است.
کاهش موارد برچسبخورده بهعنوان استفادهٔ حساس و نقش فیلترها
پژوهشگران کاهش موارد برچسبخورده بهعنوان «استفادهٔ حساس» را ثبت کردند؛ این میتواند نشاندهندهٔ بهبود تدابیر حفاظتی پلتفرمها باشد یا نتیجهٔ فیلترها و سیاستهای گزارشدهی شرکتها باشد. تحلیل مستقل لازم است تا مشخص شود کاهش واقعی است یا محصول روشهای فیلترینگ و گزارشدهی.
تفاوت رفتار کاربران بین مدلها
کاربران برای اهداف مختلف به مدلهای متفاوتی گرایش دارند:
- Grok و Gemini بیشتر برای بازیابی اطلاعات بهکار میروند؛ بهویژه Grok در موضوعات اخبار و سیاست محبوب بوده و در عین حال مستعد انتشار اطلاعات نادرست شناخته شده است.
- Anthropic بیشتر برای کمک در کدنویسی استفاده میشد.
- Gemini در نقشآفرینی و کاربردهای اجتماعی محبوبیت دارد.
- ChatGPT بیشتر در تکالیف مدرسه و آموزش بهکار گرفته شد؛ نسخههای مختلف مدل رفتارهای متفاوتی نشان دادند: GPT-3.5 مکالمات کوتاهتر و GPT-4o مکالمات طولانیتر و تکراریتر تولید میکرد که با گزارشهایی دربارهٔ ایجاد وابستگی عاطفی همخوانی دارد.
پیامدها برای سیاستگذاری و پژوهش
یافتهها نشان میدهد تصمیمگیرندگان در حوزههای مقررات محتوا، حفاظت از کودکان و قاعدهگذاری اقتصادی به دادههای مستقل و قابلاعتنایی نیاز دارند. رصدخانهٔ هوش مصنوعی نمونهای از منابع مستقل است که میتواند مبنای تدوین سیاستهای واقعگرایانهتر باشد. برای درک بهتر چالشهای شفافیت در مدلهای زبانی، میتوان صفحهٔ شفافیت در ویکیپدیا را ملاحظه کرد.
پیشنهادها برای آینده
- افزایش دسترسی عمومی به مجموعهدادههای مستقل و معتبر.
- الزام به گزارشدهی استاندارد و شفاف از سوی شرکتها در زمینهٔ استفاده و فیلترینگ محتوا.
- راهاندازی بررسیهای پیوسته و حسابرسیهای مستقل برای ردیابی تغییرات رفتاری کاربران در طول زمان.
- ترکیب گزارشهای شرکتی با تحلیلهای مستقل برای دستیابی به تصویر واقعیتر از کاربردهای روزمره و شغلی مدلها.
جمعبندی
رصدخانهٔ هوش مصنوعی نشان میدهد روایتهای شرکتها از استفاده از هوش مصنوعی ناقص است و برای مدیریت مزایا و ریسکها به شواهد مستقل، شفافیت و استانداردسازی دادهها نیاز داریم؛ سیاستگذاری مؤثر و پژوهشهای قابل اعتماد مستلزم دسترسی به این اطلاعات است.





