وقتی OpenAI در اسفند ۱۴۰۲ از GPT-4 رونمایی کرد، فناوری نوین و «عملکرد در سطح انسانی» در بنچمارک‌های آکادمیک، محور اصلی کمپین‌های تبلیغاتی این شرکت بود. در میان تمام ادعاها، نمره惊人的 GPT-4 در آزمون جامع وکالت (UBE) بیشترین سروصدا را به پا کرد. ادعایی که می‌گفت این مدل زبانی در میان «۱۰ درصد برترین شرکت‌کنندگان» یا همان صدک ۹۰ قرار دارد. رسانه‌ها و کارشناسان حقوقی بلافاصله این نتیجه را بازنشر کردند و نگرانی‌های جدی درباره جایگزینی وکلای انسانی با هوش مصنوعی شکل گرفت.

با این حال، بررسی دقیق و تازه‌ای که با عنوان «بازارزیابی عملکرد GPT-4 در آزمون وکالت» منتشر شده، شکاف‌های عمیق و مشکلات روش‌شناختی جدی در نحوه محاسبه این رقم خبرساز را برملا کرده است. این پژوهش نشان می‌دهد که برآوردهای OpenAI از قابلیت‌های مدل جدید خود در این آزمون خاص، با.large‌نمایی و سوگیری‌های آماری همراه بوده است.

تضاد عجیب افت نمرات در آزمون‌های نگارشی

جهش ناگهانی نمرات GPT-4 نسبت به نسل قبلی خود (GPT-3.5) در آزمون وکالت به‌شدت غیرعلی به نظر می‌رسید. این مدل در آزمون وکالت حدود ۸۰ واحد صدکی پیشرفت داشت؛ در حالی که در سایر آزمون‌های استاندارد پیشرفت بسیار کمتری ثبت کرد:

  • آزمون LSAT: بهبود ۴۰ واحد صدکی
  • بخش کلامی GRE: بهبود ۳۶ واحد صدکی
  • نگارش GRE: بدون هیچ پیشرفت محسوسی (۰ واحد صدکی)

بزرگترین تناقض در مهارت نگارش رخ می‌دهد. نیمی از آزمون جامع وکالت را نوشتن مقالات حقوقی تشکیل می‌دهد. با این حال، در سایر آزمون‌های مبتنی بر نگارش، GPT-4 عملکرد بسیار ضعیفی از خود نشان داد. در آزمون زبان و نگارش AP، این مدل در بازه صدکی ۱۴ تا ۴۴ قرار گرفت و در بخش نگارش GRE، نمره‌ای در حد صدک ۵۴ کسب کرد. در هیچ‌یک از این آزمون‌های نگارشی، GPT-4 نتوانست از GPT-3.5 سبقت بگیرد؛ بنابراین رسیدن به صدک ۹۰ در آزمونی که نیمی از آن بر پایه نگارش است، از نظر منطق آموزشی کاملاً نامفهوم است.

مقایسه عملکرد مدل‌های هوش مصنوعی در آزمون‌های مختلف

۴ شواهد که ادعای OpenAI را نقاب‌برداری کرد

برخلاف برگزارکنندگان سایر آزمون‌های استاندارد، شورای ملی ممتحنان وکالت (NCBE) اطلاعات آماری و صدک‌های رسمی آزمون UBE را به صورت عمومی منتشر نمی‌کند. نبود این داده‌های مرجع، راه را برای دستکاری داده‌ها و ارائه برآوردهای انحراحی هموار می‌کند. پژوهش اخیر چهار دلیل اصلی برای رد ادعای صدک ۹۰ ارائه می‌دهد:

۱. مقایسه با ضعیف‌ترین داوطلبان

شرکت OpenAI برای محاسبه صدک، GPT-4 را با داوطلبانی مقایسه کرد که در دوره برگزاری آزمون در ماه فوریه شرکت کرده بودند. این گروه عمدتاً شامل افرادی است که در دوره ماه ژوئیه مردود شده و مجدداً در آزمون شرکت کرده‌اند. این دسته از داوطلبان به طور میانگین نمرات بسیار پایینی کسب می‌کنند. در واقع، هوش مصنوعی با ضعیف‌ترین گروه آزمون‌دهندگان رقابت کرده است، نه میانگین کل داوطلبان.

۲. تصویر واقعی در دوره‌های معمول (ماه ژوئیه)

هنگامی که پژوهشگران داده‌های مربوط به دوره برگزاری ماه ژوئیه را که نشانگر جمعیتی بسیار طبیعی‌تر و نماینده‌تر است بررسی کردند، نتایج به طرز چشمگیری تغییر کرد. در این حالت، صدک کلی GPT-4 به زیر ۶۹ سقوط کرد.

نمودار سقوط نمرات هوش مصنوعی در مقایسه با انسان‌ها

۳. افت شدید در بخش مقالات حقوقی

در بخش مقاله‌نویسی آزمون وکالت که نیازمند درک عمیق و استدلال دقیق است، عملکرد مدل از صدک ۹۰ به حدود صدک ۴۵ تا ۵۰ تنزل پیدا کرد. این رقم دقیقاً با نمرات ضعیف مدل در سایر آزمون‌های مبتنی بر نگارش هم‌خوانی دارد و نشان می‌دهد مدل در تولید متن‌های تحلیلی طولانی همچنان با چالش جدی مواجه است.

۴. ابهام در نمرات تبدیلی

پژوهشگران متوجه شدند که OpenAI برای رسیدن به آن نمره طلایی، از جداول تبدیل نمره قدیمی و ناکارآمد استفاده کرده است. این جداول که برای تطبیق نمرات آزمون‌های محلی با آزمون سراسری طراحی شده‌اند، در زمان محاسبه عملکرد هوش مصنوعی خطاهای فاحشی ایجاد می‌کنند.

آیا گزارش فنی OpenAI گمراه‌کننده بود؟

نکته به شدت قابل تامل این است که در گزارش فنی GPT-4، سازندگان این برآوردهای صدکی را اعدادی «محافظه‌کارانه» توصیف کرده و ادعا کردند که این اعداد نشان‌دهنده «کران پایین دامنه صدکی» هستند. این ادعا به صورت تلویحی به کاربران القا می‌کرد که قابلیت‌های واقعی مدل زبانی GPT-4 حتی از آنچه در تیترهای خبری دیده می‌شود، بسیار بیشتر است!

این رسوایی آماری نشان می‌دهد که چگونه عدم شفافیت در داده‌های مرجع می‌تواند به تولید تبلیغات تجاری پرسروصدا در صنعت هوش مصنوعی منجر شود. تا زمانی که سازنداران مدل‌های زبانی استانداردهای سخت‌گیرانه‌تری برای ارزیابی‌های خود ارائه ندهند، باید به تیترهای درخشان و جهش‌های ناگهانی نمرات با شک و تردید فراوان نگاه کرد.