وقتی OpenAI در اسفند ۱۴۰۲ از GPT-4 رونمایی کرد، فناوری نوین و «عملکرد در سطح انسانی» در بنچمارکهای آکادمیک، محور اصلی کمپینهای تبلیغاتی این شرکت بود. در میان تمام ادعاها، نمره惊人的 GPT-4 در آزمون جامع وکالت (UBE) بیشترین سروصدا را به پا کرد. ادعایی که میگفت این مدل زبانی در میان «۱۰ درصد برترین شرکتکنندگان» یا همان صدک ۹۰ قرار دارد. رسانهها و کارشناسان حقوقی بلافاصله این نتیجه را بازنشر کردند و نگرانیهای جدی درباره جایگزینی وکلای انسانی با هوش مصنوعی شکل گرفت.
با این حال، بررسی دقیق و تازهای که با عنوان «بازارزیابی عملکرد GPT-4 در آزمون وکالت» منتشر شده، شکافهای عمیق و مشکلات روششناختی جدی در نحوه محاسبه این رقم خبرساز را برملا کرده است. این پژوهش نشان میدهد که برآوردهای OpenAI از قابلیتهای مدل جدید خود در این آزمون خاص، با.largeنمایی و سوگیریهای آماری همراه بوده است.
تضاد عجیب افت نمرات در آزمونهای نگارشی
جهش ناگهانی نمرات GPT-4 نسبت به نسل قبلی خود (GPT-3.5) در آزمون وکالت بهشدت غیرعلی به نظر میرسید. این مدل در آزمون وکالت حدود ۸۰ واحد صدکی پیشرفت داشت؛ در حالی که در سایر آزمونهای استاندارد پیشرفت بسیار کمتری ثبت کرد:
- آزمون LSAT: بهبود ۴۰ واحد صدکی
- بخش کلامی GRE: بهبود ۳۶ واحد صدکی
- نگارش GRE: بدون هیچ پیشرفت محسوسی (۰ واحد صدکی)
بزرگترین تناقض در مهارت نگارش رخ میدهد. نیمی از آزمون جامع وکالت را نوشتن مقالات حقوقی تشکیل میدهد. با این حال، در سایر آزمونهای مبتنی بر نگارش، GPT-4 عملکرد بسیار ضعیفی از خود نشان داد. در آزمون زبان و نگارش AP، این مدل در بازه صدکی ۱۴ تا ۴۴ قرار گرفت و در بخش نگارش GRE، نمرهای در حد صدک ۵۴ کسب کرد. در هیچیک از این آزمونهای نگارشی، GPT-4 نتوانست از GPT-3.5 سبقت بگیرد؛ بنابراین رسیدن به صدک ۹۰ در آزمونی که نیمی از آن بر پایه نگارش است، از نظر منطق آموزشی کاملاً نامفهوم است.
۴ شواهد که ادعای OpenAI را نقاببرداری کرد
برخلاف برگزارکنندگان سایر آزمونهای استاندارد، شورای ملی ممتحنان وکالت (NCBE) اطلاعات آماری و صدکهای رسمی آزمون UBE را به صورت عمومی منتشر نمیکند. نبود این دادههای مرجع، راه را برای دستکاری دادهها و ارائه برآوردهای انحراحی هموار میکند. پژوهش اخیر چهار دلیل اصلی برای رد ادعای صدک ۹۰ ارائه میدهد:
۱. مقایسه با ضعیفترین داوطلبان
شرکت OpenAI برای محاسبه صدک، GPT-4 را با داوطلبانی مقایسه کرد که در دوره برگزاری آزمون در ماه فوریه شرکت کرده بودند. این گروه عمدتاً شامل افرادی است که در دوره ماه ژوئیه مردود شده و مجدداً در آزمون شرکت کردهاند. این دسته از داوطلبان به طور میانگین نمرات بسیار پایینی کسب میکنند. در واقع، هوش مصنوعی با ضعیفترین گروه آزموندهندگان رقابت کرده است، نه میانگین کل داوطلبان.
۲. تصویر واقعی در دورههای معمول (ماه ژوئیه)
هنگامی که پژوهشگران دادههای مربوط به دوره برگزاری ماه ژوئیه را که نشانگر جمعیتی بسیار طبیعیتر و نمایندهتر است بررسی کردند، نتایج به طرز چشمگیری تغییر کرد. در این حالت، صدک کلی GPT-4 به زیر ۶۹ سقوط کرد.
۳. افت شدید در بخش مقالات حقوقی
در بخش مقالهنویسی آزمون وکالت که نیازمند درک عمیق و استدلال دقیق است، عملکرد مدل از صدک ۹۰ به حدود صدک ۴۵ تا ۵۰ تنزل پیدا کرد. این رقم دقیقاً با نمرات ضعیف مدل در سایر آزمونهای مبتنی بر نگارش همخوانی دارد و نشان میدهد مدل در تولید متنهای تحلیلی طولانی همچنان با چالش جدی مواجه است.
۴. ابهام در نمرات تبدیلی
پژوهشگران متوجه شدند که OpenAI برای رسیدن به آن نمره طلایی، از جداول تبدیل نمره قدیمی و ناکارآمد استفاده کرده است. این جداول که برای تطبیق نمرات آزمونهای محلی با آزمون سراسری طراحی شدهاند، در زمان محاسبه عملکرد هوش مصنوعی خطاهای فاحشی ایجاد میکنند.
آیا گزارش فنی OpenAI گمراهکننده بود؟
نکته به شدت قابل تامل این است که در گزارش فنی GPT-4، سازندگان این برآوردهای صدکی را اعدادی «محافظهکارانه» توصیف کرده و ادعا کردند که این اعداد نشاندهنده «کران پایین دامنه صدکی» هستند. این ادعا به صورت تلویحی به کاربران القا میکرد که قابلیتهای واقعی مدل زبانی GPT-4 حتی از آنچه در تیترهای خبری دیده میشود، بسیار بیشتر است!
این رسوایی آماری نشان میدهد که چگونه عدم شفافیت در دادههای مرجع میتواند به تولید تبلیغات تجاری پرسروصدا در صنعت هوش مصنوعی منجر شود. تا زمانی که سازنداران مدلهای زبانی استانداردهای سختگیرانهتری برای ارزیابیهای خود ارائه ندهند، باید به تیترهای درخشان و جهشهای ناگهانی نمرات با شک و تردید فراوان نگاه کرد.





