پژوهش جدید دانشگاه بوکونی نقش GPT-4o در آموزش را بررسی کرده است: دسترسی به این مدل زبانی می‌تواند نمره‌های تکالیف نوشتاری را افزایش دهد، اما روشن نیست این بهبود نشانگر یادگیری عمیق یا صرفاً جلوه‌ای از کیفیت نگارش است.

آزمایش بوکونی: GPT-4o نمره‌ها را بالا برد

آزمایش تصادفی در دانشگاه بوکونی روی 1,053 دانشجوی سال اول در یک دوره مقدماتی مدیریت انجام شد. شرکت‌کنندگان تا 180 کلمه برای نوشتن توصیه‌های بازاریابی فروشگاه محصولات دانشگاه زمان داشتند. گروه‌هایی که به GPT-4o دسترسی داشتند، به‌طور میانگین تقریباً 1 نمره در مقیاس 1 تا 5 بالاتر از گروه کنترل ظاهر شدند.

نتایج کلیدی

  • دسترسی به GPT-4o: میانگین نمره‌ها تقریباً 1 نمره افزایش یافت؛ پاسخ‌ها به‌طور معمول شامل حدود دو ایده بیشتر و انسجام منطقی بالاتری بودند.
  • درس کوتاه در استدلال علی: این درس نمره‌های سنتی را افزایش نداد، اما دانشجویان ایده‌های متنوع‌تر و توضیحات دقیق‌تری درباره چرایی و شرایط شکست پیشنهادها ارائه دادند.
  • ترکیب درس با GPT-4o: ترکیب درس با دسترسی به مدل، افزایش اضافی در نمره‌های سنتی به همراه نداشت؛ با این حال در شاخص‌های استدلال علی، دو رویکرد مکمل هم عمل کردند.

چه چیزی باعث برتری خروجی‌های GPT-4o شد؟

تحلیل‌ها پس از کنترل کیفیت استدلال، شمار و تنوع ایده‌ها و ویژگی‌های متنی، همچنان مزیت قابل‌توجهی برای گروه GPT-4o نشان دادند. نویسندگان نتیجه گرفته‌اند که این مزیت بیشتر ناشی از «کیفیت محتوا» است تا افزایش دانش عمیق دانشجویان؛ به عبارت دیگر، هوش مصنوعی پاسخ‌هایی صیقلی و مطابق با معیارهای نمره‌دهی سنتی تولید می‌کند.

دانشجویان در جلسه آزمایش دانشگاه بوکونی

جایزه نمره‌ها به نگارش ساختاریافته داده شد، نه به درک عمیق

تحلیل رابطه اجزای پاسخ و نمره نهایی نشان داد داشتن ایده‌های بیشتر، انسجام منطقی و تنوع داخلی ایده‌ها با نمره‌های بالاتر همبستگی دارد. در مقابل، ویژگی‌هایی مانند قابلیت ابطال پیشنهادها، توضیحات فنی‌تر از سازوکار اثرگذاری و انحراف از راه‌حل‌های متداول همبستگی معکوس با نمره داشتند. این الگو نشان می‌دهد سیستم‌های نمره‌دهی فعلی بیشتر «صیقلی بودن» پاسخ را اندازه می‌گیرند تا عمق یادگیری و فهم مفهومی.

نتیجه‌گیری موقت برای استادان و دانشگاه‌ها

  • اگر می‌خواهید اصالت و تنوع ایده‌ها به رسمیت شناخته شود، باید این معیارها را صراحتاً در روبریک نمره‌دهی وارد کنید.
  • معیارهای فعلی احتمالاً دانشجویانی را که با کمک هوش مصنوعی خروجی تولید می‌کنند پاداش می‌دهند، حتی در صورتی که درک مفهومی افزایشی نیافته باشد.

کدام پرسش‌ها بی‌جواب مانده‌اند؟

این مطالعه به بهبود عملکرد نمره‌دار روی همان تکلیف اشاره دارد و شواهدی درباره یادگیری بلندمدت ارائه نمی‌دهد. نکات مهمی که باید در تفسیر نتایج در نظر گرفته شود:

  • عدم وجود آزمون پیگیری بدون دسترسی به ابزار: مطالعه فاقد آزمون بدون دسترسی به ChatGPT بود تا مشخص شود دانشجویان واقعاً چه آموخته‌اند یا چه فرایندهایی را درونی کرده‌اند.
  • محدودیت نمونه و طراحی تصادفی: پژوهش محدود به یک دانشگاه و یک تکلیف بازاریابی بود؛ تخصیص تصادفی بین 13 بخش کلاسی صورت گرفت، نه تصادف‌زدایی در سطح هر یک از 1,053 دانشجو.
  • تأمین و تضاد منافع احتمالی: تأمین فناوری توسط OpenAI و حضور برخی نویسندگان مرتبط با این شرکت از عوامل تأثیرگذاری بر تفسیر نتایج است.

مدرسه‌ها و پژوهش‌های آینده

شواهد قبلی نشان داده‌اند نکتهٔ کلیدی نه صرفاً استفاده از هوش مصنوعی، بلکه نحوهٔ تأثیر آن بر فرایند تفکر دانش‌آموزان است. برخی مطالعات نشان داده‌اند دانشجویانی که بیشتر پاسخ‌های آماده از ابزارها می‌گیرند، پس از قطع دسترسی افت عملکرد بیشتری داشته‌اند.

پیشنهادهای پژوهشی و اجرایی:

  • طراحی مطالعات پیگیری بلندمدت که پس از حذف دسترسی به ابزارها نیز اثرات را اندازه‌گیری کند.
  • گسترش نمونه‌ها به مؤسسات و تکالیف متنوع برای سنجش تعمیم‌پذیری نتایج.
  • تحلیل دقیق‌تر منابع مزیت—تمایز بین ارتقای نگارشِ بیرونی و تغییر در فهم مفهومی.

پیشنهاد عملی برای دانشگاه‌ها:

  • روبریک‌های ارزیابی را بازنویسی کنید تا معیارهایی برای اصالت، قابلیت ابطال و نشانگرهای یادگیری پایدار را شامل شوند.
  • تکالیفی طراحی کنید که تمرکز را از «خروجی صیقلی» به «فرآیند یادگیری» منتقل کند؛ مثلاً ارزیابی‌های مرحله‌ای، بازنمایی فرایند تفکر و آزمون‌های شفاهی.
  • برای درک بهتر تأثیر، مطالعات تجربی کنترل‌شده با دوره‌های پیگیری اجرا کنید.

چشم‌انداز

پذیرش گسترده مدل‌های زبانی مانند GPT-4o پرسش‌های اخلاقی و آموزشی جدي مطرح کرده است. دانشگاه‌ها باید میان بهره‌مندی از ابزارهای توانمندساز و حفظ فرایندهای یادگیری عمیق توازن برقرار کنند؛ بازتعریف معیارهای ارزشیابی و طراحی تکالیف جدید می‌تواند راه‌حلی عملی باشد.

برای مطالعه بیشتر در مورد مدل‌های زبانی و نقش آن‌ها در آموزش، می‌توانید منابع مربوط به ChatGPT و پژوهش‌های آموزشی درباره هوش مصنوعی را دنبال کنید.