آرنا (Arena.ai) با تحلیل ده‌ها هزار خروجی مدل کلود در محیط تکست‌آرنا (Text Arena)، تحولی قابل‌توجه در سبک نگارش نسخه فبل ۵.۱ (Fable 5.1) نسبت به پیشین خود، فبل ۵، فاش کرده است. داده‌ها نشان می‌دهد انتروپیک (Anthropic) با این به‌روزرسانی، مدل را به سمت لحنی رسمی‌تر، فشرده‌تر و کمتر «انسانی‌ساز» سوق داده است.

طول پاسخ: تعادل بین جزئیات و خلاصه‌نگاری

میانه طول پاسخ‌ها در فبل ۵.۱ به ۴۱۴ کلمه رسیده که نشان‌دهنده ۳۰ درصد رشد نسبت به ۳۱۹ کلمه در فبل ۵ است. با این حال، این مدل همچنان ۲۱ درصد کوتاه‌تر از مدل پرچم‌داری اپوس ۵ (Opus 5) است که میانگین پاسخ‌های آن ۵۲۵ کلمه می‌باشد. این تعادل نشان می‌دهد انتروپیک سعی کرده بین جزئیات‌نگری و خلاصه‌نویسی توازن برقرار کند.

حذف کلمات «باربر» و علائم نگارشی پراکنده

فبل ۵.۱ نسبت به پیشین خود تغییرات زیر را در سطح سطحه (Surface-level) نشان می‌دهد:

  • کاهش ۲۰ درصدی در استفاده از عبارت‌های کلیشه‌ای و «باربر» (load-bearing) نظیر «در واقع»، «به طور کلی» و «لازم به ذکر است» در هر ۱۰۰۰ کلمه.
  • کاهش ۳۶ درصدی در کلمات محدودکننده (hedges) مانند «شاید»، «ممکن است» و «قابل بحث» (arguably).
  • حذف تقریبی کامل آغازگرهای موافقت‌نامه‌وار (agreement openers) و کلمات احساسی‌گرایانه مانند «راستش» (honestly) و «صریحاً» (frankly).
  • کاهش قابل‌توجه در استفاده از خط تیره طولانی (em dash —) که معمولاً نشانه تفکیر لحظه‌به‌لحظه و نویزهای زبانی است.

کاهش اعتبارسنجی و تحسین خودکار (Sycophancy)

یکی از شاخص‌های جالب، افت درصد پاسخ‌هایی است که حاوی عبارات تحسین و تأیید (مانند «سؤال عالی است» یا «نکته خوبی مطرح کردید») می‌باشند. این نرخ از ۳.۱۷ درصد در فبل ۵ به ۱.۹۸ درصد در فبل ۵.۱ کاهش یافته است. این امر تدل بر تلاش صریح برای حذف «چسبندگی» (sycophancy) و تمرکز بر محتوای خالص استدلال دارد.

سادگی واژگانی و کاهش انتزاع

تحلیل‌های واژگانی تغییرات ساختاری زیر را تایید می‌کنند:

  • سهم کلمات محتوایی طولانی از ۴۲.۶ درصد به ۳۸.۶ درصد افت کرده است.
  • اسم‌های انتزاعی (abstract nouns) ۲۵ درصد کاهش یافته‌اند، از ۴.۳۹ به ۳.۲۸ در هر ۱۰۰ کلمه.

این آمارها هم‌سو با رویکردی هستند که در آن مدل از واژگان پیچیده و انتزاعی پرهیز کرده و به سراغ جملات مستقیم‌تر و قابل‌فهم‌تر می‌رود، بدون اینکه عمق استدلال از دست برود.

ریشه‌ی تغییرات: داده‌های آموزش یا پرامپت سیستمی؟

تحول در سبک نگارش مدل‌های زبانی بزرگ (LLM) معمولاً انعکاس دو عامل است: تغییر در داده‌های آموزش پس‌ازآموزی (RLHF) و تنظیم مجدد توکن‌های سیستمی (System Prompt). کاهش hedges و عبارات باربر، معمولاً در پیامی است که از مدل خواسته شده «مستقیم باش»، «از کلمات پرکننده پرهیز کن» و «بدون مقدمه به جواب برسد». این روند در مدل‌های جدیدتر جی‌پی‌تی ۴او و جمینای گوگل نیز مشهود است.

از منظر تجربه کاربری، این تغییر به معنای کاهش بار شناختی است: پاسخ‌ها سریع‌تر خوانده می‌شوند، پر از هیاهو نیستند، و حس «ماشین‌مانند بودن مصنوعی» که با کلماتی مثل «راستش» و «صریحاً» القا می‌شد، محو شده است.

آینده سبک نگارش در مدل‌های استدلال‌گرا

فبل ۵.۱ گویا یک نقطه میانه است: پاسخ‌ها طولانی‌تر شده‌اند (برای پوشش استدلال پیچیده) اما سبک نگارش ترسیم شده، مکالمه‌گرایانه و پر از «نویزهای زبانی» نیست، بلکه تحلیلی، دقیق و مهنی است. این مسیر ادامه خواهد یافت؛ مدل‌های آینده احتمالاً همچنان به سمت حذف تکرارها، کلیشه‌ها و علائم نگارشیِ محوگرِ شک و تردید پیش‌روند، اما چالش بزرگ، حفظ طبیعت‌محوری در دیالوگ‌های طولانی و چندمرحله‌ای خواهد بود.

نمودار مقایسه شاخص‌های زبانی کلود فبل ۵ و فبل ۵.۱
مقایسه شاخص‌های زبانی بین فبل ۵ و فبل ۵.۱ بر اساس تحلیل آرنا