توسعه نرم‌افزارهای سنتی همواره با نگارش اسناد نیازمندی‌های محصول (PRD) آغاز می‌شود؛ اما در حوزه شگفت‌انگیز هوش مصنوعی پیشرو، قوانین بازی کاملاً متفاوت است. در شرکت آنتروپیک، ارزیابی‌های خودکار جایگزین اسناد سنگین اداری شده‌اند و ماهیت توسعه محصول را دگرگون کرده‌اند.

دایان پن، مدیر محصول پژوهش و آزمایشگاه‌های هوش مصنوعی آنتروپیک، اخیراً در مصاحبه‌ای توضیح داد که رویکرد احتمالاتی مدل‌های زبانی، تیم‌های مهندسی را مجبور کرده تا نقشه‌راه‌های قدیمی برای سنجش موفقیت را کنار بگذارند. هدف اصلی این تیم‌ها اکنون ردیابی هوشمندانه خطاها و ارزیابی مستمر مدل‌هاست.

مرگ اسناد سنتی و ظهور ارزیابی‌های پویا

در آنتروپیک، تیم مدیران محصول، مجموعه ارزیابی‌ها (Eval Set) را به‌عنوان خروجی اصلی خود در نظر می‌گیرد. تیم پن برای هر قابلیت عمده، 30 تا 40 نمونه نماینده تولید می‌کند و آن‌ها را در قالب پرامپت‌هایی با خروجی‌های مورد انتظار ثبت می‌کند. این مجموعه به‌عنوان یک معیار مرجع عمل می‌کند.

توسعه‌دهندگان موظف‌اند خطوط لوله یکپارچه‌سازی مستمر (CI) و زیرساخت‌های تست خودکار را بسازند تا بتوانند این خروجی‌ها را به‌صورت برنامه‌ریزی‌شده با نسخه‌های جدید مدل مقایسه کنند. از آنجا که رشد ظرفیت‌های هوش مصنوعی گاهی با جهش‌های ناگهانی و یک‌شبه (مانند پیشرفت چشمگیر در استدلال ریاضی) همراه است، فقدان ابزارهای ارزیابی خودکار منجر به پدیدار شدن پدیده‌ای به نام «ظرفیت بالفعل‌نشده محصول» می‌شود.

شناسایی این توانایی‌های پنهان، روش‌های تضمین کیفیت (QA) را نیز کاملاً تغییر داده است. مهندسان به‌جای ردیابی ساده اجرای کدها، اکنون باید مکالمات مدل‌ها را تحلیل کنند تا دلیل تصمیمات خاص هوش مصنوعی را درک کنند.

تیم مهندسی آنتروپیک در حال بررسی کدهای تولید شده توسط هوش مصنوعی

چالش‌های جدید دیباگ در سیستم‌های احتمالاتی

رفتارهای نادرست مدل‌ها مانند توهم (Hallucination)، اطمینان کاذب یا فراخوانی ناموفق ابزارها، همگی خطاهایی با ظاهر مشابه ایجاد می‌کنند که هرکدام نیازمند راه‌حل‌های کاملاً متفاوتی هستند. یکی دیگر از چالش‌های مهم، رفتار چاپلوسانه مدل است؛ جایی که هوش مصنوعی به‌جای اصلاح پیش‌فرض‌های اشتباه کاربر، آن‌ها را تأیید می‌کند.

پن تاکید می‌کند که مدیران ارشد فناوری برای داشتن دیدگاه معماری درست، باید تجربه عملی و دست‌به‌آچاه کار با مدل‌ها را داشته باشند. شهود فنی تنها از طریق استفاده مستمر و مواجهه با نقاط ضعف سیستم‌ها به دست می‌آید.

تغییر مسیر استراتژیک؛ از چت‌بات به دستیار برنامه‌نویسی

این تغییر رویکرد در توسعه محصول، یکی از بزرگ‌ترین تصمیمات راهبردی آنتروپیک را رقم زد: تمرکز بر ابزارهای توسعه‌دهندگان. پیش از سال 2023، آنتروپیک اصلاً به‌عنوان ابزاری برای کدنویسی شناخته نمی‌شد.

با این حال، پس از مشاهده استقبال کاربران از مدل‌های رقیب برای انجام وظایف برنامه‌نویسی، آنتروپیک توانمندی در کدنویسی را به محور اصلی مدل Claude 3 Opus تبدیل کرد. هدف این بود که هوش مصنوعی از یک ربات گفت‌وگومحور عبور کرده و به یک دستیار عملیاتی تبدیل شود. این مسیر در نهایت به معرفی ابزار Claude Code و نسخه‌های بعدی مانند Claude Opus 4.5 ختم شد.

برای شکار این جهش‌های ناگهانی در فناوری، آنتروپیک در اواسط سال 2024 یک تیم تحقیق‌وتوسعه اختصاصی با نام Labs تشکیل داد. رسالت این تیم کوچک، دنبال کردن ایده‌های آزمایشی و پرریسکی است که در نقشه‌راه معمول محصول جای نمی‌گیرند. تنها زمانی می‌توان از پتانسیل‌های پنهان هوش مصنوعی بهره برد که زیرساخت‌های ارزیابی و تیم‌های چابک، برای کشف آن‌ها در هر لحظه آماده باشند.