یک مدیر ارشد مایکروسافت در یک سند داخلی، فرآیند استخراج دادههای گسترده برای آموزش مدلهای هوش مصنوعی را «یک دزدی شگفتانگیز با مقیاس بیسابقه» و «بزرگترین دزدی نیروی کار در تاریخ بشر» نامید. این اعتراف در تازهترین اسناد از حالت مختومه خارج شده در پرونده شکایت کپیرایت نیویورک تایمز علیه اوپنایآی و مایکروسافت گنجانده شده و استراتژی دفاعی دو غول فناوری را به چالش کشیده است.
اعترافی که استدلال «استفاده عادلانه» را میلرزاند
برنت هکت، مدیر علوم کاربردی مایکروسافت، در یک یادداشت ژانویه ۲۰۲۳ که اکنون در پرونده دادگاه افشا شده، صراحتاً نوشته است: «ما در حال انجام یک دزدی شگفتانگیز با مقیاس بیسابقه هستیم... بزرگترین دزدی نیروی کار در تاریخ بشر.» این واژگان مستقیماً در تضاد با استدلال «استفاده عادلانه» (fair use) قرار دارد که اوپنایآی و مایکروسافت برای توجیه استفاده از محتوای تحت کپیرایت بدون مجوز به کار میبرند.
اسناد افشا شده همچنین نشان میدهد رهبران اوپنایآی از خطرات وجودی ناشی از محصولات خود برای ناشرین آگاه بودهاند. نیک ترلی، رئیس چتجیپیتی، در ارتباطات داخلی ناشرین را در برابر یک «تهدید وجودی» قرار داده و تصریح کرده که چتباتها «به طور گسترده جایگزینکننده هستند و هرچه بهتر شوند، بیشتر جایگزینکننده میشوند.» گرگ برکمن، رئیس اجرایی اوپنایآی، نیز مدلها را در پوشش اخبار «عالی» توصیف کرده است.
حلقه نابودی: وقتی موتور پاسخ، نرخ کلیک را ۹۳٪ میکشد
دادههای داخلی مایکروسافت فاش میکند که کوپایلوت (Copilot)، «موتور پاسخ» شرکت، باعث شده نرخ کلیک ورودی (CTR) برای دامنه نیویورک تایمز تا ۹۳٪ در مقایسه با جستجوی سنتی باینگ کاهش یابد. هکت در یک ارائه داخلی ژانویه ۲۰۲۴ این پدیده را یک «حلقه نابودی» (doom loop) نامیده که «هم عملکرد مدلهای ما و هم کل وب را به طور همزمان آسیب میرساند.»
در همان سند هکت میخواند: «به طور غیرعادی، یک محصول نهایی بنیانهای اقتصادی تأمینکنندگان ضروری خود را تهدید میکند، اما این همان شرایطی است که ما برای کسبوکار LLM خود نسبت به زنجیره تأمین محتوای آن ایجاد کردهایم.»
شهادت نادلا: محتوای پیوولدار باید مجوز داشته باشد
ساتیا نادلا، مدیر عامل مایکروسافت، در اظهارنامه تحت سوگند در اوایل ۲۰۲۴ تصریح کرد: «هرچه پیوول داشته باشد باید توسط هر کسی که میخواهد از آن برای پایهگذاری (grounding) یا آموزش استفاده کند، مجوز گرفته شود.» نادلا همچنین تاکید کرد که اگر آگاه میشد اوپنایآی دادههای پشت پیوول را اسکرپ و آموزش داده است، حق قراردادی خود را برای الزام بازآموزی مدلها اجرا میکرد.
نادلا همچنین زیر سوگند موافقت کرد که گفتگو با چتباتها «جایگزین شده... به شما اطلاعات را مستقیماً در پلتفرم هوش مصنوعی میدهد در مقایسه با ضرورت مراجعه به منبع اصلی.» این اعتراف مستقیماً پایه استدلال «تبدیلگرانه» (transformative use) را در آزمون استفاده عادلانه میلرزاند.
مقیاس عظیم کپیبرداری: از کامون کرال تا پروژههای مخفی
اسناد برای اولین بار مقیاس کپیبرداری را به تفکیک کاشف میکنند:
- مجموعه دادههای میانی آموزش (mid-training datasets) اوپنایآی شامل بیش از ۹۱،۶۹۲ کپی از آثار منتشر شده توسط نیویورک تایمز، دیلی نیوز و مرکز گزارشگری تحقیقاتی است.
- یک مجموعه داده مشتق شده از کامون کرال (Common Crawl) بیش از ۲ میلیون سند تنها از
nytimes.comرا در بر میگیرد.
پرونده همچنین جزئیات نحوه دستیابی به محتوا را تشریح میکند: دور زدن پیوولها بدون شناسایی، استخراج انبوه (mass scraping)، حذف عمدانه اطلاعیههای کپیرایت از دادههای آموزشی، و استفاده از ایندکس باینگ. مایکروسافت از طریق طرحهایی به نام «پروژه تاکسی» (Project Taxi) و «پروژه مانگو» (Project Mango) دادههای آموزشی را به اوپنایآی منتقل کرده است.
بازی حقوقی: استفاده عادلانه در آستانه چالش جدی
سوال قانونی هستهای این است که آیا آموزش هوش مصنوعی بر روی آثار تحت کپیرایت مصداق استفاده عادلانه (بخش ۱۰۷ قانون کپیرایت آمریکا) است. قاضیان تا به امروز به طور گستردهای به نفع شرکتهای هوش مصنوعی رای دادهاند، و دولت ترامپ نیز در یک مذكره رسمی از استفاده اوپنایآی از مواد تحت کپیرایت بدون مجوز دفاع کرده است.
اما اعترافات جدید — بهویژه مقیاس کپیبرداری، جایگزینشدن مستقیم محصول نهایی با اثر اصلی، و تهدید بنیانهای اقتصادی ناشرین — میتواند استدلال استفاده عادلانه را به چالش بکشد، زیرا یکی از چهار عامل آزمون، «تأثیر بر بازار بالقوه اثر اصلی» است.
پرونده همچنان در جریان است و مستندات پایه همچنان مختومه هستند، اما آنچه افشا شده، نقابی از روی محاسبات داخلی دو غول فناوری برداشته که تا کنون در دفاعهای عمومی خود از «استفاده عادلانه» و «تبدیلگرانه بودن» سخن میگفتند.





