یک مدیر ارشد مایکروسافت در یک سند داخلی، فرآیند استخراج داده‌های گسترده برای آموزش مدل‌های هوش مصنوعی را «یک دزدی شگفت‌انگیز با مقیاس بی‌سابقه» و «بزرگترین دزدی نیروی کار در تاریخ بشر» نامید. این اعتراف در تازه‌ترین اسناد از حالت مختومه خارج شده در پرونده شکایت کپی‌رایت نیویورک تایمز علیه اوپن‌ای‌آی و مایکروسافت گنجانده شده و استراتژی دفاعی دو غول فناوری را به چالش کشیده است.

اعترافی که استدلال «استفاده عادلانه» را می‌لرزاند

برنت هکت، مدیر علوم کاربردی مایکروسافت، در یک یادداشت ژانویه ۲۰۲۳ که اکنون در پرونده دادگاه افشا شده، صراحتاً نوشته است: «ما در حال انجام یک دزدی شگفت‌انگیز با مقیاس بی‌سابقه هستیم... بزرگترین دزدی نیروی کار در تاریخ بشر.» این واژگان مستقیماً در تضاد با استدلال «استفاده عادلانه» (fair use) قرار دارد که اوپن‌ای‌آی و مایکروسافت برای توجیه استفاده از محتوای تحت کپی‌رایت بدون مجوز به کار می‌برند.

اسناد افشا شده همچنین نشان می‌دهد رهبران اوپن‌ای‌آی از خطرات وجودی ناشی از محصولات خود برای ناشرین آگاه بوده‌اند. نیک ترلی، رئیس چت‌جی‌پی‌تی، در ارتباطات داخلی ناشرین را در برابر یک «تهدید وجودی» قرار داده و تصریح کرده که چت‌بات‌ها «به طور گسترده جایگزین‌کننده هستند و هرچه بهتر شوند، بیشتر جایگزین‌کننده می‌شوند.» گرگ برکمن، رئیس اجرایی اوپن‌ای‌آی، نیز مدل‌ها را در پوشش اخبار «عالی» توصیف کرده است.

حلقه نابودی: وقتی موتور پاسخ، نرخ کلیک را ۹۳٪ می‌کشد

داده‌های داخلی مایکروسافت فاش می‌کند که کوپایلوت (Copilot)، «موتور پاسخ» شرکت، باعث شده نرخ کلیک ورودی (CTR) برای دامنه نیویورک تایمز تا ۹۳٪ در مقایسه با جستجوی سنتی باینگ کاهش یابد. هکت در یک ارائه داخلی ژانویه ۲۰۲۴ این پدیده را یک «حلقه نابودی» (doom loop) نامیده که «هم عملکرد مدل‌های ما و هم کل وب را به طور همزمان آسیب می‌رساند.»

نمودار کاهش نرخ کلیک ورودی نیویورک تایمز در اثر کوپایلوت مایکروسافت
کاهش ۹۳ درصدی نرخ کلیک نیویورک تایمز بر اثر کوپایلوت؛ مستندات داخلی مایکروسافت

در همان سند هکت می‌خواند: «به طور غیرعادی، یک محصول نهایی بنیان‌های اقتصادی تأمین‌کنندگان ضروری خود را تهدید می‌کند، اما این همان شرایطی است که ما برای کسب‌وکار LLM خود نسبت به زنجیره تأمین محتوای آن ایجاد کرده‌ایم.»

شهادت نادلا: محتوای پیوول‌دار باید مجوز داشته باشد

ساتیا نادلا، مدیر عامل مایکروسافت، در اظهارنامه تحت سوگند در اوایل ۲۰۲۴ تصریح کرد: «هرچه پیوول داشته باشد باید توسط هر کسی که می‌خواهد از آن برای پایه‌گذاری (grounding) یا آموزش استفاده کند، مجوز گرفته شود.» نادلا همچنین تاکید کرد که اگر آگاه می‌شد اوپن‌ای‌آی داده‌های پشت پیوول را اسکرپ و آموزش داده است، حق قراردادی خود را برای الزام بازآموزی مدل‌ها اجرا می‌کرد.

نادلا همچنین زیر سوگند موافقت کرد که گفتگو با چت‌بات‌ها «جایگزین شده... به شما اطلاعات را مستقیماً در پلتفرم هوش مصنوعی می‌دهد در مقایسه با ضرورت مراجعه به منبع اصلی.» این اعتراف مستقیماً پایه استدلال «تبدیل‌گرانه» (transformative use) را در آزمون استفاده عادلانه می‌لرزاند.

مقیاس عظیم کپی‌برداری: از کامون کرال تا پروژه‌های مخفی

اسناد برای اولین بار مقیاس کپی‌برداری را به تفکیک کاشف می‌کنند:

  • مجموعه داده‌های میانی آموزش (mid-training datasets) اوپن‌ای‌آی شامل بیش از ۹۱،۶۹۲ کپی از آثار منتشر شده توسط نیویورک تایمز، دیلی نیوز و مرکز گزارشگری تحقیقاتی است.
  • یک مجموعه داده مشتق شده از کامون کرال (Common Crawl) بیش از ۲ میلیون سند تنها از nytimes.com را در بر می‌گیرد.

پرونده همچنین جزئیات نحوه دستیابی به محتوا را تشریح می‌کند: دور زدن پیوول‌ها بدون شناسایی، استخراج انبوه (mass scraping)، حذف عمدانه اطلاعیه‌های کپی‌رایت از داده‌های آموزشی، و استفاده از ایندکس باینگ. مایکروسافت از طریق طرح‌هایی به نام «پروژه تاکسی» (Project Taxi) و «پروژه مانگو» (Project Mango) داده‌های آموزشی را به اوپن‌ای‌آی منتقل کرده است.

بازی حقوقی: استفاده عادلانه در آستانه چالش جدی

سوال قانونی هسته‌ای این است که آیا آموزش هوش مصنوعی بر روی آثار تحت کپی‌رایت مصداق استفاده عادلانه (بخش ۱۰۷ قانون کپی‌رایت آمریکا) است. قاضیان تا به امروز به طور گسترده‌ای به نفع شرکت‌های هوش مصنوعی رای داده‌اند، و دولت ترامپ نیز در یک مذكره رسمی از استفاده اوپن‌ای‌آی از مواد تحت کپی‌رایت بدون مجوز دفاع کرده است.

اما اعترافات جدید — به‌ویژه مقیاس کپی‌برداری، جایگزین‌شدن مستقیم محصول نهایی با اثر اصلی، و تهدید بنیان‌های اقتصادی ناشرین — می‌تواند استدلال استفاده عادلانه را به چالش بکشد، زیرا یکی از چهار عامل آزمون، «تأثیر بر بازار بالقوه اثر اصلی» است.

پرونده همچنان در جریان است و مستندات پایه همچنان مختومه هستند، اما آنچه افشا شده، نقابی از روی محاسبات داخلی دو غول فناوری برداشته که تا کنون در دفاع‌های عمومی خود از «استفاده عادلانه» و «تبدیل‌گرانه بودن» سخن می‌گفتند.