نیویورک‌تایمز و دیلی‌نیوز بار دیگر دست به افشاگری علیه OpenAI زده‌اند. این دو رسانهٔ معتبر ادعا می‌کنند که OpenAI در موردِ تواناییِ خود برای جست‌وجوی داده‌های مکالماتِ کاربران و مجموعه‌های آموزشی در پیِ آثارِ دارایِ حق‌نشر دروغ گفته است. این تازه‌ترین مرحله از یک پروندهٔ دو‌ساله است که در آن OpenAI به نقضِ قانونِ حق‌نشر با استفاده از محتوای روزنامه‌ها برای آموزشِ مدل‌های هوشِ مصنوعی متهم شده است.

جزئیاتِ جدید از دادگاه

در طولِ این پرونده OpenAI همواره استدلال می‌کرد که تواناییٔ جست‌وجوی مجموعهٔ آموزشیِ خود را ندارد و جست‌وجو در میانِ میلیون‌ها مکالمهٔ ChatGPT را از نظرِ فنی مشکل‌ساز و ناقضِ حریمِ کاربران می‌دانست. اما شواهدِ جدید نشان می‌دهد که این ادعاها نادرست بوده‌اند.

افشاگریِ مهندسِ حریم‌خصوصیِ OpenAI

در آوریلِ گذشته، در یک شهادتِ تحتِ سوگند که به دستورِ دادگاه انجام شد، وینی موناکو، مهندسِ حریم‌خصوصیِ دادهٔ OpenAI، فاش کرد که این شرکت از پیش جست‌وجوها و ارزیابی‌های داخلی روی مجموعهٔ آموزشیِ خود برای یافتنِ آثارِ دارایِ حق‌نشر انجام داده است. این اولین‌بار است که روشن می‌شود OpenAI از تواناییِ فنیِ لازم برای چنین جست‌وجویی برخوردار بوده است.

پروژهٔ زرافه و فیلترِ Bloom

شهادتِ موناکو همچنین نشان می‌دهد که OpenAI پیش‌از طرحِ شکایت توسطِ نیویورک‌تایمز، پایگاهِ داده‌ای از حدودِ ۷۸‌میلیون مکالمهٔ ناشناس‌سازی‌شدهٔ ChatGPT ایجاد کرده‌بود. این پایگاه برای اندازه‌گیریِ میزانِ نقضِ آثارِ دیگران استفاده می‌شد. علاوه‌بر این، OpenAI ابزاری به نامِ پروژهٔ زرافه با فیلترِ Bloom پیاده‌سازی کرد که بازتولیدِ محتوا در خروجی‌ها را تشخیص و ثبت می‌کرد. این ابزار مدتِ کوتاهی پس از طرحِ دعوا فعال شد.

دستکاری در فرایندِ کشفِ شواهد

شاکیان در ابتدا خواستارِ نمونه‌ای از ۱۲۰‌میلیون گزارشِ چت شدند، اما OpenAI این تعداد را به ۲۰‌میلیون کاهش داد. هنگامی که این نمونه در دسامبرِ گذشته به دادگاه ارائه شد، قاضی آن را به‌دلیلِ ویرایش‌های گسترده غیرقابل‌استفاده خواند. به گفتهٔ شاکیان، OpenAI همچنین میلیاردها خروجیِ ChatGPT را پس از طرحِ دعوا حذف کرد که نقضِ مستقیمِ دستورِ حفظِ شواهد بود.

«اگر OpenAI واقعاً باور داشت که کپی‌کردنِ روزنامه‌نگاریِ موکلانِ ما منصفانه و قانونی است، حقیقتِ انجامِ آن را پنهان‌نمی‌کرد.» — ایان بی. کرازبی، وکیلِ شاکیان

درخواست‌هایِ شاکیان از دادگاه

  • ممانعت از استفادهٔ OpenAI از نمونهٔ ۲۰‌میلیونی به‌دلیلِ غیرقابل‌اعتماد بودن
  • پذیرشِ این واقعیت که گزارش‌های ChatGPT بازتولیدِ عمدهٔ محتوای شاکیان را نشان می‌دهد
  • جلوگیری از استدلالِ OpenAI مبنی‌برِ عدمِ وجودِ بازتولیدِ عمده در نمونهٔ ارائه‌شده
  • الزامِ OpenAI به پرداختِ هزینه‌هایِ قانونیِ شاکیان برای پیگیریِ شواهد

واکنشِ OpenAI

درو پوساتِری، سخنگویِ OpenAI، این اتهامات را «آشکاراً نادرست» خواند و نیویورک‌تایمز را به تلاش برای نقضِ حریمِ خصوصیٔ کاربران متهم کرد. او گفت: «در حالی‌که پروندهٔ تایمز ضعیف می‌شود و آن‌ها مجبور به کنار گذاشتنِ ادعاهایِ خود شده‌اند، با تلاش‌هایِ خود برای نقضِ حریمِ خصوصیِ افرادی که هیچ ربطی به این پرونده ندارند ادامه می‌دهند. ما همچنان از حریمِ خصوصیِ کاربرانِ خود و اصولِ دیرینهٔ استفادهٔ منصفانه دفاع خواهیم کرد.»

این پرونده یکی از مهم‌ترین دعاویِ حقوقی در حوزهٔ OpenAI و ChatGPT محسوب می‌شود و می‌تواند تأثیرِ عمیقی بر آیندهٔ مدل‌هایِ زبانیِ بزرگ و قانونِ حق‌نشر در عصرِ هوشِ مصنوعی بگذارد. فعالانِ صنعت و حقوق‌دانان از نزدیک پیگیرِ نتیجهٔ این نبردِ حقوقی هستند.