نیویورک تایمز و دیلی نیوز بار دیگر دست به افشاگری علیه OpenAI زده‌اند. این دو رسانه معتبر ادعا می‌کنند که OpenAI در مورد توانایی خود برای جستجوی داده‌های مکالمات کاربران و مجموعه‌های آموزشی به دنبال آثار دارای حق‌نشر دروغ گفته است. این تازه‌ترین مرحله از یک پرونده حقوقی دو ساله است که در آن OpenAI به نقض قانون حق‌نشر با استفاده از محتوای روزنامه‌ها برای آموزش مدل‌های هوش مصنوعی متهم شده است.

جزئیات جدید از دادگاه

در طول این پرونده، OpenAI همواره استدلال می‌کرد که توانایی جستجوی مجموعه آموزشی خود را ندارد و جستجو در میان میلیون‌ها مکالمه ChatGPT از نظر فنی مشکل‌ساز و ناقض حریم خصوصی کاربران است. اما شواهد جدید نشان می‌دهد که این ادعاها نادرست بوده است.

افشاگری مهندس حریم خصوصی OpenAI

در آوریل گذشته، در یک شهادت تحت سوگند که به دستور دادگاه انجام شد، وینی موناکو، مهندس حریم خصوصی داده OpenAI، فاش کرد که این شرکت از قبل جستجوها و ارزیابی‌های داخلی روی مجموعه آموزشی خود برای یافتن آثار دارای حق‌نشر انجام داده است. این اولین بار است که مشخص می‌شود OpenAI از توانایی فنی لازم برای چنین جستجویی برخوردار بوده است.

پروژه زرافه و فیلتر Bloom

شهادت موناکو همچنین نشان می‌دهد که OpenAI پیش از طرح شکایت توسط نیویورک تایمز، پایگاه داده‌ای از حدود ۷۸ میلیون مکالمه ناشناس‌سازی‌شده ChatGPT ایجاد کرده بود. این پایگاه برای اندازه‌گیری میزان نقض آثار دیگران استفاده می‌شد. علاوه بر این، OpenAI ابزاری به نام پروژه زرافه با فیلتر Bloom پیاده‌سازی کرد که بازتولید محتوا در خروجی‌ها را تشخیص و ثبت می‌کرد. این ابزار مدت کوتاهی پس از طرح دعوا فعال شد.

دستکاری در فرایند کشف شواهد

شاکیان در ابتدا خواستار نمونه‌ای از ۱۲۰ میلیون گزارش چت شدند، اما OpenAI این تعداد را به ۲۰ میلیون کاهش داد. هنگامی که این نمونه در دسامبر گذشته به دادگاه ارائه شد، قاضی آن را به دلیل ویرایش‌های گسترده «غیرقابل استفاده» خواند. به گفته شاکیان، OpenAI همچنین میلیاردها خروجی ChatGPT را پس از طرح دعوا حذف کرد که نقض مستقیم دستور حفظ شواهد بود.

«اگر OpenAI واقعاً باور داشت که کپی‌کردن روزنامه‌نگاری موکلان ما منصفانه و قانونی است، حقیقت انجام آن را پنهان نمی‌کرد.» - ایان بی. کرازبی، وکیل شاکیان

درخواست‌های شاکیان از دادگاه

  • ممانعت از استفاده OpenAI از نمونه ۲۰ میلیونی به دلیل غیرقابل اعتماد بودن
  • پذیرش این واقعیت که گزارش‌های ChatGPT بازتولید عمده محتوای شاکیان را نشان می‌دهد
  • جلوگیری از استدلال OpenAI مبنی بر عدم وجود بازتولید عمده در نمونه ارائه‌شده
  • الزام OpenAI به پرداخت هزینه‌های قانونی شاکیان برای پیگیری شواهد

واکنش OpenAI

درو پوساتری، سخنگوی OpenAI، این اتهامات را «آشکارا نادرست» خواند و تایمز را به تلاش برای نقض حریم خصوصی کاربران متهم کرد. او گفت: «در حالی که پرونده تایمز ضعیف می‌شود و آنها مجبور به کنار گذاشتن ادعاهای خود شده‌اند، با تلاش‌های خود برای نقض حریم خصوصی افرادی که هیچ ربطی به این پرونده ندارند ادامه می‌دهند. ما همچنان از حریم خصوصی کاربران خود و اصول دیرینه استفاده منصفانه دفاع خواهیم کرد.»

این پرونده یکی از مهم‌ترین دعاوی حقوقی در حوزه OpenAI و ChatGPT محسوب می‌شود و می‌تواند تأثیر عمیقی بر آینده مدل‌های زبانی بزرگ و قانون حق‌نشر در عصر هوش مصنوعی بگذارد. فعالان صنعت و حقوقدانان از نزدیک پیگیر نتیجه این نبرد حقوقی هستند.