نیویورک تایمز و دیلی نیوز بار دیگر دست به افشاگری علیه OpenAI زدهاند. این دو رسانه معتبر ادعا میکنند که OpenAI در مورد توانایی خود برای جستجوی دادههای مکالمات کاربران و مجموعههای آموزشی به دنبال آثار دارای حقنشر دروغ گفته است. این تازهترین مرحله از یک پرونده حقوقی دو ساله است که در آن OpenAI به نقض قانون حقنشر با استفاده از محتوای روزنامهها برای آموزش مدلهای هوش مصنوعی متهم شده است.
جزئیات جدید از دادگاه
در طول این پرونده، OpenAI همواره استدلال میکرد که توانایی جستجوی مجموعه آموزشی خود را ندارد و جستجو در میان میلیونها مکالمه ChatGPT از نظر فنی مشکلساز و ناقض حریم خصوصی کاربران است. اما شواهد جدید نشان میدهد که این ادعاها نادرست بوده است.
افشاگری مهندس حریم خصوصی OpenAI
در آوریل گذشته، در یک شهادت تحت سوگند که به دستور دادگاه انجام شد، وینی موناکو، مهندس حریم خصوصی داده OpenAI، فاش کرد که این شرکت از قبل جستجوها و ارزیابیهای داخلی روی مجموعه آموزشی خود برای یافتن آثار دارای حقنشر انجام داده است. این اولین بار است که مشخص میشود OpenAI از توانایی فنی لازم برای چنین جستجویی برخوردار بوده است.
پروژه زرافه و فیلتر Bloom
شهادت موناکو همچنین نشان میدهد که OpenAI پیش از طرح شکایت توسط نیویورک تایمز، پایگاه دادهای از حدود ۷۸ میلیون مکالمه ناشناسسازیشده ChatGPT ایجاد کرده بود. این پایگاه برای اندازهگیری میزان نقض آثار دیگران استفاده میشد. علاوه بر این، OpenAI ابزاری به نام پروژه زرافه با فیلتر Bloom پیادهسازی کرد که بازتولید محتوا در خروجیها را تشخیص و ثبت میکرد. این ابزار مدت کوتاهی پس از طرح دعوا فعال شد.
دستکاری در فرایند کشف شواهد
شاکیان در ابتدا خواستار نمونهای از ۱۲۰ میلیون گزارش چت شدند، اما OpenAI این تعداد را به ۲۰ میلیون کاهش داد. هنگامی که این نمونه در دسامبر گذشته به دادگاه ارائه شد، قاضی آن را به دلیل ویرایشهای گسترده «غیرقابل استفاده» خواند. به گفته شاکیان، OpenAI همچنین میلیاردها خروجی ChatGPT را پس از طرح دعوا حذف کرد که نقض مستقیم دستور حفظ شواهد بود.
«اگر OpenAI واقعاً باور داشت که کپیکردن روزنامهنگاری موکلان ما منصفانه و قانونی است، حقیقت انجام آن را پنهان نمیکرد.» - ایان بی. کرازبی، وکیل شاکیان
درخواستهای شاکیان از دادگاه
- ممانعت از استفاده OpenAI از نمونه ۲۰ میلیونی به دلیل غیرقابل اعتماد بودن
- پذیرش این واقعیت که گزارشهای ChatGPT بازتولید عمده محتوای شاکیان را نشان میدهد
- جلوگیری از استدلال OpenAI مبنی بر عدم وجود بازتولید عمده در نمونه ارائهشده
- الزام OpenAI به پرداخت هزینههای قانونی شاکیان برای پیگیری شواهد
واکنش OpenAI
درو پوساتری، سخنگوی OpenAI، این اتهامات را «آشکارا نادرست» خواند و تایمز را به تلاش برای نقض حریم خصوصی کاربران متهم کرد. او گفت: «در حالی که پرونده تایمز ضعیف میشود و آنها مجبور به کنار گذاشتن ادعاهای خود شدهاند، با تلاشهای خود برای نقض حریم خصوصی افرادی که هیچ ربطی به این پرونده ندارند ادامه میدهند. ما همچنان از حریم خصوصی کاربران خود و اصول دیرینه استفاده منصفانه دفاع خواهیم کرد.»
این پرونده یکی از مهمترین دعاوی حقوقی در حوزه OpenAI و ChatGPT محسوب میشود و میتواند تأثیر عمیقی بر آینده مدلهای زبانی بزرگ و قانون حقنشر در عصر هوش مصنوعی بگذارد. فعالان صنعت و حقوقدانان از نزدیک پیگیر نتیجه این نبرد حقوقی هستند.





