نیویورکتایمز و دیلینیوز بار دیگر دست به افشاگری علیه OpenAI زدهاند. این دو رسانهٔ معتبر ادعا میکنند که OpenAI در موردِ تواناییِ خود برای جستوجوی دادههای مکالماتِ کاربران و مجموعههای آموزشی در پیِ آثارِ دارایِ حقنشر دروغ گفته است. این تازهترین مرحله از یک پروندهٔ دوساله است که در آن OpenAI به نقضِ قانونِ حقنشر با استفاده از محتوای روزنامهها برای آموزشِ مدلهای هوشِ مصنوعی متهم شده است.
جزئیاتِ جدید از دادگاه
در طولِ این پرونده OpenAI همواره استدلال میکرد که تواناییٔ جستوجوی مجموعهٔ آموزشیِ خود را ندارد و جستوجو در میانِ میلیونها مکالمهٔ ChatGPT را از نظرِ فنی مشکلساز و ناقضِ حریمِ کاربران میدانست. اما شواهدِ جدید نشان میدهد که این ادعاها نادرست بودهاند.
افشاگریِ مهندسِ حریمخصوصیِ OpenAI
در آوریلِ گذشته، در یک شهادتِ تحتِ سوگند که به دستورِ دادگاه انجام شد، وینی موناکو، مهندسِ حریمخصوصیِ دادهٔ OpenAI، فاش کرد که این شرکت از پیش جستوجوها و ارزیابیهای داخلی روی مجموعهٔ آموزشیِ خود برای یافتنِ آثارِ دارایِ حقنشر انجام داده است. این اولینبار است که روشن میشود OpenAI از تواناییِ فنیِ لازم برای چنین جستوجویی برخوردار بوده است.
پروژهٔ زرافه و فیلترِ Bloom
شهادتِ موناکو همچنین نشان میدهد که OpenAI پیشاز طرحِ شکایت توسطِ نیویورکتایمز، پایگاهِ دادهای از حدودِ ۷۸میلیون مکالمهٔ ناشناسسازیشدهٔ ChatGPT ایجاد کردهبود. این پایگاه برای اندازهگیریِ میزانِ نقضِ آثارِ دیگران استفاده میشد. علاوهبر این، OpenAI ابزاری به نامِ پروژهٔ زرافه با فیلترِ Bloom پیادهسازی کرد که بازتولیدِ محتوا در خروجیها را تشخیص و ثبت میکرد. این ابزار مدتِ کوتاهی پس از طرحِ دعوا فعال شد.
دستکاری در فرایندِ کشفِ شواهد
شاکیان در ابتدا خواستارِ نمونهای از ۱۲۰میلیون گزارشِ چت شدند، اما OpenAI این تعداد را به ۲۰میلیون کاهش داد. هنگامی که این نمونه در دسامبرِ گذشته به دادگاه ارائه شد، قاضی آن را بهدلیلِ ویرایشهای گسترده غیرقابلاستفاده خواند. به گفتهٔ شاکیان، OpenAI همچنین میلیاردها خروجیِ ChatGPT را پس از طرحِ دعوا حذف کرد که نقضِ مستقیمِ دستورِ حفظِ شواهد بود.
«اگر OpenAI واقعاً باور داشت که کپیکردنِ روزنامهنگاریِ موکلانِ ما منصفانه و قانونی است، حقیقتِ انجامِ آن را پنهاننمیکرد.» — ایان بی. کرازبی، وکیلِ شاکیان
درخواستهایِ شاکیان از دادگاه
- ممانعت از استفادهٔ OpenAI از نمونهٔ ۲۰میلیونی بهدلیلِ غیرقابلاعتماد بودن
- پذیرشِ این واقعیت که گزارشهای ChatGPT بازتولیدِ عمدهٔ محتوای شاکیان را نشان میدهد
- جلوگیری از استدلالِ OpenAI مبنیبرِ عدمِ وجودِ بازتولیدِ عمده در نمونهٔ ارائهشده
- الزامِ OpenAI به پرداختِ هزینههایِ قانونیِ شاکیان برای پیگیریِ شواهد
واکنشِ OpenAI
درو پوساتِری، سخنگویِ OpenAI، این اتهامات را «آشکاراً نادرست» خواند و نیویورکتایمز را به تلاش برای نقضِ حریمِ خصوصیٔ کاربران متهم کرد. او گفت: «در حالیکه پروندهٔ تایمز ضعیف میشود و آنها مجبور به کنار گذاشتنِ ادعاهایِ خود شدهاند، با تلاشهایِ خود برای نقضِ حریمِ خصوصیِ افرادی که هیچ ربطی به این پرونده ندارند ادامه میدهند. ما همچنان از حریمِ خصوصیِ کاربرانِ خود و اصولِ دیرینهٔ استفادهٔ منصفانه دفاع خواهیم کرد.»
این پرونده یکی از مهمترین دعاویِ حقوقی در حوزهٔ OpenAI و ChatGPT محسوب میشود و میتواند تأثیرِ عمیقی بر آیندهٔ مدلهایِ زبانیِ بزرگ و قانونِ حقنشر در عصرِ هوشِ مصنوعی بگذارد. فعالانِ صنعت و حقوقدانان از نزدیک پیگیرِ نتیجهٔ این نبردِ حقوقی هستند.





