هسته اصلی اختلاف: دادههای آموزشی و چالش جمعآوری اطلاعات
شکایت نیویورکتایمز علیه OpenAI و مایکروسافت در دسامبر 2023، نقطه عطفی در تقابل رسانههای سنتی با توسعهدهندگان فناوری به شمار میرود. این پرونده که دقیقاً بر چگونگی آموزش مدلهای زبانی بزرگ تمرکز دارد، قوانین مالکیت فکری را با واقعیتهای جدید هوش مصنوعی مولد میسنجد. سرنوشت این دادخواست تنها آرشیو خبری تایمز را مشخص نمیکند، بلکه الگویی بنیادین برای کل صنعت تولید محتوا، پژوهشهای علمی و شرکتهای زیستفناوری رقم خواهد زد.
پس از پایان بینتیجهٔ مذاکرات برای دریافت مجوز استفاده از مقالات پولی، نیویورکتایمز ادعا میکند میلیونها خبر آن بدون دریافت هیچگونه حقوقی، در مخازن آموزش GPT هضم شده است. مدلهای پیشرفته فعلی بر مجموعهدادهای به وسعت 3.7 میلیارد صفحه متن آموزش میبینند. شرکت سازنده چتبات پاسخ تندی در اوایل ژانویه صادر کرد و با تأکید بر ماهیت محاسبهای فرآیند، از این اقدام بهعنوان مصداق استفاده منصفانه طرح دفاع کرد.
روزنامه برای اثبات ادعای خود بر دو پایه تأکید ویژهای دارد:
- حفظ و بازتولید محتوا: مدلهای زبانی گاهی بخشهایی از دادههای آموزشی خود را حفظ میکنند و میتوانند بازتولیدهایی تقریباً کلمهبهکلمه ارائه دهند. شکایت نمونهای را ارائه میدهد که در آن GPT-4 با دستوردهی حداقلی، مقالهای از 2019 را بازپژوهی کرده است. OpenAI این خروجیها را اشکالی نادر میداند که تیمش در تلاش برای رفع آن است.
- دور زدن دیوار پرداخت: مدلها میتوانند نتایجی تولید کنند که محتوای بیانی بیشتری را نسبت به آنچه معمولاً در جستوجوی آنلاین نمایش داده میشود بازتولید میکنند. این ویژگی عملاً خوانندگان را قادر میسازد عمق محتوای خبری را بدون مراجعه مستقیم به وبسایت روزنامه استخراج کنند.
میدان نبرد حقوقی: تفسیر استفاده منصفانه در عصر الگوریتمها
سرنوشت نهایی این پرونده مشروط به قرائت قضات از دکترین استفاده منصفانه در حقوق ایالات متحده خواهد بود. این اصل قانونی، استفاده محدود از آثار دارای حق نشر را در صورتی مشروع میداند که به شدت تحولآفرین باشد. تیم حقوقی OpenAI و مایکروسافت با تکیه بر پیشینه پروندههای نمایهسازی گوگل، استدلال میکنند که آموزش شبکههای عصبی با تکثیر کلمهبهکلمه تفاوت بنیادین دارد و صرفاً بر شناخت احتمالی الگوها استوار است. همچنین تأکید میکنند که در نبود موانع فنی، در دسترس بودن عمومی محتوا به معنای مجوز نامحدود استفاده نیست.
از سوی دیگر، نیویورکتایمز با تمرکز بر آسیبپذیری بازار اشتراک، مخالفت میکند. استراتژی روزنامه نشان میدهد اگر خلاصههای خودکار و بازنویسیهای هوش مصنوعی جایگزین خوانش متن کامل شوند، درآمد حاصل از تبلیغات و اشتراکها به سرعت سقوط خواهد کرد. صنعت هوش مصنوعی اکنون منتظر است ببیند آیا دادگاه بر حقوق اقتصادی ناشران اولویت میدهد یا بر لزوم جلوگیری از بنبستهای نوآوری در مدلهای زبانی.
تأثیرات فراگیر بر اکوسیستم فناوری و رسانه
فراتر از مرزهای قضایی، این پرونده سیگنالهای واضحی برای سایر بخشهای صنعت میفرستد. توسعهدهندگان هوش مصنوعی مجبور خواهند بود سیاستهای جمعآوری دادهها را بازنگری کنند یا مدلهای جدیدی را با تمرکز بر مجموعهدادههای کاملاً مجاز بسازند. در عین حال، انتشارات علمی و شرکتهای حوزه سلامت نیز با دقت منتظر رأی نهایی هستند. الگویی که برای حفاظت از محتوای خبری تثبیت شود، میتواند چرخه انتشار مقالات تخصصی و کارهای تحقیقاتی را نیز دستخوش تحول کند و استانداردهای جدیدی برای دیباگ حقوقی سیستمهای هوشمند تعریف نماید.
دیدگاه آیندهنگر
دادگاهها در تلاشند تعادلی میان تسریع نوآوری در مدلهای زبانی و حفظ انگیزه اقتصادی تولید محتوای انسانی پیدا کنند. نتیجه این نبرد ساختار فعلی رایجترین چتباتها را دستخوش تغییر خواهد کرد و مرزهای جدیدی برای همکاری میان خبرنگاران و الگوریتمهای پیشبینانه ترسیم میکند. آیندهٔ هوش مصنوعی به زودی مشخص میشود که آیا فناوری باید برای تغذیهٔ دادهها بجنگد یا با شریک شدن منافع، بستر همکاری پایدار با منابع خبری و دانشگاهی را به وجود میآورد. این پرونده تنها آغاز مسیر است و نشان میدهد که در عصر هوش مصنوعی مولد، تعریف مالکیت معنوی نیازمند بازتعریفی عمیق و پویا است.





