نتفلیکس با معرفی GenRec نشان داد یک مدل زبانی می‌تواند به‌جای منطق پیچیدهٔ دست‌ساز سیستم‌های توصیه‌گر عمل کند: مدلی که با حجم بسیار کمتر دادهٔ برچسب‌خورده، کیفیت رتبه‌بندی را ارتقا می‌دهد.

چطور GenRec کار می‌کند

رویکرد GenRec در دو مرحله اجرا می‌شود:

  • فاز اول: فاین‌تیون یک مدل پایهٔ اوپن‌ویت روی داده‌های داخلی نتفلیکس برای آشنایی با کاتالوگ و الگوهای رفتاری کاربران.
  • فاز دوم: فاین‌تیون تخصصی‌تر برای تبدیل مدل به یک رتبه‌بندی‌کنندهٔ توصیه که با فرکانس بیشتری به‌روزرسانی می‌شود تا عناوین جدید و تغییر سلیقه‌ها را منعکس کند.

تبدیل تاریخچهٔ تماشا به متن

به‌جای مهندسی هزاران ویژگی عددی و برداری، رویدادهای تعامل کاربر—پخش، مدت تماشا، پسند/عدم‌پسند، افزودن به لیست و رها کردن تماشا—به متن تبدیل شده و به‌صورت یک دیالوگ بین کاربر و سیستم به مدل داده می‌شوند. این رویکرد به مدل اجازه می‌دهد الگوهایی مانند گرایش ژانری یا تغییر علاقه را ضمنی بیاموزد، بدون نیاز به استخراج دستی ویژگی‌ها.

نمونه‌ای از رابط توصیه‌گر نتفلیکس و نمایش محتوا

کل تاریخچهٔ تعامل هر کاربر در پنجرهٔ کانتکست قرار نمی‌گیرد؛ بنابراین نتفلیکس ورودی‌ها را فیلتر و خلاصه می‌کند: رویدادهای با سیگنال قوی (مثلاً جلسات تماشای طولانی) حفظ می‌شوند، ضربه‌های کوتاه و اسکرول سریع حذف می‌شوند و نشست‌های binge به‌صورت فشرده نمایش داده می‌شوند.

رفع چالش‌های مدل‌های زبان برای توصیه‌گری

مدل‌های زبان خارج از جعبه برای کاربرد توصیه‌گری چند مشکل اساسی دارند، از جمله:

  • تمایل به پیشنهاد محتوای بسیار محبوب و نادیده گرفتن تنوع
  • هذیان‌سازی و تولید عناوین غیرواقعی
  • نادیده گرفتن محدودیت‌ها و قوانین تجاری کاتالوگ

راهکارهای عملی نتفلیکس برای کاهش این مشکلات عبارت‌اند از:

  • اضافه کردن یک مولفهٔ جدا که فقط روی آیتم‌های واقعی کاتالوگ امتیاز می‌دهد تا تولیدِ عناوین غیرموجود جلوگیری شود.
  • اجرای حالت امتیازدهی یک‌گذر روی vLLM تا مدل ورودی را یک‌بار بخواند و همهٔ نامزدها را بدون تولید متن در همان گذر امتیازدهی کند؛ روشی که هزینه‌ها را کنترل‌پذیر نگه می‌دارد.

نتایج آزمایش‌ها

آزمایش‌های آفلاین نشان داد GenRec حدود 1.6٪ بهتر از سیستم تولیدی قدیمی در کیفیت رتبه‌بندی عمل می‌کند و برای رسیدن به آن به تقریباً 40 برابر دادهٔ برچسب‌خوردهٔ کمتر نیاز داشت. در آزمایش آنلاین A/B چهار هفته‌ای روی نزدیک به 10٪ ترافیک، یک معیار کوتاه‌مدت در صفحهٔ اصلی 0.115٪ و یک معیار بلندمدت هسته‌ای 0.006٪ افزایش یافتند؛ نتفلیکس این بهبودها را از نظر آماری معنادار گزارش کرده است.

بخش‌هایی از معماری GenRec و جریان داده

فاین‌تیون اختصاصی در فاز دوم بین 35٪ تا 50٪ به عملکرد مدل پایه اضافه می‌کند؛ اما اگر مدل پایه تنها دو هفته قدیمی شود، این فاصله تا حدود 80٪ افزایش می‌یابد—نشانه‌ای از نیاز به به‌روزرسانی مکرر مدل‌های توصیه‌گر.

تغییر پارادایم: از مهندسی ویژگی به مهندسی کانتکست

GenRec نشان می‌دهد روندی در حال شکل‌گیری است: به‌جای طراحی معماری‌های جداگانه برای هر وظیفهٔ توصیه‌گری، یک مدل زبانی عمومی می‌تواند چندین وظیفه را پوشش دهد. تمرکز از تولید ویژگی‌های بیشتر به طراحی دقیق ورودی‌ها و انتخاب سیگنال‌های مناسب برای کانتکست منتقل شده است. زیرساخت‌ها نیز به سمت سرورهای GPU و ابزارهای مرتبط با عملیات مدل‌های زبانی حرکت می‌کنند.

نمایی از داده‌های تعامل کاربران برای آموزش مدل

محدودیت‌ها و نکات عملیاتی

مهم‌ترین چالش‌ها برای به‌کارگیری GenRec در مقیاس عبارت‌اند از:

  • کنترل سوگیری به سمت محتوای محبوب و حفظ تنوع توصیه‌ها
  • جلوگیری از هذیان‌سازی و تولید آیتم‌های غیرواقعی
  • رعایت قوانین کسب‌وکار و محدودیت‌های کاتالوگ
  • پیاده‌سازی سازوکارهای پویا برای به‌روزرسانی سریع مدل پایه

برای منابع فنی بیشتر می‌توان به Netflix Tech Blog و مخزن vLLM مراجعه کرد.

چشم‌انداز

GenRec مسیر استفاده از قابلیات عمومی مدل‌های زبانی در حوزهٔ توصیه‌گری را روشن کرده است. این رویکرد می‌تواند نیاز به تیم‌های گستردهٔ مهندسی ویژگی را کاهش دهد و تمرکز را به مهندسی کانتکست و توسعهٔ زیرساخت‌های LLM منتقل کند؛ اما پیاده‌سازی کامل مستلزم محافظت در برابر هذیان، رعایت قوانین تجاری و مکانیزم‌های به‌روزرسانی مداوم خواهد بود.