نتفلیکس با معرفی GenRec نشان داد یک مدل زبانی میتواند بهجای منطق پیچیدهٔ دستساز سیستمهای توصیهگر عمل کند: مدلی که با حجم بسیار کمتر دادهٔ برچسبخورده، کیفیت رتبهبندی را ارتقا میدهد.
چطور GenRec کار میکند
رویکرد GenRec در دو مرحله اجرا میشود:
- فاز اول: فاینتیون یک مدل پایهٔ اوپنویت روی دادههای داخلی نتفلیکس برای آشنایی با کاتالوگ و الگوهای رفتاری کاربران.
- فاز دوم: فاینتیون تخصصیتر برای تبدیل مدل به یک رتبهبندیکنندهٔ توصیه که با فرکانس بیشتری بهروزرسانی میشود تا عناوین جدید و تغییر سلیقهها را منعکس کند.
تبدیل تاریخچهٔ تماشا به متن
بهجای مهندسی هزاران ویژگی عددی و برداری، رویدادهای تعامل کاربر—پخش، مدت تماشا، پسند/عدمپسند، افزودن به لیست و رها کردن تماشا—به متن تبدیل شده و بهصورت یک دیالوگ بین کاربر و سیستم به مدل داده میشوند. این رویکرد به مدل اجازه میدهد الگوهایی مانند گرایش ژانری یا تغییر علاقه را ضمنی بیاموزد، بدون نیاز به استخراج دستی ویژگیها.
کل تاریخچهٔ تعامل هر کاربر در پنجرهٔ کانتکست قرار نمیگیرد؛ بنابراین نتفلیکس ورودیها را فیلتر و خلاصه میکند: رویدادهای با سیگنال قوی (مثلاً جلسات تماشای طولانی) حفظ میشوند، ضربههای کوتاه و اسکرول سریع حذف میشوند و نشستهای binge بهصورت فشرده نمایش داده میشوند.
رفع چالشهای مدلهای زبان برای توصیهگری
مدلهای زبان خارج از جعبه برای کاربرد توصیهگری چند مشکل اساسی دارند، از جمله:
- تمایل به پیشنهاد محتوای بسیار محبوب و نادیده گرفتن تنوع
- هذیانسازی و تولید عناوین غیرواقعی
- نادیده گرفتن محدودیتها و قوانین تجاری کاتالوگ
راهکارهای عملی نتفلیکس برای کاهش این مشکلات عبارتاند از:
- اضافه کردن یک مولفهٔ جدا که فقط روی آیتمهای واقعی کاتالوگ امتیاز میدهد تا تولیدِ عناوین غیرموجود جلوگیری شود.
- اجرای حالت امتیازدهی یکگذر روی vLLM تا مدل ورودی را یکبار بخواند و همهٔ نامزدها را بدون تولید متن در همان گذر امتیازدهی کند؛ روشی که هزینهها را کنترلپذیر نگه میدارد.
نتایج آزمایشها
آزمایشهای آفلاین نشان داد GenRec حدود 1.6٪ بهتر از سیستم تولیدی قدیمی در کیفیت رتبهبندی عمل میکند و برای رسیدن به آن به تقریباً 40 برابر دادهٔ برچسبخوردهٔ کمتر نیاز داشت. در آزمایش آنلاین A/B چهار هفتهای روی نزدیک به 10٪ ترافیک، یک معیار کوتاهمدت در صفحهٔ اصلی 0.115٪ و یک معیار بلندمدت هستهای 0.006٪ افزایش یافتند؛ نتفلیکس این بهبودها را از نظر آماری معنادار گزارش کرده است.
فاینتیون اختصاصی در فاز دوم بین 35٪ تا 50٪ به عملکرد مدل پایه اضافه میکند؛ اما اگر مدل پایه تنها دو هفته قدیمی شود، این فاصله تا حدود 80٪ افزایش مییابد—نشانهای از نیاز به بهروزرسانی مکرر مدلهای توصیهگر.
تغییر پارادایم: از مهندسی ویژگی به مهندسی کانتکست
GenRec نشان میدهد روندی در حال شکلگیری است: بهجای طراحی معماریهای جداگانه برای هر وظیفهٔ توصیهگری، یک مدل زبانی عمومی میتواند چندین وظیفه را پوشش دهد. تمرکز از تولید ویژگیهای بیشتر به طراحی دقیق ورودیها و انتخاب سیگنالهای مناسب برای کانتکست منتقل شده است. زیرساختها نیز به سمت سرورهای GPU و ابزارهای مرتبط با عملیات مدلهای زبانی حرکت میکنند.
محدودیتها و نکات عملیاتی
مهمترین چالشها برای بهکارگیری GenRec در مقیاس عبارتاند از:
- کنترل سوگیری به سمت محتوای محبوب و حفظ تنوع توصیهها
- جلوگیری از هذیانسازی و تولید آیتمهای غیرواقعی
- رعایت قوانین کسبوکار و محدودیتهای کاتالوگ
- پیادهسازی سازوکارهای پویا برای بهروزرسانی سریع مدل پایه
برای منابع فنی بیشتر میتوان به Netflix Tech Blog و مخزن vLLM مراجعه کرد.
چشمانداز
GenRec مسیر استفاده از قابلیات عمومی مدلهای زبانی در حوزهٔ توصیهگری را روشن کرده است. این رویکرد میتواند نیاز به تیمهای گستردهٔ مهندسی ویژگی را کاهش دهد و تمرکز را به مهندسی کانتکست و توسعهٔ زیرساختهای LLM منتقل کند؛ اما پیادهسازی کامل مستلزم محافظت در برابر هذیان، رعایت قوانین تجاری و مکانیزمهای بهروزرسانی مداوم خواهد بود.





