Swiggy پیش از اولین سفارش، ارزش بلندمدت مشتری را پیش‌بینی می‌کند

Swiggy مدلی داخلی برای پيش‌بيني ارزش طول عمر مشتری (pLTV) ساخته که پیش از ثبت اولین سفارش سیگنال‌های عملی برای بهینه‌سازی پیشنهادهای تبلیغاتی تولید می‌کند. هدف، تمرکز بر ارزش بلندمدت مشتریان به‌جای معیارهای تبدیل کوتاه‌مدت است تا تخصیص بودجه و اولویت‌بندی تبلیغات به سمت کاربران با پتانسیل بالاتر هدایت شود.

چالش‌های اصلی

دو چالش کلیدی وجود داشت: اول، سیگنال‌های اولیه بسیار پراکنده و کم‌اطمینان‌اند؛ دوم، توزیع هدف دارای دُم طولانی است؛ سهم قابل‌توجهی از کاربران جدید در ۳۰ روز اول هیچ سفارش ثبت نمی‌کنند و گروه کوچکی ارزش بسیار بالاتری تولید می‌کنند. مدل باید قادر به تمایز بین کاربرانی باشد که در ابتدا رفتار مشابهی دارند اما در طول زمان مسیرهای متفاوتی می‌پیمایند.

بیش از ۳۵۰ ویژگیِ استخراج‌شده قبل از اولین سفارش

ویژگی‌ها از چند حوزه استخراج شده‌اند تا مشکل «شروع سرد» برطرف شود. دسته‌بندی اصلی ویژگی‌ها عبارت است از:

  • کانال جذب و منبع تراکنش
  • نوع دستگاه، سیستم‌عامل و سیگنال‌های مرتبط با تقلب
  • ویژگی‌های رفتاری و جغرافیایی
  • سابقهٔ شکایت و تعاملات سرویس مشتری
  • تمایل به دسته‌های Instamart و الگوهای سفارش‌گذاری
  • شیوه‌های پرداخت و شاخص‌های اقتصادی-اجتماعی

تمام این ویژگی‌ها از داده‌های موجود پیش از اولین سفارش استخراج شدند تا مدل بتواند بلافاصله پس از جذب کاربر، تصمیمات تبلیغاتی را هدایت کند.

ویژگی‌های استخراج‌شده برای مدل pLTV Swiggy

معماری: MLP چندوظیفه‌ای ساده و مؤثر

به‌جای پیچیده‌سازی معماری، تیم از یک پرسپترون چندلایه (MLP) با سه لایهٔ پنهان مشترک استفاده کرد که نمایه‌های عمومی برای چند وظیفه یاد می‌گیرند. سپس سرهای اختصاصی برای دو محصول اصلی—Food و Instamart—روی این نمایه‌ها سوار شدند. علاوه بر هدف اصلی pLTV، یک وظیفهٔ کمکی برای پیش‌بینی تعداد سفارش‌ها اضافه شد که به بهبود دقت کمک کرد و باعث کاهش پارامترها از ۳۶۳٬۰۰۰ به ۱۳۵٬۰۰۰ (کاهش ۶۳٪) شد.

مرجع ساختار شبکه‌های MLP: پرسپترون چندلایه در ویکی‌پدیا

معماری چهارسر MLP برای پیش‌بینی Food و Instamart

معیارهای ارزیابی؛ رتبه‌بندی اولویت دارد

با وجود فراوانی کاربران با ارزش صفر و دُم طولانی توزیع، معیارهای رگرسیون نقطه‌ای مانند MAE یا MAPE ناکافی بودند. به‌جای آن معیارها، ارزیابی بر توانایی مدل در رتبه‌بندی مشتریان بر اساس ارزش تمرکز یافت. رویکرد اجرایی تیم:

  • تقسیم مقادیر پیش‌بینی‌شده و واقعی به ۱۰ دهک
  • محاسبهٔ درصد کاربران قرارگرفته در دهک‌های متناظر (diagonal coverage)
  • محاسبهٔ همبستگی اسپیرمن برای اندازه‌گیری نظم رتبه‌ای

نتایج: همبستگی اسپیرمن بالاتر از ۰.۷۵ برای هر دو بخش Food و Instamart و پوشش قطری بین ۷۰٪ تا ۸۰٪ در دهک‌های ارزش که نشان‌دهندهٔ توانایی مدل در جداسازی کاربران با ارزش‌های متفاوت است.

پیاده‌سازی در سیستم تبلیغات و مقایسه با پلتفرم خارجی

سیگنال pLTV در تولید با سیستم پیشنهادگذاری هدف‌مند بازگشت سرمایهٔ تبلیغاتی گوگل (tROAS) ترکیب شد: کاربران بر اساس ارزش پیش‌بینی‌شده رتبه‌بندی می‌شوند و سیستم تبلیغات بر مبنای این رتبه‌بندی پیشنهادها را تنظیم می‌کند. در آزمایش‌های A/B با یک پلتفرم pLTV خارجی، مدل داخلی Swiggy منجر به نگهداشت و ارزش ناخالص سفارش بالاتر به ازای هر کاربر جذب‌شده شد، در حالی که پلتفرم خارجی به ازای هر دلار هزینه، تعداد کاربران بیشتری جذب می‌کرد.

با توجه به این نتایج، انتخاب بین «بیشینه‌سازی تعداد کاربران جذب‌شده» و «بیشینه‌سازی ارزش بلندمدت کاربران» بستگی به هدف کسب‌وکار و نرخ بازگشت سرمایه مورد انتظار دارد.

گام بعدی: حرکت به سوی پیش‌بینی‌های احتمال‌محور

تیم قصد دارد از تخمین‌های نقطه‌ای به مدل‌های احتمال‌محور منتقل شود تا عدم‌قطعیت در برآورد ارزش هر مشتری را مدل‌سازی کند. این رویکرد امکان ترکیب عدم‌قطعیت در تصمیم‌گیری پیشنهادگذاری، تخصیص بهتر بودجه و ارزیابی ریسک دقیق‌تر را فراهم می‌کند.

نتایج کلیدی و پیامدها برای صنعت

  • استفاده از بیش از ۳۵۰ ویژگی پیش از اولین سفارش، مسئلهٔ شروع سرد را کاهش می‌دهد و تصمیم‌گیری زودهنگام را ممکن می‌سازد.
  • معماری چندوظیفه‌ای ساده با وظیفهٔ کمکی می‌تواند هم دقت را افزایش دهد و هم هزینهٔ محاسباتی را کاهش دهد (کاهش ۶۳٪ پارامترها).
  • ارزیابی مبتنی بر رتبه‌بندی، در سناریوهای دارای دُم بلند توزیع معتبرتر است و معیارهای نقطه‌ای را تکمیل می‌کند.
  • انتقال به مدل‌های احتمال‌محور، فرصت‌های جدیدی برای مدیریت ریسک و تخصیص بودجه تبلیغاتی بهینه فراهم می‌آورد.

پیش‌بینی ارزش طول عمر مشتری به‌عنوان سیگنالی راهبردی، موجب تخصیص بهینه‌تر بودجه تبلیغاتی و ایجاد فضای نوآوری در سیاست‌های قیمت‌گذاری و مزایده در تبلیغات دیجیتال می‌شود. جهت مطالعهٔ بیشتر دربارهٔ مفاهیم پایهٔ شبکه‌های عصبی چندلایه می‌توانید به صفحهٔ ویکی‌پدیا مراجعه کنید.