مدل‌های مقایسه‌ای بینایی-زبان با نگاشت تصویر و متن به یک فضای تعبیهٔ مشترک، امکان انجام وظایف جدید را بدون ریزتنظیم فراهم می‌کنند و بازیابی چندمودالی را تسهیل می‌کنند.

مبنای مقایسه‌ای (Contrastive)

یادگیری مقایسه‌ای به تولید نمایش‌هایی می‌پردازد که نمونه‌های مرتبط را در فضا به هم نزدیک و نمونه‌های نامرتبط را دور نگه می‌دارند. در عمل این رویکرد با آموزش دو رمزگذار مجزا — یکی برای تصاویر و دیگری برای متن — اجرا می‌شود تا بردارهای متناظر در یک فضای نهفته مشترک به هم نزدیک شوند.

چگونه تصویر و متن را مقایسه می‌کنند

ساختار عمومی این خانوادهٔ مدل‌ها ساده اما مؤثر است:

  • رمزگذارهای دوگانه: یک شبکه تصاویر را به برداری با طول ثابت و دیگری متن را به برداری با همان بُعد نگاشت می‌کند.
  • سنجهٔ شباهت: ضرب داخلی یا شباهت کسینوسی بین بردار تصویر و بردار متن معیار هم‌ترازی معنایی است.
  • زیان مقایسه‌ای: امتیازهای شباهت درون یک بچ با سافت‌مکس به توزیع تبدیل شده و زیان آنتروپی متقاطع (در دو جهت تصویر→متن و متن→تصویر) یا نسخه‌های متفاوتی مثل Sigmoid CLIP برای تشویق زوج‌های درست استفاده می‌شود.
  • پارامتر دما: ضریب دما توزیع سافت‌مکس را نرم یا تیز می‌کند و در پایداری و کیفیت آموزش نقش مهمی دارد.

فرایند آموزش مقایسه‌ای

در هر بچ، مدل امتیاز شباهت هر تصویر را با تمام کپشن‌های موجود محاسبه می‌کند. سپس با تبدیل آن امتیازها به احتمالات و محاسبهٔ زیان در دو جهت، مدل تشویق می‌شود که زوج‌های متناظر را بیشینه و زوج‌های نامرتبط را کمینه نماید.

CLIP چیست و چگونه عمل می‌کند

OpenAI در اوایل 2021 مدل CLIP (Contrastive Language–Image Pre‑training) را معرفی کرد. در CLIP یک رمزگذار تصویر و یک رمزگذار متن به‌صورت مقایسه‌ای آموزش می‌بینند؛ نتیجه این آموزش نگاشت توصیف‌های متنی و تصاویر مرتبط در نزدیکی یکدیگر است. کاربردهای عملی شامل جست‌وجوی تصویر با متن، طبقه‌بندی صفر-شات با تعریف برچسب‌های متنی و بازیابی چندمودالی است.

مروری عمومی بر مفاهیم یادگیری مقایسه‌ای را می‌توان در صفحهٔ Wikipedia: Contrastive learning یافت.

معماری‌ها و ابعاد تعبیه

رمزگذار تصویر در اکوسیستم CLIP می‌تواند از انواع معماری‌ها بهره ببرد؛ از شبکه‌های کانولوشنی تا ویژن‌ترنسفورمرها. نمونه‌ای از ابعاد تعبیه که در منابع عمومی گزارش شده‌اند:

  • RN50: بعد تعبیه 1024
  • RN101: بعد تعبیه 512
  • ViT-B/32 و ViT-B/16: بعد تعبیه 512
  • ViT-L/14 و ViT-L/14@336px: بعد تعبیه 768

در پیاده‌سازی ViT پس از تعبیهٔ پَچ‌ها و افزودن تعبیهٔ موقعیتی، نرمال‌سازی لایه‌ای اعمال می‌شود. نسخه‌های مبتنی بر ResNet می‌توانند تغییراتی مانند سه کانولوشن 3×3 در استم، میانگین‌گیری با گام 2 برای کاهش آنتی‌آلیاسینگ و مکانیزم پولینگ چندسرِ توجه را شامل شوند. برای بررسی بیشتر به صفحات ResNet و Vision Transformer مراجعه کنید. همچنین مرجع داخلی دربارهٔ معماری ResNet در وب‌سایت موجود است: ResNet.

رمزگذار متن در CLIP

نسخهٔ اولیهٔ CLIP از یک ترنسفورمر متن شبیه به decoder-only استفاده می‌کرد: حدود 12 لایه با اندازهٔ پنهان 512 و 8 سر توجه، رمزگذاری BPE و واژه‌نامه‌ای نزدیک به 49,152. توالی‌ها با توکن‌های آغاز و پایان قاب‌بندی شده و خروجی نهایی پس از نرمال‌سازی و نگاشت خطی به بردار تعبیهٔ متن تبدیل می‌شود.

ALIGN و پیاده‌سازی‌های دیگر

گوگل مدل ALIGN را با اهداف مشابه CLIP ارائه کرد و در آن از معماری‌های متنوعی مانند EfficientNet برای رمزگذار تصویر بهره برده شد. تجربه‌ها نشان می‌دهند که چارچوب مقایسه‌ای قابل تعمیم به ترکیب‌ها و مقیاس‌های مختلف معماری است.

مزایا و کاربردهای عملی

  • طبقه‌بندی صفر-شات با تعریف برچسب‌های متنی بدون نیاز به مجموعهٔ برچسب‌خوردهٔ اختصاصی
  • بازیابی چندمودالی و رتبه‌بندی تصاویر بر اساس کوئری متن
  • فیلترسازی محتوا و کمک به هدایت مدل‌های مولد تصویر با متن
  • قابلیت ترکیب در سیستم‌های بزرگ‌تر مولتی‌مودال

محدودیت‌ها و ملاحظات عملی

  • حساسیت به سوگیری‌های مجموعهٔ آموزش: دامنه و تنوع متن‌ها و تصاویر اثر مستقیمی بر رفتار مدل دارد.
  • نیاز به مجموعه‌های بزرگ و متنوع از جفت‌های تصویر–متن برای دست‌یابی به عملکرد عمومی مناسب.
  • ضعف نسبی در فهم روابط پیچیده و چندمرحله‌ای بین عناصر تصویر و متن؛ مدل‌ها معمولاً توصیفات کلی را بهتر نگاشت می‌کنند تا استدلال دقیق دربارهٔ جزئیات.
  • ملاحظات مقیاس و هزینهٔ محاسباتی هنگام آموزش یا استفاده از نسخه‌های بزرگ‌تر معماری.

راهبردهای توسعه و آینده

جهت‌های پیشرفت شامل ترکیب یادگیری مقایسه‌ای با روش‌های دیگر مولتی‌مدال، استفاده از داده‌افزایی و فیلترهای انتخاب داده برای کاهش سوگیری، و توسعهٔ معیارهای ارزیابی دقیق‌تر برای سنجش درک معنایی عمیق‌تر است. ادغام این مدل‌ها با نسل بعدی مولدها می‌تواند کاربردهای خلاقانه و عملی جدیدی ایجاد کند.

منابع مرتبط: معرفی CLIP توسط OpenAI و مطالب فنی گوگل دربارهٔ ALIGN نقطهٔ شروع مناسبی برای مطالعهٔ عمیق‌تر هستند.