مدلهای مقایسهای بینایی-زبان با نگاشت تصویر و متن به یک فضای تعبیهٔ مشترک، امکان انجام وظایف جدید را بدون ریزتنظیم فراهم میکنند و بازیابی چندمودالی را تسهیل میکنند.
مبنای مقایسهای (Contrastive)
یادگیری مقایسهای به تولید نمایشهایی میپردازد که نمونههای مرتبط را در فضا به هم نزدیک و نمونههای نامرتبط را دور نگه میدارند. در عمل این رویکرد با آموزش دو رمزگذار مجزا — یکی برای تصاویر و دیگری برای متن — اجرا میشود تا بردارهای متناظر در یک فضای نهفته مشترک به هم نزدیک شوند.
چگونه تصویر و متن را مقایسه میکنند
ساختار عمومی این خانوادهٔ مدلها ساده اما مؤثر است:
- رمزگذارهای دوگانه: یک شبکه تصاویر را به برداری با طول ثابت و دیگری متن را به برداری با همان بُعد نگاشت میکند.
- سنجهٔ شباهت: ضرب داخلی یا شباهت کسینوسی بین بردار تصویر و بردار متن معیار همترازی معنایی است.
- زیان مقایسهای: امتیازهای شباهت درون یک بچ با سافتمکس به توزیع تبدیل شده و زیان آنتروپی متقاطع (در دو جهت تصویر→متن و متن→تصویر) یا نسخههای متفاوتی مثل Sigmoid CLIP برای تشویق زوجهای درست استفاده میشود.
- پارامتر دما: ضریب دما توزیع سافتمکس را نرم یا تیز میکند و در پایداری و کیفیت آموزش نقش مهمی دارد.
فرایند آموزش مقایسهای
در هر بچ، مدل امتیاز شباهت هر تصویر را با تمام کپشنهای موجود محاسبه میکند. سپس با تبدیل آن امتیازها به احتمالات و محاسبهٔ زیان در دو جهت، مدل تشویق میشود که زوجهای متناظر را بیشینه و زوجهای نامرتبط را کمینه نماید.
CLIP چیست و چگونه عمل میکند
OpenAI در اوایل 2021 مدل CLIP (Contrastive Language–Image Pre‑training) را معرفی کرد. در CLIP یک رمزگذار تصویر و یک رمزگذار متن بهصورت مقایسهای آموزش میبینند؛ نتیجه این آموزش نگاشت توصیفهای متنی و تصاویر مرتبط در نزدیکی یکدیگر است. کاربردهای عملی شامل جستوجوی تصویر با متن، طبقهبندی صفر-شات با تعریف برچسبهای متنی و بازیابی چندمودالی است.
مروری عمومی بر مفاهیم یادگیری مقایسهای را میتوان در صفحهٔ Wikipedia: Contrastive learning یافت.
معماریها و ابعاد تعبیه
رمزگذار تصویر در اکوسیستم CLIP میتواند از انواع معماریها بهره ببرد؛ از شبکههای کانولوشنی تا ویژنترنسفورمرها. نمونهای از ابعاد تعبیه که در منابع عمومی گزارش شدهاند:
- RN50: بعد تعبیه 1024
- RN101: بعد تعبیه 512
- ViT-B/32 و ViT-B/16: بعد تعبیه 512
- ViT-L/14 و ViT-L/14@336px: بعد تعبیه 768
در پیادهسازی ViT پس از تعبیهٔ پَچها و افزودن تعبیهٔ موقعیتی، نرمالسازی لایهای اعمال میشود. نسخههای مبتنی بر ResNet میتوانند تغییراتی مانند سه کانولوشن 3×3 در استم، میانگینگیری با گام 2 برای کاهش آنتیآلیاسینگ و مکانیزم پولینگ چندسرِ توجه را شامل شوند. برای بررسی بیشتر به صفحات ResNet و Vision Transformer مراجعه کنید. همچنین مرجع داخلی دربارهٔ معماری ResNet در وبسایت موجود است: ResNet.
رمزگذار متن در CLIP
نسخهٔ اولیهٔ CLIP از یک ترنسفورمر متن شبیه به decoder-only استفاده میکرد: حدود 12 لایه با اندازهٔ پنهان 512 و 8 سر توجه، رمزگذاری BPE و واژهنامهای نزدیک به 49,152. توالیها با توکنهای آغاز و پایان قاببندی شده و خروجی نهایی پس از نرمالسازی و نگاشت خطی به بردار تعبیهٔ متن تبدیل میشود.
ALIGN و پیادهسازیهای دیگر
گوگل مدل ALIGN را با اهداف مشابه CLIP ارائه کرد و در آن از معماریهای متنوعی مانند EfficientNet برای رمزگذار تصویر بهره برده شد. تجربهها نشان میدهند که چارچوب مقایسهای قابل تعمیم به ترکیبها و مقیاسهای مختلف معماری است.
مزایا و کاربردهای عملی
- طبقهبندی صفر-شات با تعریف برچسبهای متنی بدون نیاز به مجموعهٔ برچسبخوردهٔ اختصاصی
- بازیابی چندمودالی و رتبهبندی تصاویر بر اساس کوئری متن
- فیلترسازی محتوا و کمک به هدایت مدلهای مولد تصویر با متن
- قابلیت ترکیب در سیستمهای بزرگتر مولتیمودال
محدودیتها و ملاحظات عملی
- حساسیت به سوگیریهای مجموعهٔ آموزش: دامنه و تنوع متنها و تصاویر اثر مستقیمی بر رفتار مدل دارد.
- نیاز به مجموعههای بزرگ و متنوع از جفتهای تصویر–متن برای دستیابی به عملکرد عمومی مناسب.
- ضعف نسبی در فهم روابط پیچیده و چندمرحلهای بین عناصر تصویر و متن؛ مدلها معمولاً توصیفات کلی را بهتر نگاشت میکنند تا استدلال دقیق دربارهٔ جزئیات.
- ملاحظات مقیاس و هزینهٔ محاسباتی هنگام آموزش یا استفاده از نسخههای بزرگتر معماری.
راهبردهای توسعه و آینده
جهتهای پیشرفت شامل ترکیب یادگیری مقایسهای با روشهای دیگر مولتیمدال، استفاده از دادهافزایی و فیلترهای انتخاب داده برای کاهش سوگیری، و توسعهٔ معیارهای ارزیابی دقیقتر برای سنجش درک معنایی عمیقتر است. ادغام این مدلها با نسل بعدی مولدها میتواند کاربردهای خلاقانه و عملی جدیدی ایجاد کند.
منابع مرتبط: معرفی CLIP توسط OpenAI و مطالب فنی گوگل دربارهٔ ALIGN نقطهٔ شروع مناسبی برای مطالعهٔ عمیقتر هستند.





