دستاوردی که معادله بینایی ماشین را تغییر داد
وقتی شبکههای عصبی برای درک جهان عکسها به میلیونها نمونه برچسبخورده وابسته بودند، یک راهکار ساده اما انقلابی نیاز داشت. اوائل 2021، تیم اپنآیآی مقاله CLIP را منتشر کرد و ثابت کرد که میتوان مفاهیم بصری را مستقیماً از متنهای غنی و توصیفی که بهطور طبیعی در اینترنت پراکندهاند، استخراج کرد. این مدل نشان داد که بهجای ساخت لایههای خروجی فیزیکی برای هر وظیفه، میتوان فضای برداری تصویر و زبان را در هم تنید.
هسته این سیستم بر معماری دوگانه استوار است. یک ترنسفورمر دیداری ویک ترنسفورمر زبانی بهصورت موازی آموزش میبینند تا جفتهای مرتبط را در یک فضای ریاضی مشترک به هم نزدیک کنند و جفتهای ناهماهنگ را از یکدیگر دور کنند. این فرآیند یادگیری مقابلهای، به مدل توانایی تطبیق فوقالعادهای میدهد.
شکستن قفل سه مانع سنتی
توسعه بر فراز مجموعهدادههای انباشته
ساخت برچسب دقتیافته همیشه سنگینترین گلوگاه آموزش مدلها بوده است. پروژههای اَبَر مانند ImageNet دهها هزار نیروی انسانی و میلیونها دلار صرف چیدمان 14 میلیون عکس در 22 هزار کلاس کرده بودند. CLIP مسیر را کاملاً عوض کرد؛ این سیستم مستقیماً از 400 میلیون جفت عکس و متن موجود در وب بهره میبرد. وقتی دانشجو هزار برابر داده خام و طبیعی داشته باشد، دیگر نیازی به کوششهای مهندسیشده برچسبزنی نیست.
ظهور قابلیت Zero-Shot واقعی
در مدلهای کلاسیک، اگر محققی بخواهد دستهبندی جدیدی را بررسی کند، باید از صفر مدل جدیدی بسازد، لایه درجاگیری را تنظیم کند و دادههای جدیدی جمعآوری نماید. در معماری کلپ، تنها کافی است نام دستههای هدف را به بخش پردازش متن بدهید. مدل بهطور خودکار یک طبقهبند خطی بر اساس بردارهای بصری درون ساخت میکند. این مکانیزم اجازه میدهد بدون دیدن حتی یک عکس آموزشی اضافی، مدل روی وظایف کاملاً تازه فعال شود.
پوشاندن شکاف استحکام عملکردی
یکی از نقاط کور عمدهی یادگیری عمیق، افت ناگهانی دقت در تستهای استرس محیطی بود. مدلها که در بچنمارکهای استاندارد نمرات عالی میگرفتند، با کوچکترین تغییر زاویه دوربین، نویز یا نورپردازی اشتباه، عملکردشان فرو میریخت. از آنجا که کلپ برای هیچ بچنمارک خاصی بهینه نشده بود، توزیع بردارهای آن بسیار گستردهتر و طبیعیتر بود. این ویژگی شکاف استحکام را تا 75 درصد کاهش داد و عملکردی همتراز با ResNet-50 در حالت صفر-شات تولید کرد.
از آزمایشگاه تا عصر هوش مصنوعی مولد
ایدهی استفاده از زبان طبیعی بهعنوان فضای پیشبینی، ریشه در تحقیقات دهه 90 و اوایل 2010 داشت. پروژههای دانشگاه استنفورد و تحقیقات گروه FAIR درباره n-gramهای بصری، جرقههای اولیه را زده بودند، اما محاسبات آن زمان و عدم بلوغ ترنسفورمرها اجازه مقیاسپذیری نمیداد. ورود لایههای توجه متقابل و دسترسی به دیتاستهای عظیم وب، این مسیر را به یک چرخه خودتقویتکننده تبدیل کرد.
پیامد مستقیم این زیرساخت، ظهور پلتفرمهای تصویرساز نسل جدید بود. وقتی مرزهای بین کپشننویسی و درک بصری برداشته شوند، تولید محتوای چندرسانهای دیگر محدود به الگوهای تکراری نمیماند. مقالات منتشر شده روی سایت اپنآیآی نشان میدهد که پیوند این دو مدالیت، پایهای برای سیستمهایی شده که نه فقط شباهت ظاهری، بلکه روابط منطقی اشیاء در صحنه را فهم میکنند.
چشمانداز پردازش چندرسانهای
آیندهی بینایی ماشین دیگر به سمت ساخت کلاندادههای مصنوعی یا برچسبگذاریهای گرانقیمت حرکت نمیکند. الگوریتمهای همترازسازی زبان و تصویر نشان میدهند که ماشینها میتوانند جهان را نه به پیکسلهای خام، بلکه به صورت روایتی از روابط معناشناسی درک کنند. با تکامل ترنسفورمرهای چندوجهی، ابزارهایی که میتوانند هم بخوانند و هم ببینند، به استانداردی بیسابقه برای تحلیل دادههای پیچیده و تعامل انسان و ماشین تبدیل خواهند شد.





