دستاوردی که معادله بینایی ماشین را تغییر داد

وقتی شبکه‌های عصبی برای درک جهان عکس‌ها به میلیون‌ها نمونه برچسب‌خورده وابسته بودند، یک راهکار ساده اما انقلابی نیاز داشت. اوائل 2021، تیم اپن‌آی‌آی مقاله CLIP را منتشر کرد و ثابت کرد که می‌توان مفاهیم بصری را مستقیماً از متن‌های غنی و توصیفی که به‌طور طبیعی در اینترنت پراکنده‌اند، استخراج کرد. این مدل نشان داد که به‌جای ساخت لایه‌های خروجی فیزیکی برای هر وظیفه، می‌توان فضای برداری تصویر و زبان را در هم تنید.

هسته این سیستم بر معماری دوگانه استوار است. یک ترنسفورمر دیداری ویک ترنسفورمر زبانی به‌صورت موازی آموزش می‌بینند تا جفت‌های مرتبط را در یک فضای ریاضی مشترک به هم نزدیک کنند و جفت‌های ناهماهنگ را از یکدیگر دور کنند. این فرآیند یادگیری مقابله‌ای، به مدل توانایی تطبیق فوق‌العاده‌ای می‌دهد.

شکستن قفل سه مانع سنتی

توسعه بر فراز مجموعه‌داده‌های انباشته

ساخت برچسب دقت‌یافته همیشه سنگین‌ترین گلوگاه آموزش مدل‌ها بوده است. پروژه‌های اَبَر مانند ImageNet ده‌ها هزار نیروی انسانی و میلیون‌ها دلار صرف چیدمان 14 میلیون عکس در 22 هزار کلاس کرده بودند. CLIP مسیر را کاملاً عوض کرد؛ این سیستم مستقیماً از 400 میلیون جفت عکس و متن موجود در وب بهره می‌برد. وقتی دانشجو هزار برابر داده خام و طبیعی داشته باشد، دیگر نیازی به کوشش‌های مهندسی‌شده برچسب‌زنی نیست.

ظهور قابلیت Zero-Shot واقعی

در مدل‌های کلاسیک، اگر محققی بخواهد دسته‌بندی جدیدی را بررسی کند، باید از صفر مدل جدیدی بسازد، لایه درجاگیری را تنظیم کند و داده‌های جدیدی جمع‌آوری نماید. در معماری کلپ، تنها کافی است نام دسته‌های هدف را به بخش پردازش متن بدهید. مدل به‌طور خودکار یک طبقه‌بند خطی بر اساس بردارهای بصری درون ساخت می‌کند. این مکانیزم اجازه می‌دهد بدون دیدن حتی یک عکس آموزشی اضافی، مدل روی وظایف کاملاً تازه فعال شود.

پوشاندن شکاف استحکام عملکردی

یکی از نقاط کور عمده‌ی یادگیری عمیق، افت ناگهانی دقت در تست‌های استرس محیطی بود. مدل‌ها که در بچنمارک‌های استاندارد نمرات عالی می‌گرفتند، با کوچک‌ترین تغییر زاویه دوربین، نویز یا نورپردازی اشتباه، عملکردشان فرو می‌ریخت. از آنجا که کلپ برای هیچ بچنمارک خاصی بهینه نشده بود، توزیع بردارهای آن بسیار گسترده‌تر و طبیعی‌تر بود. این ویژگی شکاف استحکام را تا 75 درصد کاهش داد و عملکردی هم‌تراز با ResNet-50 در حالت صفر-شات تولید کرد.

نمودار معماری شبکه عصبی CLIP و نحوه هم‌ترازسازی تصاویر و متن‌ها

از آزمایشگاه تا عصر هوش مصنوعی مولد

ایده‌ی استفاده از زبان طبیعی به‌عنوان فضای پیش‌بینی، ریشه در تحقیقات دهه 90 و اوایل 2010 داشت. پروژه‌های دانشگاه استنفورد و تحقیقات گروه FAIR درباره n-gramهای بصری، جرقه‌های اولیه را زده بودند، اما محاسبات آن زمان و عدم بلوغ ترنسفورمرها اجازه مقیاس‌پذیری نمی‌داد. ورود لایه‌های توجه متقابل و دسترسی به دیتاست‌های عظیم وب، این مسیر را به یک چرخه خودتقویت‌کننده تبدیل کرد.

پیامد مستقیم این زیرساخت، ظهور پلتفرم‌های تصویرساز نسل جدید بود. وقتی مرزهای بین کپشن‌نویسی و درک بصری برداشته شوند، تولید محتوای چندرسانه‌ای دیگر محدود به الگوهای تکراری نمی‌ماند. مقالات منتشر شده روی سایت اپن‌آی‌آی نشان می‌دهد که پیوند این دو مدالیت، پایه‌ای برای سیستم‌هایی شده که نه فقط شباهت ظاهری، بلکه روابط منطقی اشیاء در صحنه را فهم می‌کنند.

چشم‌انداز پردازش چندرسانه‌ای

آینده‌ی بینایی ماشین دیگر به سمت ساخت کلان‌داده‌های مصنوعی یا برچسب‌گذاری‌های گران‌قیمت حرکت نمی‌کند. الگوریتم‌های هم‌ترازسازی زبان و تصویر نشان می‌دهند که ماشین‌ها می‌توانند جهان را نه به پیکسل‌های خام، بلکه به صورت روایتی از روابط معناشناسی درک کنند. با تکامل ترنسفورمرهای چندوجهی، ابزارهایی که می‌توانند هم بخوانند و هم ببینند، به استانداردی بی‌سابقه برای تحلیل داده‌های پیچیده و تعامل انسان و ماشین تبدیل خواهند شد.