در ژانویه سال ۲۰۲۱، شرکت OpenAI شبکهای عصبی را معرفی کرد که ارتباط میان زبان و خلاقیت بصری را برای همیشه تغییر داد. این سامانه که DALL-E نام گرفت، بر پایه ایدهای ساده اما شگفتانگیز بنا شد: توانایی خلق تصاویر کاملاً جدید صرفاً از روی توصیفات متنی. این اتفاق، نقطه عطفی تاریخی در هوش مصنوعی محسوب میشد. تصویر معروف «یک صندلی راحتی به شکل آووکادو» به نماد بصری این پیشرفت تبدیل شد و نشان داد که الگوریتمها میتوانند به مرز درک مفاهیم انتزاعی و خلاقیت واقعی برسند.
این فناوری با کسب امتیاز ۴ از ۵ در ارزیابیهای تاثیرگذاری نقاط عطف هوش مصنوعی، راه را برای ظهور نسلهای بعدی هموار کرد. DALL-E زمینهساز پیدایش ابزارهای قدرتمندی نظیر Midjourney و Stable Diffusion شد و هنر دیجیتال تولیدشده توسط ماشین را وارد جریان اصلی فرهنگ و رسانه کرد.
معماری نوین: بازطراحی GPT-3 برای پردازش تصاویر
در هسته اصلی خود، DALL-E نسخهای ۱۲ میلیارد پارامتری از GPT-3 است که برای تبدیل متن به تصویر آموزش دیده است. تبار مفهومی این معماری بسیار کلیدی است. پیشتر، مدلهای زبانی قدرتمند توانایی درک و تولید متنهای پیچیده را ثابت کرده بودند و از سوی دیگر، پروژههایی مانند Image GPT نشان داده بودند که شبکههای عصبی قادر به تولید تصاویر با وفاداری بالا هستند. DALL-E با ترکیب این دو رویکرد ثابت کرد که دستکاری مفاهیم بصری از طریق زبان طبیعی کاملاً امکانپذیر است.
این مدل زبانی مبتنی بر ترنسفورمر، متن و تصویر را به عنوان یک جریان واحد از داده دریافت میکند. این جریان شامل حداکثر 1280 توکن است و سیستم با روش بیشینهسازی درستنمایی آموزش میبیند تا تمامی توکنها (چه کلمات و چه پیکسلها) را به صورت ترتیبی تولید کند. این نگاه یکپارچه به متن و پیکسل، همان راز اصلی پر کردن شکاف میان زبان و تصویر بود.
قابلیتهای ویرایشی فراتر از سنتز تصویر
شیوه آموزش این سامانه، قابلیتهایی فراتر از خلق تصاویر از صفر در اختیار آن قرار داد. مدل میتوانست هر ناحیه مستطیلی از یک تصویر موجود را تا گوشه پایین-راست بازتولید کند و در عین حال با دستورات ورودی سازگار بماند. این یعنی سیستم توانایی درک ساختار تصاویر را داشت تا آنها را به شکلی منسجم گسترش دهد یا تغییر دهد؛ نمونه اولیهای از تکنیک Inpainting که امروزه به یکی از اصلیترین ابزارهای ویرایش عکس با هوش مصنوعی تبدیل شده است.
تنوع چشمگیر در تواناییهای خلاقانه مصنوعی
تیم تحقیقاتی OpenAI متوجه شد که DALL-E مجموعهای متنوع و شگفتانگیز از استعدادهای هنری و مفهومی از خود نشان میدهد. برخی از برجستهترین قابلیتهای این مدل عبارتند از:
- تجسم انسانانگاشته: خلق حیوانات و اشیاء بیجان با ویژگیها و احساسات شبیه به انسان.
- ترکیب مفاهیم نامرتبط: ادغام ایدههای کاملاً متفاوت به شکلی باورپذیر و منطقی (مانند همان صندلی آووکادویی).
- رندر کردن متن: تولید تصاویری از اشیاء که کلمات یا جملات مشخصی با تایپوگرافی درست روی آنها نوشته شده است.
- اعمال تغییرات بصری: درک دستورات کاربر برای تغییر رنگ، زاویه یا ترکیببندی در یک تصویر موجود.
برای اطمینان از صحت ارزیابیها، شرکت OpenAI تاکید کرد که تصاویر نمایشدادهشده، شانس دستی و انتخاب چریکی نداشتهاند. سیستم از میان 512 تصویر تولیدشده برای هر دستور، 32 گزینه برتر را پس از رتبهبندی با الگوریتم CLIP انتخاب میکرد تا دقت و نظم مدل را به رخ بکشد.
چالش ترکیب: ویژگیها، اشیاء و روابط فضایی
یکی از سختترین آزمونها برای DALL-E، درک پیچیدگیهای روابط فیزیکی و ویژگیهای مستقل در یک صحنه بود. کنترل همزمان چند شیء مختلف، تغییر رنگها و مدیریت موقعیت مکانی آنها نسبت به یکدیگر، چالشی جدی برای شبکههای عصبی محسوب میشد.
برای مثال، زمانی که مدل با دستورات پیچیدهای با چند شرط متوالی مواجه میشد، باید تمام متغیرها را به درستی در تصویر اعمال میکرد. این چالشها به پژوهشگران کمک کرد تا محدودیتهای مدلهای اولیه را بشناسند و مسیر را برای توسعه موتورهای تصویرسازی بسیار دقیقتر در سالهای پس از آن هموار سازند. تلاش برای حل این مشکلات مفهومی، نهایتاً منجر به خلق ابزارهایی شد که امروزه با چند کلمه کلیدی ساده، شاهکارهای بصری خلق میکنند.





