در ژانویه سال ۲۰۲۱، شرکت OpenAI شبکه‌ای عصبی را معرفی کرد که ارتباط میان زبان و خلاقیت بصری را برای همیشه تغییر داد. این سامانه که DALL-E نام گرفت، بر پایه ایده‌ای ساده اما شگفت‌انگیز بنا شد: توانایی خلق تصاویر کاملاً جدید صرفاً از روی توصیفات متنی. این اتفاق، نقطه عطفی تاریخی در هوش مصنوعی محسوب می‌شد. تصویر معروف «یک صندلی راحتی به شکل آووکادو» به نماد بصری این پیشرفت تبدیل شد و نشان داد که الگوریتم‌ها می‌توانند به مرز درک مفاهیم انتزاعی و خلاقیت واقعی برسند.

این فناوری با کسب امتیاز ۴ از ۵ در ارزیابی‌های تاثیرگذاری نقاط عطف هوش مصنوعی، راه را برای ظهور نسل‌های بعدی هموار کرد. DALL-E زمینه‌ساز پیدایش ابزارهای قدرتمندی نظیر Midjourney و Stable Diffusion شد و هنر دیجیتال تولیدشده توسط ماشین را وارد جریان اصلی فرهنگ و رسانه کرد.

معماری نوین: بازطراحی GPT-3 برای پردازش تصاویر

در هسته اصلی خود، DALL-E نسخه‌ای ۱۲ میلیارد پارامتری از GPT-3 است که برای تبدیل متن به تصویر آموزش دیده است. تبار مفهومی این معماری بسیار کلیدی است. پیش‌تر، مدل‌های زبانی قدرتمند توانایی درک و تولید متن‌های پیچیده را ثابت کرده بودند و از سوی دیگر، پروژه‌هایی مانند Image GPT نشان داده بودند که شبکه‌های عصبی قادر به تولید تصاویر با وفاداری بالا هستند. DALL-E با ترکیب این دو رویکرد ثابت کرد که دست‌کاری مفاهیم بصری از طریق زبان طبیعی کاملاً امکان‌پذیر است.

این مدل زبانی مبتنی بر ترنسفورمر، متن و تصویر را به عنوان یک جریان واحد از داده دریافت می‌کند. این جریان شامل حداکثر 1280 توکن است و سیستم با روش بیشینه‌سازی درست‌نمایی آموزش می‌بیند تا تمامی توکن‌ها (چه کلمات و چه پیکسل‌ها) را به صورت ترتیبی تولید کند. این نگاه یکپارچه به متن و پیکسل، همان راز اصلی پر کردن شکاف میان زبان و تصویر بود.

نمایش معماری مدل زبانی DALL-E برای تولید تصویر

قابلیت‌های ویرایشی فراتر از سنتز تصویر

شیوه آموزش این سامانه، قابلیت‌هایی فراتر از خلق تصاویر از صفر در اختیار آن قرار داد. مدل می‌توانست هر ناحیه مستطیلی از یک تصویر موجود را تا گوشه پایین-راست بازتولید کند و در عین حال با دستورات ورودی سازگار بماند. این یعنی سیستم توانایی درک ساختار تصاویر را داشت تا آن‌ها را به شکلی منسجم گسترش دهد یا تغییر دهد؛ نمونه اولیه‌ای از تکنیک Inpainting که امروزه به یکی از اصلی‌ترین ابزارهای ویرایش عکس با هوش مصنوعی تبدیل شده است.

تنوع چشمگیر در توانایی‌های خلاقانه مصنوعی

تیم تحقیقاتی OpenAI متوجه شد که DALL-E مجموعه‌ای متنوع و شگفت‌انگیز از استعدادهای هنری و مفهومی از خود نشان می‌دهد. برخی از برجسته‌ترین قابلیت‌های این مدل عبارتند از:

  • تجسم انسان‌انگاشته: خلق حیوانات و اشیاء بی‌جان با ویژگی‌ها و احساسات شبیه به انسان.
  • ترکیب مفاهیم نامرتبط: ادغام ایده‌های کاملاً متفاوت به شکلی باورپذیر و منطقی (مانند همان صندلی آووکادویی).
  • رندر کردن متن: تولید تصاویری از اشیاء که کلمات یا جملات مشخصی با تایپوگرافی درست روی آن‌ها نوشته شده است.
  • اعمال تغییرات بصری: درک دستورات کاربر برای تغییر رنگ، زاویه یا ترکیب‌بندی در یک تصویر موجود.

برای اطمینان از صحت ارزیابی‌ها، شرکت OpenAI تاکید کرد که تصاویر نمایش‌داده‌شده، شانس دستی و انتخاب چریکی نداشته‌اند. سیستم از میان 512 تصویر تولیدشده برای هر دستور، 32 گزینه برتر را پس از رتبه‌بندی با الگوریتم CLIP انتخاب می‌کرد تا دقت و نظم مدل را به رخ بکشد.

چالش ترکیب: ویژگی‌ها، اشیاء و روابط فضایی

یکی از سخت‌ترین آزمون‌ها برای DALL-E، درک پیچیدگی‌های روابط فیزیکی و ویژگی‌های مستقل در یک صحنه بود. کنترل هم‌زمان چند شیء مختلف، تغییر رنگ‌ها و مدیریت موقعیت مکانی آن‌ها نسبت به یکدیگر، چالشی جدی برای شبکه‌های عصبی محسوب می‌شد.

برای مثال، زمانی که مدل با دستورات پیچیده‌ای با چند شرط متوالی مواجه می‌شد، باید تمام متغیرها را به درستی در تصویر اعمال می‌کرد. این چالش‌ها به پژوهشگران کمک کرد تا محدودیت‌های مدل‌های اولیه را بشناسند و مسیر را برای توسعه موتورهای تصویرسازی بسیار دقیق‌تر در سال‌های پس از آن هموار سازند. تلاش برای حل این مشکلات مفهومی، نهایتاً منجر به خلق ابزارهایی شد که امروزه با چند کلمه کلیدی ساده، شاهکارهای بصری خلق می‌کنند.