فناوری‌های اندکی توانسته‌اند مرز میان واقعیت و تصاویر مصنوعی را به‌اندازه StyleGAN در هم بشکنند. این شبکه مولد تخاصمی که به‌دست واحد پژوهشی انویدیا توسعه یافت، با قابلیت خلق پرتره‌های بی‌نهایت و کاملاً متقاعدکننده از چهره افرادی که هرگز وجود خارجی نداشته‌اند، جهان را شگفت‌زده کرد. این معماری سال‌ها به‌عنوان پیشرفته‌ترین معیار در تولید چهره‌های فوتورئالیستی شناخته می‌شد و پایه‌گذار ورود جامعه به عصر جدید رسانه‌های مصنوعی (Synthetic Media) شد.

ریشه‌های دگرگونی: شبکه‌های GAN و رشد تدریجی

StyleGAN شاخه‌ای پیشرفته از خانواده بزرگ‌تر شبکه‌های مولد تخاصمی (GAN) است که ایان گودفلو و همکارانش در سال 2014 خلق کردند. در سال‌های ابتدایی، خروجی این مدل‌ها برای تولید چهره چندان قابل‌اعتماد نبود و تصاویر با ابعاد 256x256 پیکسل یا کمتر، پر از ناهنجاری‌های بصری بودند.

نقطه عطف این مسیر با معرفی روش «رشد تدریجی شبکه‌های GAN» یا PGGAN در اکتبر 2017 رقم خورد. ترو کاراس و تیمش با رشد دادن مدل از مقیاس 4x4 تا 1024x1024 به‌صورت هرمی، مشکل ناپایداری در آموزش را حل کردند. PGGAN نخستین روشی بود که چهره‌های فوتورئالیستی باکیفیت را با موفقیت روی مجموعه داده CelebA-HQ ترکیب کرد و راه را برای ظهور استانداردهای جدید هموار ساخت.

نمونه‌ای از چهره‌های فوتورئالیستی تولید شده توسط هوش مصنوعی

ورود به صحنه: تولد StyleGAN در دسامبر 2018

در دسامبر 2018، پژوهشگران دفتر تحقیقاتی انویدیا در هلسینکی مقاله‌ای با عنوان «معماری مولد مبتنی بر سبک برای شبکه‌های مولد تخاصمی» را منتشر کردند. این معماری توانست تفکیک خودکار ویژگی‌های کلیدی مانند ژست و هویت را از جزئیات تصادفی مانند کک‌ومک یا رنگ مو به‌شکلی خیره‌کننده انجام دهد. کیفیت نمونه‌گیری بدون شرط در وضوح 1024x1024 آن‌قدر بالا بود که ارزیابان انسانی به‌سختی می‌توانستند چهره‌های شبیه‌سازی‌شده را از عکس‌های واقعی تشخیص دهند.

مکانیسم درونی مولد مبتنی بر سبک چگونه کار می‌کند؟

هسته نوآوری این سیستم، ترکیب هوشمندانه Progressive GAN با تکنیک انتقال سبک عصبی (Neural Style Transfer) بود. به‌جای وارد کردن مستقیم داده‌ها به لایه‌های شبکه، معماری مولد به دو زیرشبکه مجزا تقسیم شد:

  • شبکه نگاشت (Mapping Network): یک پرسپترون چندلایه 8 لایه که بردارهای نهفته 512 بعدی را به یک فضای میانی با قابلیت یادگیری منتقل می‌کند.
  • شبکه ترکیب (Synthesis Network): شبکه‌ای کانولوشنی که از یک تانسور ثابت آغاز شده و با افزایش تدریجی وضوح، مقادیر مقیاس و بایاس را برای تنظیم دقیق ویژگی‌ها تولید می‌کند.

این معماری با استفاده از روش «نرمال‌سازی تطبیقی نمونه» (AdaIN)، امکان کنترل دقیق و لایه‌به‌لایه جزئیات تصویر را فراهم کرد.

نمودار معماری و ساختار شبکه StyleGAN انویدیا

تکامل نسلی: از StyleGAN2 تا StyleGAN3

فناوری متوقف نشد. نسخه بعدی، یعنی StyleGAN2، با حذف برخی از نقاط ضعف نسخه اول در فوریه 2020 رونمایی شد و با اصلاح نرمال‌سازی تطبیقی، نواری که به‌صورت مصنوعی روی تصاویر می‌افتاد را از بین برد.

در نهایت، با انتشار StyleGAN3 در اواخر سال 2021، انویدیا پدیده «پیوند با بافت» (Texture Stickiness) را هدف قرار داد. در نسخه‌های قبلی، فرفرهای مو یا بافت لباس هنگام تغییر زاویه چهره به‌جای چرخش طبیعی، ماهیت خود را حفظ می‌کردند. StyleGAN3 با الهام از پردازش سیگنال‌های پیوسته، این بافت‌ها را به‌طور مایع و کاملاً طبیعی تغییر موقعیت می‌دهد.

تأثیر میراث StyleGAN بر هوش مصنوعی مولد

ظهور این معماری فراتر از یک دستاورد تئوریک عمل کرد و سایه سنگین خود را بر وب‌سایت‌های وایرال و رسانه‌های اجتماعی انداخت. پلتفرم‌هایی مانند This Person Does Not Exist به مخاطبان نشان دادند که چگونه می‌توان به‌راحتی هویت‌های تصویری ناموجود خلق کرد.

با وجود اینکه امروزه مدل‌های پیشرفته扩散 (Diffusion Models) بخش عمده‌ای از توجهات را به خود جلب کرده‌اند، اما معماری دقیق کنترل تصویر که توسط StyleGAN معرفی شد، همچنان نقطه عطفی تاریخی محسوب می‌شود و کدهای منبع آن پایه‌ای برای بی‌شماری از پروژه‌های متن‌باز در سراسر جهان است.