کمتر سامانه هوش مصنوعی‌ای تا این حد تخیل عمومی را جلب کرده است. شما یک جمله تایپ می‌کنید، چند ثانیه later و یک تصویر منسجم و باکیفیت روی صفحه ظاهر می‌شود. اما داستان واقعی مهندسی پشت این پرده، نه در خروجی شگفت‌انگیز، بلکه در معماری زیربنایی آن نهفته است. بازآرایی هوشمندانه فرایند تولید تصویر باعث شد تا خلق آثار باکیفیت از نظر محاسباتی کاملاً امکان‌پذیر شود. این معماری تحت عنوان «مدل انتشار نهفته» (Latent Diffusion Model یا LDM) شناخته می‌شود.

شالوده این طراحی بر یک بینش کلیدی استوار است: اجرای فرایند حذف نویز به جای پردازش مستقیم روی پیکسل‌های خام، در یک فضای کاملاً فشرده. ترکیب این روش با شرطی‌سازی متن‌محور (Text Conditioning) و توجه متقاطع (Cross-Attention)، پایه و اساس یکی از تأثیرگذارترین مدل‌های هوش مصنوعی مولد را بنا نهاد.

مشکل فضای پیکسلی؛ چرا روش‌های سنتی مقیاس‌پذیر نیستند؟

برای درک مزیت اصلی LDM، باید هزینه سنگین اجرای فرایند انتشار به روش سنتی را بررسی کنیم. یک تصویر RGB با ابعاد 512×512 دارای 786,432 بُعد اطلاعاتی است. در مدل‌های قدیمی‌تر، شبکه U-Net که وظیفه پیش‌بینی و پاکسازی نویز را بر عهده دارد، باید تمام‌وضوح این تنسور عظیم را در هر گام زمانی پردازش می‌کرد. از آنجا که خروجی گرفتن از این مدل‌ها نیازمند ده‌ها تا صدها بار پردازش متوالی است، بار محاسباتی به طرز وحشتناکی افزایش می‌یافت.

مدل انتشار نهفته با یک راهکار ظریف این گلوگاه را دور می‌زند: فشرده‌سازی تصویر پیش از شروع کار. با کاهش نمونه‌برداری فضایی به میزان 8 برابر، یک تصویر 512×512 به یک تنسور نهفته با ابعاد 4×64×64 تبدیل می‌شود. این یعنی تنها 16,384 بُعد پردازشی برای هر نمونه! در نتیجه، شبکه U-Net در هر یک از 50 گام نمونه‌گیری، تقریباً با 48 برابر داده کمتری مواجه می‌شود. عملیات سنگین تولید تصویر در همین فضای فشرده انجام شده و تنها در مرحله نهایی، خروجی به حالت پیکسلی با وضوح کامل بازگردانده می‌شود.

نمایشاری از معماری U-Net و نحوه ارتباط آن با فضای نهفته در Stable Diffusion

خودرمزگذار вариational (VAE)؛ دروازه ورود و خروج داده‌ها

مرحله نخست در معماری Stable Diffusion، استفاده از یک خودرمزگذار variational (VAE) ازپیش‌آموزش‌دیده است. وظیفه این شبکه عصبی، فشرده‌سازی تصاویر در فضای نهفته و بازسازی دقیق آن‌ها است. نکته حیاتی اینجاست که این خودرمزگذار تنها یک‌بار آموزش می‌بیند و سپس وزن‌های آن کاملاً ثابت می‌شوند (Frozen). این بخش هم‌زمان با مدل انتشار یاد نمی‌گیرد، بلکه صرفاً صحنه فشرده‌ای را فراهم می‌کند که عملیات نویززدایی در آن رخ می‌دهد.

رمزگذار (Encoder)، تصاویر سه‌کاناله RGB را دریافت کرده و یک بازنمایی چهارکاناله تحویل می‌دهد. در سمت دیگر، رمزگشا (Decoder) عملیات معکوس را انجام داده و نهفته‌های 4×64×64 را مجدداً به تصاویری با ابعاد 3×512×512 پیکسل تبدیل می‌کند. در این میان، یک انتخاب مهندسی بسیار مهم وجود دارد: ضریب مقیاس (Scaling Factor). در Stable Diffusion، داده‌های کدگذاری‌شده در عدد 0.18215 ضرب می‌شوند تا توزیع نهفته دارای واریانس واحد شود. این عدد کوچک نقشی کلیدی در ثبات فرایند آموزش و تولید ایفا می‌کند.

رمزگذار متن؛ هدایت زبان طبیعی به سمت شبکه

مدل‌های مدرن تولید تصویر، ساختارهایی شرطی‌شده با متن هستند. به عبارت دیگر، آن‌ها باید زبان طبیعی انسان را به اعدادی تبدیل کنند که شبکه قادر به درک آن‌ها باشد. این وظیفه بر عهده رمزگذار متنی است که معمولاً بر پایه مدل CLIP شرکت OpenAI توسعه می‌یابد.

این بخش با دقت بالایی پردازش می‌شود و حداکثر 77 توکن (Token) را می‌پذیرد. سپس در نسخه‌های 1.x، تعبیه‌هایی (Embeddings) با 768 بُعد و در نسخه‌های 2.x، تعبیه‌هایی با 1024 بُعد تولید می‌کند. در نهایت، یک تنسور شرطی‌سازی ساخته می‌شود که در هر گام از عملیات تولید، اطلاعات معنایی پرامپت را به شبکه نویززدایی تزریق می‌کند.

معماری U-Net در مدل‌های انتشار نهفته و نحوه تزریق متن به آن

U-Net؛ هسته مرکزی نویززدایی

شبکه U-Net قلب تپنده فرایند در این معماری است. این شبکه در هر گام زمانی، نسخه نویزدار شده تصویر نهفته و تعبیه‌های متنی را هم‌زمان دریافت می‌کند. ساختار U-Net به گونه‌ای طراحی شده که بتواند هم جزئیات ریز و هم ساختار کلی تصویر را درک کند. لایه‌های توجه متقاطع در دل این شبکه قرار دارند و به متن پرامپت اجازه می‌دهند تا شکل نهایی تصویر را هدایت کنند. این شبکه به طور مداوم نویز اضافه شده را پیش‌بینی کرده و در طی یک فرایند تکراری، تصویر را از حالت آشفته به یک اثر هنری منسجم تبدیل می‌کند.

درک ظرافت‌های این معماری نشان می‌دهد که شکل‌گیری یک تصویر دیجیتال در کمتر از چند ثانیه، نیازمند سال‌ها تلاش مهندسی برای بهینه‌سازی پارامترها، انتخاب فضای داده مناسب و توسعه شبکه‌های عصبی پیشرفته است. همین چینش هوشمندانه باعث شده تا ابزارهای گرافیکی مبتنی بر هوش مصنوعی، به بخش جدایی‌ناپذیری از گردشکار خلاقان و طراحان تبدیل شوند.