تصویر و رسانه مولد

مدل‌های تولید تصویر، ویدیو و موسیقی با هوش مصنوعی

سونو مدل v6 را با آموزش روی موزیک مجاز رونمایی کرد؛ جنگ حقوقی با غول‌های صنعت ادامه دارد
تصویر و رسانه مولد

سونو مدل v6 را با آموزش روی موزیک مجاز رونمایی کرد؛ جنگ حقوقی با غول‌های صنعت ادامه دارد

سونو مدل v6 را با ادعای آموزش انحصاری روی داده‌های مجاز از وارنر، BMG و بلیو منتشر کرد؛ در حالی که دعاوی سونی، یونیورسال و هنرمندان همچنان در جریان است. سه نسخه v6، v6 wild و v6 mini با قابلیت‌های ویرایش بخش‌آهنگ، رفرنس Multimedia و جداسازی استم عرضه شده‌اند.

محمد علی ذاکری۱۵ ساعت پیش
روایت‌های نودل؛ آموزش زندگی و تاب‌آوری در دانشگاه اموری
تصویر و رسانه مولد

روایت‌های نودل؛ آموزش زندگی و تاب‌آوری در دانشگاه اموری

درس «روایت‌های نودل در جاده ابریشم» در اموری نشان می‌دهد چگونه نودل، زوم و یک وب‌سایت کلاسی می‌توانند یادگیری را به تجربه‌ای زندگی‌محور و توانمندساز تبدیل کنند.

مهسا خالقی۱۰ شهریور ۱۴۰۵
مستند هوش مصنوعی Be Brave؛ بازآفرینی رنزو روسّو با ابزارهای مولد
تصویر و رسانه مولد

مستند هوش مصنوعی Be Brave؛ بازآفرینی رنزو روسّو با ابزارهای مولد

فرانچسکو کاروچینی با «Be Brave» رنزو روسّو را بدون فیلم‌برداری مستقیم بازآفرینی کرده؛ مستندی 85 دقیقه‌ای که هوش مصنوعی را هم ابزار و هم موضوع روایت قرار می‌دهد.

دانیال لطفی۹ شهریور ۱۴۰۵
ویدئوهای هوش مصنوعی چگونه در چین جای بازیگران و استریمرهای زنده را می‌گیرند
تصویر و رسانه مولد

ویدئوهای هوش مصنوعی چگونه در چین جای بازیگران و استریمرهای زنده را می‌گیرند

در سه‌ماهه اول 2026، اکثریت درام‌های کوتاه چین با هوش مصنوعی تولید شدند؛ فناوری‌هایی مانند Seedance سرعت و هزینه تولید را کاهش داده‌اند و پیامدهای حقوقی و شغلی جدی پدید آورده‌اند.

محمد علی ذاکری۷ شهریور ۱۴۰۵
بازار ویدئوی هوش مصنوعی پس از سورا: از دموی ناکام تا فاز تجاری
تصویر و رسانه مولد

بازار ویدئوی هوش مصنوعی پس از سورا: از دموی ناکام تا فاز تجاری

استودیوهای هالیوود، استارت‌آپ‌های میلیاردی و «کارخانه»های شخصیت‌های دیجیتال نشان می‌دهند بازار ویدئوی هوش مصنوعی پس از سورا مسیر رشد را ادامه می‌دهد.

محمد علی ذاکری۲۶ مرداد ۱۴۰۵
گوگل قابلیت حذف واترمارک قابل‌مشاهده در رسانه‌های تولیدشده با هوش مصنوعی را فعال کرد
تصویر و رسانه مولد

گوگل قابلیت حذف واترمارک قابل‌مشاهده در رسانه‌های تولیدشده با هوش مصنوعی را فعال کرد

گوگل گزینه غیرفعال‌سازی واترمارک قابل‌مشاهده برای تصاویر، ویدئوها و آهنگ‌های تولیدشده توسط مدل‌های Gemini را فعال کرد؛ SynthID و متادیتای C2PA همچنان باقی می‌مانند.

محمد علی ذاکری۲۳ مرداد ۱۴۰۵
Imagine Image 2.0 از xAI در بنچمارک Arena 2026 — نزدیک صدر اما پشت GPT-Image-2
تصویر و رسانه مولد

Imagine Image 2.0 از xAI در بنچمارک Arena 2026 — نزدیک صدر اما پشت GPT-Image-2

xAI نسخهٔ Imagine Image 2.0 را عرضه کرد؛ مدل در بنچمارک Arena مقام دوم را پس از GPT-Image-2 کسب کرده و ابزارهای ویرایشی و قالب‌های پیش‌تولید ویدیو را معرفی می‌کند.

محمد علی ذاکری۱۹ مرداد ۱۴۰۵
Seedance 2.5 بایت‌دنس: تولید هم‌زمان ویدئو و صدا تا ۳۰ ثانیه
تصویر و رسانه مولد

Seedance 2.5 بایت‌دنس: تولید هم‌زمان ویدئو و صدا تا ۳۰ ثانیه

Seedance 2.5 بایت‌دنس ویدئو و صدا را هم‌زمان تا 30 ثانیه تولید می‌کند؛ آپلود 30 تصویر و 10 ویدئو/صدا به‌عنوان مرجع، بهبود نورپردازی و دسترسی API در راه است.

محمد علی ذاکری۱۰ مرداد ۱۴۰۵
تغییر پارادایم تولید تصویر از GAN به مدل‌های انتشار
تصویر و رسانه مولد

تغییر پارادایم تولید تصویر از GAN به مدل‌های انتشار

تحلیل عمیق تفاوت‌های معماری GAN و مدل‌های انتشار، دلایل جابه‌جایی استاندارد تولید تصویر هوش مصنوعی و آینده معماری‌های ترکیبی در ایجاد محتوای بصری.

محمد علی ذاکری۷ مرداد ۱۴۰۵
انقلاب مدل‌های انتشار در DALL-E 2 و تحول تولید تصاویر واقع‌گرایانه
تصویر و رسانه مولد

انقلاب مدل‌های انتشار در DALL-E 2 و تحول تولید تصاویر واقع‌گرایانه

DALL-E 2 با گذار از ترنسفورمرهای خودبازگشتی به سمت مدل‌های انتشار (Diffusion) و تلفیق آن با CLIP، کیفیت تصاویر متنی را به سطح واقع‌گرایی حرفه‌ای ارتقا داد و قابلیت‌های ویرایش بی‌سابقه‌ای را معرفی کرد.

محمد علی ذاکری۷ مرداد ۱۴۰۵
کالبدشکافی معماری پشت پرده Stable Diffusion و مدل‌های انتشار نهفته
تصویر و رسانه مولد

کالبدشکافی معماری پشت پرده Stable Diffusion و مدل‌های انتشار نهفته

معماری مدل‌های انتشار نهفته (LDM) با فشرده‌سازی داده‌ها پیش از پردازش، انقلاب بزرگی در تولید تصاویر دیجیتال ایجاد کرده است. بررسی اجزای کلیدی Stable Diffusion از جمله VAE و شبکه U-Net.

محمد علی ذاکری۷ مرداد ۱۴۰۵
تکامل انقلاب تصویرسازی دیجیتال با معماری StyleGAN انویدیا
تصویر و رسانه مولد

تکامل انقلاب تصویرسازی دیجیتال با معماری StyleGAN انویدیا

با بررسی تکامل معماری StyleGAN انویدیا، به discoversیم چگونه این تکنولوژی بر پایه شبکه‌های GAN توانست با تولید چهره‌های فوتورئالیستی و ناموجود، مرز واقعیت و فانتزی را در هوش مصنوعی از بین ببرد.

محمد علی ذاکری۷ مرداد ۱۴۰۵