شرکت هوش مصنوعی آلمانی بلک فورست لبز (Black Forest Labs) با معرفی مدل پایه چندوجهی فلاکس ۳ (Flux 3)، فصل تازه‌ای در تولید محتوای مولد گشوده است. این مدل به طور همزمان از تصاویر، ویدیوها و صداها یاد می‌گیرد تا درک عمیق‌تری از دنیای فیزیکی و دیجیتال پیدا کند و شکاف میان واقعیت و شبیه‌سازی را کاهش دهد.

تولید ویدیوهای ۲۰ ثانیه‌ای با صدای بومی

مهم‌ترین دستاورد فلاکس ۳، توانایی تولید ویدیوهایی تا ۲۰ ثانیه با صدای بومی (Native Audio) است. این فناوری از روش‌هایی مانند تبدیل متن به ویدیو، تصویر به ویدیو و دیالوگ‌های چندزبانه پشتیبانی می‌کند. کاربران می‌توانند کلیپ‌های مجزا را به یکدیگر زنجیر کرده و توالی‌های چندشاتِ طولانی‌تری بسازند. بلک فورست لبز تاکید دارد که فلاکس ۳ در شبیه‌سازی حالات چهره انسان و هماهنگ کردن صداها با رویدادهای فیزیکی عملکرد درخشانی دارد.

طبق استدلال این شرکت آلمانی، هیچ حالت منفردی نمی‌تواند واقعیت را به تنهایی بازتاب دهد. تصاویر ساختار فضایی را نشان می‌دهند، ویدیو تغییرات زمانی را ثبت می‌کند و صدا رویدادهای مکانیکی را آشکار می‌سازد. آموزش همزمان بر هر سه مورد به مدل اجازه می‌دهد خلأهای یکدیگر را پر کند و به اطلاعات بسیار کامل‌تری نسبت به گذشته دست یابد.

رقابت تنگاتنگ با غول‌های تولید ویدیو

نتایج اولیه ارزیابی‌ها با کلیپ‌های ۱۰ ثانیه‌ای در کیفیت 720p نشان می‌دهد فلاکس ۳ در 93 درصد موارد نسبت به Luma Ray 3.2 و در 77 درصد موارد نسبت به Runway Gen-4.5 ترجیح داده شده است. این مدل همچنین در 69 درصد مقایسه‌ها بر Grok Imagine Video غلبه کرد.

در برابر رقبای قدرتمندتری نظیر Kling v3 Pro و Seedance 2.0، اختلاف کمتر می‌شود؛ اما فلاکس ۳ همچنان در 60 تا 52 درصد مواقع انتخاب کاربران بوده است. همتراز شدن با سیستمی مانند Seedance که پیش‌تر راهی هالیوود شده بود، جایگاه این مدل آلمانی را در میان برترین‌های بازار تثبیت می‌کند. البته بلک فورست لبز تاکید می‌کند این نتایج اولیه هستند و منتظر آزمایش‌های مستقل است.

از تولید محتوا تا رباتیک صنعتی

فلاکس ۳ تنها یک تولیدکننده ویدیو نیست. بلک فورست لبز این مدل را گامی به سوی «هوش بصری در دنیای واقعی» می‌داند؛ سیستمی که می‌تواند محیط را درک، پیش‌بینی و در آن عمل کند. بر همین اساس، همکاری با Mimic Robotics برای توسعه Flux-mimic آغاز شده است. این مدل کنش ویدیویی اکنون در خطوط تولید خودروسازی آئودی (Audi) آزمایش می‌شود تا عملکردهای رباتیک را بهینه‌سازی کند.

معماری Self-Flow و عرضه تدریجی

بنیان فلاکس ۳ بر رویکرد Self-Flow استوار است. در این معماری، یک ترانسفورمر چندوجهی با استفاده از اجزای اختصاصی، تصاویر، ویدیو و صدا را به یک بازنمایی داخلی مشترک تبدیل کرده و سپس آن‌ها را به خروجی مطلوب تبدیل می‌کند. وجود بخشی برای پیش‌بینی کنش‌ها، پایه‌گذار کاربردهای رباتیک در این مدل است. این یادگیری یکپارچه، نتایج باکیفیت‌تری نسبت به روش‌های استاندارد قبلی نظیر flow-matching ارائه می‌دهد.

بلک فورست لبز عرضه قابلیت‌ها را به صورت مرحله‌ای برنامه‌ریزی کرده است. نسخه ویدیویی اکنون در دسترس است و نسخه تصویری (Flux 3 Image) که در رندر دقیق متن‌های چندزبانه و درخواست‌های پیچیده تبحر دارد، در هفته‌های آینده منتشر خواهد شد. علاوه بر این، شرکت قصد دارد دسترسی به وزن‌های باز (Open-weight) را تحت عنوان «Flux 3 Dev» برای توسعه‌دهندگان فراهم کند تا اکوسیستم مدل‌های چندوجهی در آینده گسترش یابد.