شرکت هوش مصنوعی آلمانی بلک فورست لبز (Black Forest Labs) با معرفی مدل پایه چندوجهی فلاکس ۳ (Flux 3)، فصل تازهای در تولید محتوای مولد گشوده است. این مدل به طور همزمان از تصاویر، ویدیوها و صداها یاد میگیرد تا درک عمیقتری از دنیای فیزیکی و دیجیتال پیدا کند و شکاف میان واقعیت و شبیهسازی را کاهش دهد.
تولید ویدیوهای ۲۰ ثانیهای با صدای بومی
مهمترین دستاورد فلاکس ۳، توانایی تولید ویدیوهایی تا ۲۰ ثانیه با صدای بومی (Native Audio) است. این فناوری از روشهایی مانند تبدیل متن به ویدیو، تصویر به ویدیو و دیالوگهای چندزبانه پشتیبانی میکند. کاربران میتوانند کلیپهای مجزا را به یکدیگر زنجیر کرده و توالیهای چندشاتِ طولانیتری بسازند. بلک فورست لبز تاکید دارد که فلاکس ۳ در شبیهسازی حالات چهره انسان و هماهنگ کردن صداها با رویدادهای فیزیکی عملکرد درخشانی دارد.
طبق استدلال این شرکت آلمانی، هیچ حالت منفردی نمیتواند واقعیت را به تنهایی بازتاب دهد. تصاویر ساختار فضایی را نشان میدهند، ویدیو تغییرات زمانی را ثبت میکند و صدا رویدادهای مکانیکی را آشکار میسازد. آموزش همزمان بر هر سه مورد به مدل اجازه میدهد خلأهای یکدیگر را پر کند و به اطلاعات بسیار کاملتری نسبت به گذشته دست یابد.
رقابت تنگاتنگ با غولهای تولید ویدیو
نتایج اولیه ارزیابیها با کلیپهای ۱۰ ثانیهای در کیفیت 720p نشان میدهد فلاکس ۳ در 93 درصد موارد نسبت به Luma Ray 3.2 و در 77 درصد موارد نسبت به Runway Gen-4.5 ترجیح داده شده است. این مدل همچنین در 69 درصد مقایسهها بر Grok Imagine Video غلبه کرد.
در برابر رقبای قدرتمندتری نظیر Kling v3 Pro و Seedance 2.0، اختلاف کمتر میشود؛ اما فلاکس ۳ همچنان در 60 تا 52 درصد مواقع انتخاب کاربران بوده است. همتراز شدن با سیستمی مانند Seedance که پیشتر راهی هالیوود شده بود، جایگاه این مدل آلمانی را در میان برترینهای بازار تثبیت میکند. البته بلک فورست لبز تاکید میکند این نتایج اولیه هستند و منتظر آزمایشهای مستقل است.
از تولید محتوا تا رباتیک صنعتی
فلاکس ۳ تنها یک تولیدکننده ویدیو نیست. بلک فورست لبز این مدل را گامی به سوی «هوش بصری در دنیای واقعی» میداند؛ سیستمی که میتواند محیط را درک، پیشبینی و در آن عمل کند. بر همین اساس، همکاری با Mimic Robotics برای توسعه Flux-mimic آغاز شده است. این مدل کنش ویدیویی اکنون در خطوط تولید خودروسازی آئودی (Audi) آزمایش میشود تا عملکردهای رباتیک را بهینهسازی کند.
معماری Self-Flow و عرضه تدریجی
بنیان فلاکس ۳ بر رویکرد Self-Flow استوار است. در این معماری، یک ترانسفورمر چندوجهی با استفاده از اجزای اختصاصی، تصاویر، ویدیو و صدا را به یک بازنمایی داخلی مشترک تبدیل کرده و سپس آنها را به خروجی مطلوب تبدیل میکند. وجود بخشی برای پیشبینی کنشها، پایهگذار کاربردهای رباتیک در این مدل است. این یادگیری یکپارچه، نتایج باکیفیتتری نسبت به روشهای استاندارد قبلی نظیر flow-matching ارائه میدهد.
بلک فورست لبز عرضه قابلیتها را به صورت مرحلهای برنامهریزی کرده است. نسخه ویدیویی اکنون در دسترس است و نسخه تصویری (Flux 3 Image) که در رندر دقیق متنهای چندزبانه و درخواستهای پیچیده تبحر دارد، در هفتههای آینده منتشر خواهد شد. علاوه بر این، شرکت قصد دارد دسترسی به وزنهای باز (Open-weight) را تحت عنوان «Flux 3 Dev» برای توسعهدهندگان فراهم کند تا اکوسیستم مدلهای چندوجهی در آینده گسترش یابد.





