تیم Qwen شرکت علی‌بابا سومین نسخه از تولیدکننده تصویر خود، Qwen-Image-3.0 را منتشر کرده است. به گفته توسعه‌دهندگان، نسخه اول بر روی «دقت» و نسخه دوم بر «دقت، تنوع، تکمیل، زیبایی و اصالت» تمرکز داشتند، اما این بار هدف اصلی با یک کلمه خلاصه می‌شود: «واقعی». این مدل برای انجام کارهای کاربردی مانند چیدمان روزنامه‌ها، استوری‌بوردها و برگه‌های امتحانی طراحی شده است، نه صرفاً خلق تصاویر زیبا.

پرامپت‌های طولانی‌تر و چیدمان‌های پیچیده در یک مرحله

مدل جدید پرامپت‌هایی با ظرفیت حداکثر 4500 توکن را می‌پذیرد. این فضای اضافی به هوش مصنوعی اجازه می‌دهد تا چیدمان‌های متراکم را در یک مرحله واحد بسازد، به جای آنکه بخش‌های مختلف را از چند تصویر مجزا مونتاژ کند.

نمونه چیدمان پیچیده تولید شده با Qwen-Image-3.0

یکی از دموهای ارائه‌شده، نه اینفوگرافیک مجزا را در یک شبکه 3 در 3 جای می‌دهد که هر کدام متن، فرمول و تصویرسازی‌های خاص خود را دارند. این پنل‌ها موضوعات متنوعی را پوشش می‌دهند؛ از فاصله امن پیروی نزدیک تونل‌ها و خطوط عمود بر هم گرفته تا درس کنفوسیوسی درباره احساس و عقل، سرعت جدا شدن پرتابه از سیلندر چرخان، چرخه زندگی فلوک کبدی، قضایای سیلو برای گروه‌های مرتبه 72، کنترل‌های داخلی بانک‌ها و ساختار DNA در سلول‌های جانوری و گیاهی.

تیم Qwen همچنین توانایی مدل در مدیریت رابط‌های کاربری تودرتو را به نمایش گذاشته است. یک نمونه با پنجره VSCode آغاز می‌شود که درون آن صفحه Qwen Chat قرار دارد و در داخل آن نیز یک مکالمه WeChat با پوستری برای آموزش تهیه قهوه دمی دیده می‌شود.

متن‌های ده‌پیکسلی و فرمول‌های لاتک

توسعه‌دهندگان ادعا می‌کنند این مدل توانایی تولید متن‌های خوانا با ابعاد بسیار کوچک و در حد 10 پیکسل را دارد. مثال‌های منتشرشده شامل یک اینفوگرافیک وال‌کوسه‌ماهی پر از متن و یک صفحه کامل از یک مقاله فرضی هندسه جبری است که در آن معادلات چند خطی لاتک با زیرنویس، بالا‌نویس، آکولاد، کسر، جمع و حاصل‌ضرب با دقت بالایی رندر شده‌اند.

نمایش رندر متن‌های بسیار ریز و فرمول‌های ریاضی

سایر دموها یک صفحه روزنامه شبیه‌سازی‌شده و یادداشت‌های دست‌نویس قرمزرنگی را نشان می‌دهند که شبیه به کامنت‌های یک معلم است. Qwen-Image-3.0 در بخش عکاسی نیز به دنبال ثبت جزئیات دقیق در پرتره‌ها و اشیاء است؛ از جمله منافذ پوستی قابل مشاهده و تارهای منفرد مو. در یک دمو ویرایشی، مدل نقاشی جوهر سنتی آسیب‌دیده‌ای از عقاب‌های در حال جنگ را ترمیم کرده و نواحی مفقود را با هماهنگی کامل با قلم‌مو و سایه‌روی اصلی پر کرده است.

پشتیبانی از دوازده زبان و ماکت‌های رابط کاربری

سومین حوزه تمرکز این هوش مصنوعی بر «دانش عمیق» استوار است. این مدل به صورت بومی از 12 زبان از جمله ژاپنی، کره‌ای و اسپانیایی پشتیبانی می‌کند. مثال‌های منتشرشده نشان می‌دهند که مدل توانایی بازسازی رابط‌های کاربری وب‌سایت‌ها، بازی‌ها و لایواستریم‌ها را دارد.

بازسازی رابط کاربری وب‌سایت‌ها و اپلیکیشن‌ها

در یک دمو ویرایشی دیگر، عکس یک حشره به یک صفحه شناسایی کامل با تاکسونومی، برچسب‌های ویژگی‌های فیزیکی، نماهای جزئی بزرگ‌نمایی‌شده و نوار مقیاس تبدیل شده است. مدل همچنین می‌تواند داده‌های زنده اینترنت را دریافت کرده و برای نمونه، پیش‌بینی آب‌وهوای شهر هانگژو را تولید کند. در مثالی جالب، چی بایشی، نقاش جوهری چینی و وینسنت ون گوگ در یک استودیوی لایواستریم شبیه‌سازی‌شده در کنار هم قرار گرفته‌اند.

دسترسی محدود و احتمال متن‌باز نبودن وزن‌ها

Qwen-Image-3.0 در حال حاضر تنها از طریق دسترسی API مبتنی بر دعوتنامه در دسترس است و قرار است به زودی در اپلیکیشن‌های شخص اول مانند Qwen Chat ادغام شود. برخلاف نسخه اولیه Qwen-Image، به احتمال زیاد وزن‌های این مدل تحت یک مجوز متن‌باز منتشر نخواهند شد.