تیم Qwen شرکت علیبابا سومین نسخه از تولیدکننده تصویر خود، Qwen-Image-3.0 را منتشر کرده است. به گفته توسعهدهندگان، نسخه اول بر روی «دقت» و نسخه دوم بر «دقت، تنوع، تکمیل، زیبایی و اصالت» تمرکز داشتند، اما این بار هدف اصلی با یک کلمه خلاصه میشود: «واقعی». این مدل برای انجام کارهای کاربردی مانند چیدمان روزنامهها، استوریبوردها و برگههای امتحانی طراحی شده است، نه صرفاً خلق تصاویر زیبا.
پرامپتهای طولانیتر و چیدمانهای پیچیده در یک مرحله
مدل جدید پرامپتهایی با ظرفیت حداکثر 4500 توکن را میپذیرد. این فضای اضافی به هوش مصنوعی اجازه میدهد تا چیدمانهای متراکم را در یک مرحله واحد بسازد، به جای آنکه بخشهای مختلف را از چند تصویر مجزا مونتاژ کند.
یکی از دموهای ارائهشده، نه اینفوگرافیک مجزا را در یک شبکه 3 در 3 جای میدهد که هر کدام متن، فرمول و تصویرسازیهای خاص خود را دارند. این پنلها موضوعات متنوعی را پوشش میدهند؛ از فاصله امن پیروی نزدیک تونلها و خطوط عمود بر هم گرفته تا درس کنفوسیوسی درباره احساس و عقل، سرعت جدا شدن پرتابه از سیلندر چرخان، چرخه زندگی فلوک کبدی، قضایای سیلو برای گروههای مرتبه 72، کنترلهای داخلی بانکها و ساختار DNA در سلولهای جانوری و گیاهی.
تیم Qwen همچنین توانایی مدل در مدیریت رابطهای کاربری تودرتو را به نمایش گذاشته است. یک نمونه با پنجره VSCode آغاز میشود که درون آن صفحه Qwen Chat قرار دارد و در داخل آن نیز یک مکالمه WeChat با پوستری برای آموزش تهیه قهوه دمی دیده میشود.
متنهای دهپیکسلی و فرمولهای لاتک
توسعهدهندگان ادعا میکنند این مدل توانایی تولید متنهای خوانا با ابعاد بسیار کوچک و در حد 10 پیکسل را دارد. مثالهای منتشرشده شامل یک اینفوگرافیک والکوسهماهی پر از متن و یک صفحه کامل از یک مقاله فرضی هندسه جبری است که در آن معادلات چند خطی لاتک با زیرنویس، بالانویس، آکولاد، کسر، جمع و حاصلضرب با دقت بالایی رندر شدهاند.
سایر دموها یک صفحه روزنامه شبیهسازیشده و یادداشتهای دستنویس قرمزرنگی را نشان میدهند که شبیه به کامنتهای یک معلم است. Qwen-Image-3.0 در بخش عکاسی نیز به دنبال ثبت جزئیات دقیق در پرترهها و اشیاء است؛ از جمله منافذ پوستی قابل مشاهده و تارهای منفرد مو. در یک دمو ویرایشی، مدل نقاشی جوهر سنتی آسیبدیدهای از عقابهای در حال جنگ را ترمیم کرده و نواحی مفقود را با هماهنگی کامل با قلممو و سایهروی اصلی پر کرده است.
پشتیبانی از دوازده زبان و ماکتهای رابط کاربری
سومین حوزه تمرکز این هوش مصنوعی بر «دانش عمیق» استوار است. این مدل به صورت بومی از 12 زبان از جمله ژاپنی، کرهای و اسپانیایی پشتیبانی میکند. مثالهای منتشرشده نشان میدهند که مدل توانایی بازسازی رابطهای کاربری وبسایتها، بازیها و لایواستریمها را دارد.
در یک دمو ویرایشی دیگر، عکس یک حشره به یک صفحه شناسایی کامل با تاکسونومی، برچسبهای ویژگیهای فیزیکی، نماهای جزئی بزرگنماییشده و نوار مقیاس تبدیل شده است. مدل همچنین میتواند دادههای زنده اینترنت را دریافت کرده و برای نمونه، پیشبینی آبوهوای شهر هانگژو را تولید کند. در مثالی جالب، چی بایشی، نقاش جوهری چینی و وینسنت ون گوگ در یک استودیوی لایواستریم شبیهسازیشده در کنار هم قرار گرفتهاند.
دسترسی محدود و احتمال متنباز نبودن وزنها
Qwen-Image-3.0 در حال حاضر تنها از طریق دسترسی API مبتنی بر دعوتنامه در دسترس است و قرار است به زودی در اپلیکیشنهای شخص اول مانند Qwen Chat ادغام شود. برخلاف نسخه اولیه Qwen-Image، به احتمال زیاد وزنهای این مدل تحت یک مجوز متنباز منتشر نخواهند شد.





