
علیبابا را تولید تصاویر با پسزمینه شفاف منتشر کرد
اینجا شروع به نوشتن کعلیبابا نسل جدید مدل تصویری Qwen را با نام Qwen-Image-۲.۱ منتشر کرد؛ مدلی که تولید تصویر و ویرایش تصویر را در یک سیستم واحد ترکیب میکند و بخش تولید بصری آن تنها ۷ میلیارد پارامتر دارد. وزنهای مدل اکنون از طریق Hugging Face و ModelScope در دسترس قرار گرفتهاند و امکان اجرای محلی آن نیز فراهم است.
یکی از تغییرات اصلی Qwen-Image-۲.۱، پشتیبانی بومی از تصاویر دارای پسزمینه شفاف است. مدل میتواند مستقیماً از روی متن، تصویر RGBA تولید کند و در ویرایش تصاویر شفاف نیز اطلاعات مربوط به لایه شفافیت را حفظ کند. استخراج سوژه از عکس و تولید عناصر گرافیکی با پسزمینه شفاف نیز در همین فرایند انجام میشود.
قابلیت مهم دیگر، امکان استفاده از تا ۱۰ تصویر مرجع بهصورت همزمان است. کاربر میتواند چند تصویر را در اختیار مدل قرار دهد و از آنها برای ساخت یک ترکیب جدید استفاده کند. برای نمونه، میتوان تصاویر جداگانه یک شخصیت، لباس، کفش و سایر عناصر را به مدل داد و از آنها یک تصویر واحد ساخت.
Qwen-Image-۲.۱ همچنین امکان ویرایش موضعی تصویر را فراهم میکند. کاربر میتواند بخش مشخصی از تصویر را با دایره، علامتگذاری دستی یا ماسک مشخص کند و تغییر موردنظر را فقط روی همان ناحیه اعمال کند. حفظ هویت چهره افراد و ویژگی محصولات در فرایند ویرایش نیز از قابلیتهایی است که Qwen روی آن تأکید دارد.

بخش تولید تصویر این مدل از یک معماری Single-Stream DiT با ۳۲ لایه و ۷ میلیارد پارامتر استفاده میکند. Qwen برای کاهش هزینه پردازش، معماری توجه با دانهبندی ترکیبی و استفاده مجدد از KV Cache را به کار گرفته است.
در ویرایش چندتصویری، تصاویر مرجع و دستور ویرایش در مراحل مختلف تولید ثابت میمانند. مدل میتواند این اطلاعات را در مرحله نخست پردازش و ذخیره کند و در مراحل بعدی دوباره از همان اطلاعات استفاده کند. به گفته Qwen، این روش بهخصوص هنگام استفاده از چند تصویر مرجع میتواند محاسبات تکراری و مصرف حافظه را کاهش دهد.
مدل بهصورت بومی از خروجیهای ۲K نیز پشتیبانی میکند. وضوح پیشنهادی برای تصویر مربعی ۲۰۴۸×۲۰۴۸ پیکسل است و در نسبت تصویر ۱۶:۹ میتوان خروجی ۲۷۵۲×۱۵۳۶ پیکسلی تولید کرد.نید...














نظرات کاربران
۰