علیبابا نسخه جدید مدل هوش مصنوعی تصویرساز خود با نام Qwen Image 2.1 را معرفی کرده است؛ مدلی که علاوه بر تولید تصویر، قابلیتهای مختلفی برای ویرایش تصاویر دارد و با معماری ۷ میلیارد پارامتری توسعه یافته است. وزنهای این مدل نیز بهصورت متنباز منتشر شده تا توسعهدهندگان بتوانند از آن در پروژههای مختلف استفاده کنند.
به گفته علیبابا، Qwen Image 2.1 با هدف ایجاد تعادل میان کیفیت خروجی، سرعت پردازش و هزینه استفاده طراحی شده است. با وجود تعداد نسبتاً پایین پارامترها، این مدل برای کار با تصاویر پیچیده، چند تصویر مرجع و ویرایش بخشهای مشخصی از عکس بهینه شده است.
جدیدترین اخبار روز تکنولوژی در کانال تلگرام آونگ
Qwen Image 2.1 چیست؟
Qwen Image 2.1 جدیدترین نسل از مدلهای تصویری خانواده Qwen است که تمرکز اصلی آن روی تولید و ویرایش تصاویر با استفاده از هوش مصنوعی قرار دارد. این مدل با ۷ میلیارد پارامتر ساخته شده و بهدلیل متنباز بودن وزنها، امکان استفاده و توسعه آن برای طیف گستردهای از پروژهها وجود دارد.
یکی از ویژگیهای قابلتوجه Qwen Image 2.1 پشتیبانی بومی از شفافیت و لایههای RGBA است. به این ترتیب، مدل میتواند تصاویری با پسزمینه شفاف تولید یا ویرایش کند؛ قابلیتی که برای طراحی گرافیکی، ساخت تصاویر محصول و ترکیب چند تصویر میتواند کاربرد زیادی داشته باشد.
قابلیتهای جدید Qwen Image 2.1
Qwen Image 2.1 تنها به تولید تصویر از روی متن محدود نمیشود و مجموعهای از ابزارهای ویرایشی را نیز در اختیار کاربر قرار میدهد. برای مثال، میتوان بخش مشخصی از یک تصویر را تغییر داد، بدون اینکه ظاهر کلی سوژه به شکل محسوسی دستخوش تغییر شود.
این مدل همچنین امکان استفاده از تا ۱۰ تصویر مرجع را فراهم میکند. چنین قابلیتی میتواند در پروژههایی که نیاز به حفظ ظاهر یک شخصیت، محصول یا سوژه در تصاویر مختلف دارند، اهمیت زیادی داشته باشد.
علیبابا اعلام کرده است که Qwen Image 2.1 در ویرایش پرتره و تصاویر محصولات میتواند ویژگیها و جزئیات اصلی سوژه را با دقت مناسبی حفظ کند. بنابراین کاربر میتواند تغییراتی مانند اصلاح ظاهر، تغییر پسزمینه یا ویرایش بخش خاصی از تصویر را انجام دهد، بدون اینکه نتیجه نهایی کاملاً از تصویر اولیه فاصله بگیرد.
Qwen Image 2.1 در چه کارهایی کاربرد دارد؟
کاربردهای این مدل به تصاویر معمولی محدود نیست. علیبابا Qwen Image 2.1 را برای تولید انواع مختلف محتوای بصری توسعه داده است؛ از تصاویر پانوراما و اینفوگرافیک گرفته تا تصاویر مربوط به پرو مجازی لباس.
یکی دیگر از حوزههایی که در این مدل مورد توجه قرار گرفته، تولید بافتهای واقعگرایانه و تایپوگرافی است. توانایی تولید متن خوانا و قرار دادن آن در تصاویر یکی از چالشهای مهم مدلهای تصویرساز محسوب میشود و Qwen Image 2.1 تلاش کرده عملکرد خود را در این بخش بهبود دهد.
امکان استفاده همزمان از چند تصویر مرجع نیز کاربردهای خلاقانهتری ایجاد میکند. برای نمونه، علیبابا نشان داده است که با ارائه تصاویر یک شخصیت از سه زاویه مختلف، Qwen Image 2.1 میتواند بر اساس این اطلاعات یک استوریبرد کامل ایجاد کند.
این قابلیت میتواند برای طراحان، تولیدکنندگان محتوا و افرادی که در زمینه تبلیغات یا تولید محتوای تصویری فعالیت میکنند، کاربرد داشته باشد؛ چراکه حفظ ظاهر یک سوژه در چند صحنه مختلف معمولاً یکی از چالشهای تولید تصاویر با هوش مصنوعی است.
سرعت و عملکرد Qwen Image 2.1
یکی از نکات مهم درباره Qwen Image 2.1، معماری نسبتاً سبک آن است. این مدل با وجود برخورداری از قابلیتهای مختلف، تنها ۷ میلیارد پارامتر دارد و علیبابا تلاش کرده است این ساختار را با سرعت مناسب در زمان استنتاج همراه کند.
این موضوع بهخصوص هنگام استفاده از چند تصویر ورودی اهمیت بیشتری پیدا میکند. مدل باید اطلاعات بصری موجود در تصاویر مختلف را پردازش کرده و ارتباط میان آنها را در خروجی نهایی حفظ کند.
علیبابا معتقد است ترکیب معماری سبک، سرعت استنتاج و قابلیت پردازش چند تصویر باعث شده Qwen Image 2.1 بتواند در برخی سناریوها با مدلهای بسته و بزرگتر رقابت کند. البته مقایسه عملکرد مدلها به نوع وظیفه، سختافزار و معیار مورد استفاده بستگی دارد و نمیتوان صرفاً بر اساس تعداد پارامترها درباره کیفیت نهایی آنها قضاوت کرد.
Qwen Image 2.1 چه تفاوتی با نسل قبلی دارد؟
مهمترین تغییرات Qwen Image 2.1 را میتوان در گسترش قابلیتهای ویرایش تصویر، پشتیبانی بهتر از چند تصویر مرجع و اضافه شدن امکانات مربوط به تصاویر شفاف و RGBA مشاهده کرد.
در نسخه جدید، تمرکز بیشتری روی حفظ هویت بصری سوژه در زمان ویرایش شده است. همچنین قابلیتهایی مانند تولید اینفوگرافیک، تصاویر پانوراما، پرو مجازی لباس و استوریبردسازی، دامنه کاربردهای مدل را گستردهتر کردهاند.
از طرف دیگر، متنباز بودن وزنهای Qwen Image 2.1 این امکان را ایجاد میکند که توسعهدهندگان و پژوهشگران بتوانند مدل را در پروژههای خود بررسی و متناسب با نیازشان از آن استفاده یا توسعه دهند.
جمعبندی
Qwen Image 2.1 را میتوان یکی از مدلهای جدید علیبابا در حوزه تولید و ویرایش تصویر دانست که تلاش میکند قابلیتهای پیشرفته تصویری را در قالب یک مدل ۷ میلیارد پارامتری و متنباز ارائه کند. پشتیبانی از تصاویر شفاف، استفاده از حداکثر ۱۰ تصویر مرجع، ویرایش دقیقتر سوژهها و تمرکز روی تولید تایپوگرافی و بافتهای واقعگرایانه، از مهمترین ویژگیهای این مدل هستند.
برای اجرای مدلهای هوش مصنوعی، تولید محتوای تصویری و کار با فایلهای حجیم، داشتن حافظه ذخیرهسازی مطمئن و سختافزار مناسب اهمیت زیادی دارد. اگر برای سیستم خود از محصولات ذخیرهسازی مانند SSD یا هارددیسکهای ADATA استفاده میکنید، برخورداری از خدمات پس از فروش و پشتیبانی معتبر نیز میتواند خیال شما را بابت نگهداری اطلاعات راحتتر کند. آونگ بهعنوان تنها گارانتی محصولات ADATA در ایران، خدمات گارانتی و پشتیبانی این محصولات را ارائه میدهد تا کاربران بتوانند با اطمینان بیشتری از تجهیزات ذخیرهسازی خود استفاده کنند.

