Релиз Qwen-Image-2.1: нейросеть с нативной прозрачностью и умным редактором

Команда разработчиков Qwen представила новую модель Qwen-Image-2.1, которая способна генерировать изображения с нативной прозрачностью и редактировать готовые файлы с помощью простых графических пометок. Релиз состоялся 20 сентября, и веса модели уже доступны на платформах Hugging Face и ModelScope. Несмотря на открытый доступ к технологиям, текущая лицензия ограничивает использование нейросети исключительно исследовательскими целями.
Ключевые возможности и работа с прозрачным фоном
Главной технической особенностью Qwen-Image-2.1 является встроенная поддержка альфа-канала. В отличие от большинства существующих генераторов, где прозрачный фон приходится создавать на этапе постобработки с помощью сторонних инструментов, эта модель работает с форматом RGBA на уровне архитектуры. Это позволяет получать готовые PNG-изображения с прозрачным слоем сразу после генерации по текстовому запросу.
Такой функционал делает модель крайне полезной для создания графических элементов, таких как:
- стикеры и иконки;
- логотипы;
- карточки товаров для маркетплейсов.
Чтобы активировать режим прозрачности, пользователям необходимо использовать специальную формулировку в запросе, указывающую на наличие альфа-канала и прозрачного фона.
Умное редактирование и использование референсов
Модель демонстрирует высокую гибкость при работе с визуальными данными. Qwen-Image-2.1 может принимать до десяти референсных изображений одновременно. Это открывает широкие возможности для композиции: например, можно собрать групповое фото из нескольких портретов или создать полноценный образ персонажа, объединив отдельные снимки одежды, обуви и аксессуаров.
Для точечного изменения уже существующих картинок предусмотрено три способа управления:
- обводка нужной области кругом непосредственно на изображении;
- ручное закрашивание участка;
- использование отдельной маски.
Система позволяет проводить несколько правок одновременно, сохраняя при этом узнаваемость лиц и объектов. Кроме того, модель способна работать со сложными задачами, такими как создание панорам из селфи или генерация раскадровок персонажа в разных ракурсах.
Технические характеристики и производительность
Разработчики из Alibaba сделали ставку на оптимизацию. Новая модель содержит около семи миллиардов параметров и использует 32 слоя Single-Stream DiT, что делает её значительно компактнее первой версии семейства Qwen-Image. Обработку текста и входящих изображений осуществляет языковая модель Qwen3-VL 8B.
Для повышения скорости работы применяется механизм повторного использования KV-кеша. Это позволяет не пересчитывать служебные данные текста и референсов на каждом шаге, что существенно ускоряет процесс редактирования сложных сцен. По умолчанию модель способна генерировать изображения в разрешении 2048×2048 пикселей и поддерживает различные пропорции, включая широкоформатный режим 16:9.
Лицензионные ограничения и доступность
Важно понимать различие между открытыми весами и открытой лицензией. Qwen-Image-2.1 распространяется под Qwen Research License, которая позволяет использовать модель бесплатно только для научных исследований и тестирования. Для коммерческого внедрения в платные продукты необходимо заключать отдельный договор с Hangzhou Tongyi Laboratory.
Если вы планируете использовать модель локально, доступны следующие варианты:
- готовые шаблоны для ComfyUI;
- поддержка в библиотеке Diffusers;
- серверные решения на базе vLLM и SGLang.
Модель оптимизирована для работы на видеокартах NVIDIA и AMD (через ROCm), а для экономии видеопамяти предусмотрена возможность выгрузки части данных в оперативную память или использование версии FP8.
Вывод: Qwen-Image-2.1 — это мощный и компактный инструмент, предлагающий уникальную функцию прямой генерации прозрачных объектов. Несмотря на ограничения в коммерческом использовании, технологический прорыв в работе с альфа-каналом делает её крайне интересной для исследователей и дизайнеров в рамках личных проектов.
