首页 > 人工智能 > 7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图
2026
09-21

7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图

快科技9月21日消息,阿里千问正式开源新一代图像模型Qwen-Image-2.1,将文生图与图像编辑整合在同一模型中。
视觉生成部分仅7B参数,却在Qwen-Image-Bench公开评测中拿下60.28总分登顶开源第一,甚至超过闭源的Nano Banana 2.0(59.82)和GPT Image 1.5(59.65),官方将其定位为千问图像系列当前"最平衡、性价比最高"的开源生图模型。
7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图
7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图
视觉生成部分采用32层Single-Stream DiT,原生支持2K分辨率输出,整个管线(含Qwen3-VL 8B文本编码器)总参数量约16.22B。
推理侧引入混合粒度注意力结构:文本部分(系统前缀、编辑指令)走Token级因果掩码,图像生成部分走Chunk级掩码,配合KV Cache复用机制将输入图像与编辑指令作为静态上下文在首步预计算缓存。
多图输入场景下的效率提升尤为明显,兼顾了推理速度与显存开销。
7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图
7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图
原生RGBA透明图是本次更新最具实用价值的能力,模型可根据提示词自动决定输出普通图像还是带透明通道的图像,无需额外的抠图环节。
这项能力吸收了2025年12月发布的Qwen-Image-Layered专用模型,并进一步扩展——不仅能生成单个主体的透明素材,也能生成多元素组合的复杂结构图像;透明图层中的文字、人物表情均可直接编辑。
7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图
7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图
输入一张RGB真实照片,模型可提取主体输出带Alpha通道的RGBA图层,毛发边缘这类传统抠图痛点从根源上被绕开。
编辑能力有四个维度升级,参考图上限提升到10张,可将多张人像合成合照,也可输入模特+衣服+鞋子+包包+帽子共5张图生成完整穿搭,还能参考10张家装图输出室内布置方案;局部编辑支持圈选、涂抹和独立掩码三种方式,一次指定多个区域分别修改,掩码方式可完整保留原图信息。
7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图
7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图
人像与商品保真增强,修图前后面部特征保持高度一致,商品在新场景中文字、纹理与形态不走样;同时覆盖全景图、信息图、分镜图等多种任务类型。
文字生成除内容准确外,更注重字体、排版与画面的整体协调;人物表现上强化光影与细节刻画,让生成结果更接近真实质感。
7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图
7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图
7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图
7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图
7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图
7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图
7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图
7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图
7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图
7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图
7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图
7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图
【本文结束】出处:快科技