Qwen 开源 Qwen-Image-2.1:7B 统一生成与编辑并原生支持透明图像

Qwen:Blog Retrieval(API)·2026-09-20 20:00·1小时前·QwenTeam
AI 导读

Qwen 团队开源 Qwen-Image-2.1,将文生图与图像编辑统一到一个模型中,视觉生成组件仅 7B 参数,并原生支持生成和编辑透明图像。模型支持最多 10 张参考图、圆形/涂鸦/独立蒙版指定局部编辑,通过混合粒度注意力架构和 KV cache 复用提升推理效率,同时改进文字渲染、人像光照与人物产品保真度,并覆盖全景图、信息图和分镜等任务。

Qwen:Blog Retrieval(API)
精选
72AI 编辑部评分,满分 100

Qwen 开源 Qwen-Image-2.1:7B 统一生成与编辑并原生支持透明图像

2026-09-20 20:00· 1小时前· QwenTeam
AI 导读

Qwen 团队开源 Qwen-Image-2.1,将文生图与图像编辑统一到一个模型中,视觉生成组件仅 7B 参数,并原生支持生成和编辑透明图像。模型支持最多 10 张参考图、圆形/涂鸦/独立蒙版指定局部编辑,通过混合粒度注意力架构和 KV cache 复用提升推理效率,同时改进文字渲染、人像光照与人物产品保真度,并覆盖全景图、信息图和分镜等任务。

推荐理由

官方详解了 7B 统一图像模型的透明图像生成、10 图参考编辑与推理优化,读者可据此评估在设计等场景的可用性。

正文 · AI 翻译
Qwen-Image-2.1 banner

GITHUB HUGGING FACE MODELSCOPE

我们很高兴开源 Qwen-Image-2.1,这是 Qwen 家族中的一款图像模型,在生成质量、推理效率与成本之间取得平衡。Qwen-Image-2.1 将文生图生成与图像编辑统一在单一模型中,其视觉生成组件仅 7B 参数,并原生支持生成和编辑透明图像。

本次更新带来四项关键改进:

  • 紧凑高效:轻量级架构与推理优化在图像质量与计算成本之间取得平衡。
  • 原生透明,统一创作与编辑:根据提示词生成普通或透明图像,编辑透明图层,并从照片中提取主体。
  • 多样化编辑:最多可使用 10 张参考图像,指定局部编辑,保留人物与产品,并处理各类任务。
  • 逼真质感与精致美学:改进的排版、人像光影与精细细节让生成图像更具视觉吸引力。

紧凑高效#

Qwen-Image-2.1 采用轻量级架构。其视觉生成组件包含 32 层单流 DiT 和 7B 参数。尽管体量紧凑,该模型仍能提供出色的图像生成质量。下方的 Qwen-Image-Bench 对比展示了它与其他开源和闭源模型的表现对比。

Qwen-Image-Bench evaluation comparison

Qwen-Image-Bench 评测对比

推理效率是另一个重点,尤其是在使用多张输入图像进行编辑时。这一优化来自 混合粒度注意力架构。文本(包括系统前缀和编辑指令)使用 token 级因果掩码,而图像生成使用块级掩码。KV cache 复用 使输入图像和编辑指令可作为静态上下文,在第一步中计算并缓存,从而提升推理效率并降低内存占用。

Qwen-Image-2.1 mixed-granularity attention architecture

Qwen-Image-2.1 混合粒度注意力架构

原生透明度,统一创作与编辑#

原生透明度是本次发布的一大新增功能。2025 年 12 月,我们推出了 Qwen-Image-Layered,作为一款支持透明图像生成的专用模型。Qwen-Image-2.1 现将这一能力整合进统一模型,通过提示词决定是输出普通图像还是带透明度通道的图像。

以下是由文本直接生成的透明图像示例:

Transparent images generated from text (1) Transparent images generated from text (2) Transparent images generated from text (3)

除了单个主体之外,该模型还能生成由多个元素构成的更复杂的透明图像,为设计和素材创作开辟了更多可能性。

Transparent compositions with multiple elements (1) Transparent compositions with multiple elements (2)

通过统一生成与编辑,Qwen-Image-2.1 还支持直接编辑透明图像。例如,它可以在保留透明背景的同时改变主体的表情。左侧为输入,右侧为编辑结果。

Expression editing on a transparent image: input and result (1) Expression editing on a transparent image: input and result (2)

透明图层中的文字同样可以编辑。在下面的示例中,“BLOOM”被替换为“Qwen-Image”。

Transparent text editing: replacing BLOOM with Qwen-Image (1) Transparent text editing: replacing BLOOM with Qwen-Image (2)

这一能力也延伸到了真实照片。给定一张 RGB 图像,该模型可以将所需主体提取为带透明度的 RGBA 图层,从而更便于在后续的设计与合成工作中复用元素。

Extracting a transparent RGBA layer from an RGB photograph (1) Extracting a transparent RGBA layer from an RGB photograph (2)

多样化编辑#

Qwen-Image-2.1 在四个方面改进了编辑能力:多参考图像、局部编辑、保真度保持以及任务覆盖范围。

多参考:最多 10 张输入图像#

Qwen-Image-2.1 支持最多 10 张参考图像,可将多个主体和素材组合成一幅协调的构图。在下面的合影示例中,左侧的六张单人肖像被汇聚到一张照片中。

A group photograph generated from six portrait references

一张由六张人像参考图生成的全家福照片

在虚拟试穿场景中,五个输入——模特、服装、鞋子、包和帽子——可以组合成一套完整的穿搭。

A complete outfit generated from five reference images

一套由五张参考图生成的完整穿搭

在室内设计场景中,模型可以使用 10 张家具图片生成一个完整的房间布置。

An interior generated from ten furnishing references

一个由十张家具参考图生成的室内场景

局部编辑:灵活的区域选择#

Qwen-Image-2.1 支持用圆圈、手绘标注和独立掩码来指定编辑应当发生的位置。

第一个示例使用不同颜色的圆圈一次性标出三个区域:“移除蓝色圆圈中的金属手表,将红色圆圈中的头发改为黑色,并将绿色圆圈中的区域替换为灰色短袖亚麻睡衣。”标注后的输入在左侧,结果在右侧。

Circle-guided editing of a watch, hair, and clothing (1) Circle-guided editing of a watch, hair, and clothing (2)

手绘标注提供了另一种标出区域的方式。在这个示例中,模型在输入图像右侧用白色标出的区域中添加了一名潜水员。

Paint-guided editing: adding a diver to the marked region (1) Paint-guided editing: adding a diver to the marked region (2)

圆圈和手绘标注会遮挡部分原始内容。为保留完整输入,Qwen-Image-2.1 还支持将原始图像和单独的掩码作为两个输入。以下示例要求模型使用这两张图像生成一个骑马牛仔:

Local editing inputs: original image and separate mask (1) Local editing inputs: original image and separate mask (2)

模型对掩码指定的区域进行编辑,生成以下结果:

Mask-guided editing result: a cowboy on horseback

掩码引导编辑结果:一个骑马牛仔

局部编辑还可以支持连续创作。通过在保留场景其余部分的同时进行连续修改,编辑后的图像可以组合成简单的动画,如下方的水豚葫芦兄弟示例所示。

视频 · 前往原文观看

保真度:保留人物与产品#

保真度的改进主要集中在人像身份产品一致性上。对于人像,模型能更好地保留面部特征,使人物身份在多次编辑中保持更高的一致性。下方每一组左侧为输入,右侧为编辑结果。

Portrait fidelity example one: input and result (1) Portrait fidelity example one: input and result (2) Portrait fidelity example two: input and result (1) Portrait fidelity example two: input and result (2) Portrait fidelity example three: input and result (1) Portrait fidelity example three: input and result (2)

对于产品编辑,模型旨在保留文字、纹理和形状,使产品的标志性特征在新图像中保持一致。

Product fidelity example one: input and result (1) Product fidelity example one: input and result (2) Product fidelity example two: input and result (1) Product fidelity example two: input and result (2) Product fidelity example three: input and result (1) Product fidelity example three: input and result (2)

任务覆盖范围:全景图、信息图与故事板#

Qwen-Image-2.1 支持广泛的编辑任务,包括全景图、信息图和分镜图生成,在不同应用之间实现了能力平衡。

例如,从这张自拍开始:

Input selfie for panorama generation

用于全景图生成的输入自拍

模型生成了以下全景图:

Panorama generated from the selfie

由自拍生成的全景图

随后可以在可视化工具中从不同视角方向探索这张全景图。

视频 · 前往原文观看

在信息图生成方面,一张模特照片可以被扩展为细节丰富、信息密集的构图。

Input model photograph for infographic generation

用于信息图生成的输入模特照片

Complex infographic generated from the model photograph

由模特照片生成的复杂信息图

该模型还可以将三视图角色参考图转化为完整的分镜图,为故事叙述和视觉叙事提供素材。

Three-view character reference for storyboard generation

用于分镜图生成的三视图角色参考图

Complete storyboard generated from the character reference

由角色参考图生成的完整分镜图

逼真的纹理与精致的美学#

Qwen-Image-2.1 进一步提升了视觉质量,尤其关注排版和肖像。文本渲染不仅考虑内容本身,还考虑字体样式、布局及其与整体构图的关系。以下示例展示了不同场景下的文本渲染效果。

Text rendering example one

文本渲染示例一

Text rendering example two

文本渲染示例二

Text rendering example three

文本渲染示例三

Text rendering example four

文本渲染示例四

对于肖像,改进的光照和精细细节让生成的图像呈现出更逼真的外观。

Portrait lighting and detail example one

肖像光照与细节示例一

Portrait lighting and detail example two

肖像光照与细节示例二

结论#

凭借紧凑的 7B 视觉生成组件,Qwen-Image-2.1 将图像生成、透明度和广泛的编辑能力集于一个模型之中。更快的推理速度、最多支持 10 张参考图像、灵活的局部编辑,以及对人物和产品更高的保真度,使其成为设计、内容创作、电商和视觉叙事的实用工具。

希望您喜欢用 Qwen-Image-2.1 进行创作!

来源:Qwen:Blog Retrieval(API)· qwen.ai