# Qwen 开源 Qwen-Image-2.1：7B 统一生成与编辑并原生支持透明图像

- 来源：Qwen：Blog Retrieval（API）
- 作者：QwenTeam
- 发布时间：2026-09-20 20:00
- AIHOT 分数：72
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cmu9tfhu904turokx2vfjy34f
- 原文链接：https://qwen.ai/blog?id=qwen-image-2.1

## 精选理由

官方详解了 7B 统一图像模型的透明图像生成、10 图参考编辑与推理优化，读者可据此评估在设计等场景的可用性。

## AI 摘要

Qwen 团队开源 Qwen-Image-2.1，将文生图与图像编辑统一到一个模型中，视觉生成组件仅 7B 参数，并原生支持生成和编辑透明图像。模型支持最多 10 张参考图、圆形/涂鸦/独立蒙版指定局部编辑，通过混合粒度注意力架构和 KV cache 复用提升推理效率，同时改进文字渲染、人像光照与人物产品保真度，并覆盖全景图、信息图和分镜等任务。

## 正文

GITHUB HUGGING FACE MODELSCOPE

我们很高兴开源 Qwen-Image-2.1，这是 Qwen 家族中的一款图像模型，在生成质量、推理效率与成本之间取得平衡。Qwen-Image-2.1 将文生图生成与图像编辑统一在单一模型中，其视觉生成组件仅 7B 参数，并原生支持生成和编辑透明图像。

本次更新带来四项关键改进：

紧凑高效：轻量级架构与推理优化在图像质量与计算成本之间取得平衡。

原生透明，统一创作与编辑：根据提示词生成普通或透明图像，编辑透明图层，并从照片中提取主体。

多样化编辑：最多可使用 10 张参考图像，指定局部编辑，保留人物与产品，并处理各类任务。

逼真质感与精致美学：改进的排版、人像光影与精细细节让生成图像更具视觉吸引力。

紧凑高效#

Qwen-Image-2.1 采用轻量级架构。其视觉生成组件包含 32 层单流 DiT 和 7B 参数。尽管体量紧凑，该模型仍能提供出色的图像生成质量。下方的 Qwen-Image-Bench 对比展示了它与其他开源和闭源模型的表现对比。

Qwen-Image-Bench 评测对比

推理效率是另一个重点，尤其是在使用多张输入图像进行编辑时。这一优化来自 混合粒度注意力架构。文本（包括系统前缀和编辑指令）使用 token 级因果掩码，而图像生成使用块级掩码。KV cache 复用 使输入图像和编辑指令可作为静态上下文，在第一步中计算并缓存，从而提升推理效率并降低内存占用。

Qwen-Image-2.1 混合粒度注意力架构

原生透明度，统一创作与编辑#

原生透明度是本次发布的一大新增功能。2025 年 12 月，我们推出了 Qwen-Image-Layered，作为一款支持透明图像生成的专用模型。Qwen-Image-2.1 现将这一能力整合进统一模型，通过提示词决定是输出普通图像还是带透明度通道的图像。

以下是由文本直接生成的透明图像示例：

除了单个主体之外，该模型还能生成由多个元素构成的更复杂的透明图像，为设计和素材创作开辟了更多可能性。

通过统一生成与编辑，Qwen-Image-2.1 还支持直接编辑透明图像。例如，它可以在保留透明背景的同时改变主体的表情。左侧为输入，右侧为编辑结果。

透明图层中的文字同样可以编辑。在下面的示例中，“BLOOM”被替换为“Qwen-Image”。

这一能力也延伸到了真实照片。给定一张 RGB 图像，该模型可以将所需主体提取为带透明度的 RGBA 图层，从而更便于在后续的设计与合成工作中复用元素。

多样化编辑#

Qwen-Image-2.1 在四个方面改进了编辑能力：多参考图像、局部编辑、保真度保持以及任务覆盖范围。

多参考：最多 10 张输入图像#

Qwen-Image-2.1 支持最多 10 张参考图像，可将多个主体和素材组合成一幅协调的构图。在下面的合影示例中，左侧的六张单人肖像被汇聚到一张照片中。

一张由六张人像参考图生成的全家福照片

在虚拟试穿场景中，五个输入——模特、服装、鞋子、包和帽子——可以组合成一套完整的穿搭。

一套由五张参考图生成的完整穿搭

在室内设计场景中，模型可以使用 10 张家具图片生成一个完整的房间布置。

一个由十张家具参考图生成的室内场景

局部编辑：灵活的区域选择#

Qwen-Image-2.1 支持用圆圈、手绘标注和独立掩码来指定编辑应当发生的位置。

第一个示例使用不同颜色的圆圈一次性标出三个区域：“移除蓝色圆圈中的金属手表，将红色圆圈中的头发改为黑色，并将绿色圆圈中的区域替换为灰色短袖亚麻睡衣。”标注后的输入在左侧，结果在右侧。

手绘标注提供了另一种标出区域的方式。在这个示例中，模型在输入图像右侧用白色标出的区域中添加了一名潜水员。

圆圈和手绘标注会遮挡部分原始内容。为保留完整输入，Qwen-Image-2.1 还支持将原始图像和单独的掩码作为两个输入。以下示例要求模型使用这两张图像生成一个骑马牛仔：

模型对掩码指定的区域进行编辑，生成以下结果：

掩码引导编辑结果：一个骑马牛仔

局部编辑还可以支持连续创作。通过在保留场景其余部分的同时进行连续修改，编辑后的图像可以组合成简单的动画，如下方的水豚葫芦兄弟示例所示。

视频 · 前往原文观看

保真度：保留人物与产品#

保真度的改进主要集中在人像身份和产品一致性上。对于人像，模型能更好地保留面部特征，使人物身份在多次编辑中保持更高的一致性。下方每一组左侧为输入，右侧为编辑结果。

对于产品编辑，模型旨在保留文字、纹理和形状，使产品的标志性特征在新图像中保持一致。

任务覆盖范围：全景图、信息图与故事板#

Qwen-Image-2.1 支持广泛的编辑任务，包括全景图、信息图和分镜图生成，在不同应用之间实现了能力平衡。

例如，从这张自拍开始：

用于全景图生成的输入自拍

模型生成了以下全景图：

由自拍生成的全景图

随后可以在可视化工具中从不同视角方向探索这张全景图。

视频 · 前往原文观看

在信息图生成方面，一张模特照片可以被扩展为细节丰富、信息密集的构图。

用于信息图生成的输入模特照片

由模特照片生成的复杂信息图

该模型还可以将三视图角色参考图转化为完整的分镜图，为故事叙述和视觉叙事提供素材。

用于分镜图生成的三视图角色参考图

由角色参考图生成的完整分镜图

逼真的纹理与精致的美学#

Qwen-Image-2.1 进一步提升了视觉质量，尤其关注排版和肖像。文本渲染不仅考虑内容本身，还考虑字体样式、布局及其与整体构图的关系。以下示例展示了不同场景下的文本渲染效果。

文本渲染示例一

文本渲染示例二

文本渲染示例三

文本渲染示例四

对于肖像，改进的光照和精细细节让生成的图像呈现出更逼真的外观。

肖像光照与细节示例一

肖像光照与细节示例二

结论#

凭借紧凑的 7B 视觉生成组件，Qwen-Image-2.1 将图像生成、透明度和广泛的编辑能力集于一个模型之中。更快的推理速度、最多支持 10 张参考图像、灵活的局部编辑，以及对人物和产品更高的保真度，使其成为设计、内容创作、电商和视觉叙事的实用工具。

希望您喜欢用 Qwen-Image-2.1 进行创作！
