Qwen 开源 Qwen-Image-2.1:7B 统一生成与编辑并原生支持透明图像 · AIHOT
📌 One-Sentence Summary Qwen 发布 Qwen-Image-2.1,一款 7B 参数的开源模型,统一生成与编辑并原生支持透明图像。 📝 Summary Qwen-Image-2.1 是一款开源图像模型,采用紧凑的 7B 参数 DiT 架构,能够统一文本到图像的生成与编辑,并原生支持透明图像。它引入了多项改进,例如支持最多十张参考图像进行编辑、通过圆形、手绘注释或单独掩码实现灵活的局部编辑、提升人物与产品的真实性,并具备全景图、信息图和分镜图的生成能力。模型还升级了文字渲染和人像照明,使输出更具真实美感,旨在平衡设计、内容创作、电子商务和视觉叙事的质量、效率与成本。 💡 Main Points 紧凑的 7B 架构兼顾质量与效率。 视觉生成模块采用 32 层单流 DiT,参数 7B,既能提供高质量图像,又通过混合粒度注意力和 KV 缓存复用降低计算成本。 原生透明图像支持统一创作与编辑。 模型可根据文本提示生成普通或 RGBA 透明图像,编辑透明层,并能将 RGB 照片中的主体提取为透明 RGBA 层,方便在设计流程中复用。 支持多达十张参考图像的多功能编辑与灵活的局部控制。 用户可使用最多十张参考图像组合多主体,通过圆形、手绘掩码或单独输入掩码进行区域编辑,并在编辑过程中保持人物与产品的身份一致。 提升真实性、美感与广泛任务覆盖。 改进的文字渲染、人像照明与细节保留使输出更具视觉吸引力;模型还支持全景图、信息图和分镜图的生成,拓展了在视觉叙事与数据呈现中的应用。 💬 Key Quotes Qwen-Image-2.1 采用轻量级架构。其视觉生成组件由 32 层单流 DiT 和 7B 参数组成。 Qwen-Image-2.1 原生支持生成与编辑透明图像。 它支持最多 10 张参考图像进行编辑。 该模型还提升了人物与产品的真实性。 Qwen-Image-2.1 支持全景图、信息图和分镜图的生成。 📊 Article Meta AI Screening: 89 Source: AIHOT — 精选 Author: noreply@aihot.news (Qwen:Blog Retrieval(API)) Category: 人工智能 Language: 英文 Read Time: 9 min Word Count: 2243 Tags: AI 与智能应用 , 图像生成 , 模型训练与推理 , 多模态 AI , 开源项目 Read Full Article
不错不错,已加入书签。
刚好最近在找这方面的资料,太及时了。