探索索引返回模型
Qwen-Image-2.1
阿里云通义千问团队于 2026 年 9 月开源的统一多模态图像生成与编辑模型。模型采用 7B 参数的 32 层单流 Diffusion Transformer(DiT)底座与 Qwen3-VL 8B 编码器,原生支持 2K 分辨率、RGBA 透明通道输出以及最多 10 张参考图联合条件引导,并引入前缀 KV Cache 复用降低迭代去噪开销。
阿里云通义千问团队于 2026 年 9 月开源的统一多模态图像生成与编辑模型。模型采用 7B 参数的 32 层单流 Diffusion Transformer(DiT)底座与 Qwen3-VL 8B 编码器,原生支持 2K 分辨率、RGBA 透明通道输出以及最多 10 张参考图联合条件引导,并引入前缀 KV Cache 复用降低迭代去噪开销。