内容生成容量与排版控制
Qwen-Image-3.0 将指令输入上限提升至 4.5k token,能够理解并渲染高信息密集的视觉版面,并具备横向拓展与纵向嵌套能力。
- 横向排版拓展:模型能够单次生成包含多种不同主题的信息图。在官方测试中,模型单次生成了包含隧道安全漫画、空间几何教学、古文分析、物理抛体运动等九个独立主题的九宫格图像,每个格子均包含精确的文字、公式与图表,未进行多图后期拼接。
- 纵向逻辑嵌套:模型能够处理语义解构与多层级界面嵌套。测试显示,模型可以通过单条指令在一幅图中展示从外到内依次嵌套的 VSCode 编程界面、通义千问对话框、微信聊天界面以及手冲咖啡海报,且各层级 UI 均能保持原本的视觉风格。
微观细节渲染精度
模型在细微文字和材质纹理的渲染上进行了优化,支持微观级别的画面刻画。
- 细微文字精准度:模型支持低至 10px 的微小字号渲染,能够呈现包含复杂 LaTeX 物理公式推导的学术论文页面,并支持在书籍和报纸画面上添加字迹自然的红色手写批注。
- 质感还原与图像编辑:在人像和物体生成中,模型能够还原细腻的毛孔与发丝纹理。在图像编辑任务中,模型能够对霉斑破损的水墨画进行高精度修复,并在补全缺失画面的同时保持原画的水墨渐变与笔触风格。
多语言与世界知识库
Qwen-Image-3.0 扩大了知识库覆盖面,提升了多语言排版和特定形象的创作能力。
- 多语言与 UI 仿真:原生支持日、韩、西等 12 国语言的文字渲染,并能仿真主流网页、社交直播界面以及 iOS、macOS、Windows 和 Android 操作系统的系统交互 UI。
- 联网知识与特定形象创作:模型支持联网获取实时信息进行内容创作,例如生成当天的实时天气预报图,并能识别特定的 IP 形象将齐白石与梵高置于同一直播间内进行二次创意构图。