内容丰实:支持最大4.5k token输入,轻松生成报纸、分镜、试卷等复杂版面。
细节真实:支持 10px 小字精准渲染,毛孔、发丝细节生动还原,逼真的微观级刻画。
知识厚实:支持12国语言原生渲染,主流网页、游戏、直播等界面仿真,拥有丰富的世界知识。
内容丰实:能画多复杂?
内容可横展:知识九宫格
这是一张由Qwen-Image-3.0准确渲染的数学PPT,包括空间关系、数学符号、定理描述等等这些丰富的视觉内容,有着合理的排版和相对位置关系。

而这只是Qwen-Image-3.0真实能力的“1/9”,因为这张图事实上只是Qwen-Image-3.0生成的一个复杂9宫格图片中的一个格子。让我们看原图:

上面整张图是Qwen-Image-3.0一次性生成的,而非多个图片拼接而成。这张图片难度在于,每个格子都是一张复杂信息图,如果要精准的描述完整的九宫格,整整需要3.7k个token。
这3.7k token需要完整的刻画隧道安全漫画、空间几何教学、《出师表》文体分析、物理抛体运动、生物寄生虫科普、右胸疼痛医学图解、群论 Sylow 定理、银行内控管理信息图、以及细胞 DNA 结构对比——每一格都包含精确的中英文文字、公式、图表和漫画人物等等。
而这对于Qwen-Image-3.0来说依然轻松,因为Qwen-Image-3.0 将可接受的指令长度提升至 4.5k token,这意味着模型可以理解和渲染极其复杂、信息密集的视觉版面。
这就是Qwen-Image-3.0"内容丰实"的一个重要特点:内容可横展(横向扩展)。横展能力反映了模型语义并置与空间控制的实力——能够让多种概念在同一画面中有序布局、互不干扰地渲染。
内容有纵深:界面嵌套
横展能力考验的是"在一张画布上摆放多少个并列元素",纵深能力则考验模型的语义解构与逻辑嵌套——能否在一幅图中层层递进地渲染多个嵌套的界面。
以下示例用一条指令在一幅图中从外到内依次展示了:VSCode 编程界面 → 千问聊天界面 → 社交媒体聊天界面 → 手冲咖啡海报。每一层都保持了各自 UI 的真实风格与细节,形成了"画中画中画"的视觉纵深。

细节真实:能画多逼真?
如果说"内容丰实"解决的是"画多少"的问题,那么"细节真实"解决的是"画多细"的问题。Qwen-Image-3.0 在微观细节上的渲染精度达到了新的高度:10px 小字清晰可辨,毛孔与发丝纤毫毕现,肌肤质感逼近摄影级真实。
鲸鲨的知识图解
这是一张关于鲸鲨的知识图解,包含大量的文字和插图,而Qwen-Image-3.0能够准确渲染每个区域。

学术论文PDF
学术论文是小字渲染的极限测试场,模型完整渲染了一整页代数几何领域的学术论文,包含多行复杂公式推导。上标、下标、花括号、分数线、多行对齐等 LaTeX 排版元素均准确呈现,小字号下依然保持了极高的可读性。

笔记批注
模型在书页上叠加了逼真的红色手写批注——下划线、波浪线、圈画、箭头和简短评语,字迹自然流畅,完美模拟了高中生课堂笔记的风格。

人像摄影
在人像摄影中,模型也能够刻画非常细腻的纹理。

物体纹理
除人像之外,模型也能刻画其他物体的纹理细节。

知识厚实:理解的知识边界有多广?
"内容丰实"回答了"能画多复杂","细节真实"回答了"能画多逼真",而"知识厚实"回答的是"能画多广"。Qwen-Image-3.0 拥有覆盖 12 国语言、多种字体、100+ 艺术风格和多种 UI 界面的渲染能力,其背后是模型对世界知识的深度理解。
西班牙语渲染

仿真UI界面

复杂信息图

