阿里发布Qwen-Image 3.0,目前仍处于邀请测试阶段

阿里正式发布第三代图像生成基础模型 Qwen-Image 3.0,这一代主要加强了复杂内容生成、细节表现和知识理解能力。

Qwen-Image 3.0 可接收最长约 4.5k token 的指令,适合处理信息量较大的画面。官方展示中,模型可以一次生成包含多个复杂信息图的九宫格,每个格子还能单独呈现数学 PPT、隧道安全漫画等内容;也能在同一张图里组合 VSCode 编程界面、微信聊天记录、手冲咖啡海报等不同元素,制作多层嵌套的“画中画”效果。

文字生成也是这次升级的重点。模型据称可以渲染约 10px 的小字,并较完整地呈现代数几何论文中的 LaTeX 公式、上下标、花括号和多行对齐内容。除了文字准确度,它还能模拟报纸纸张、红色手写批注等细节,人像毛孔、发丝以及皮革纹理也有进一步提升,同时支持传统绘画破损区域的修复。

语言方面,Qwen-Image 3.0 原生支持 12 种语言文字生成,还可以制作网页、游戏、直播间等 UI 界面。依靠模型自身的知识储备,它也能生成昆虫分类学信息图等学术配图,并支持联网获取实时信息,例如制作杭州天气预报图。官方还展示了结合特定 IP 形象进行创作的案例,比如让齐白石和梵高出现在同一个直播场景中。

从展示方向来看,Qwen-Image 3.0 想覆盖的不只是常规图片生成,还包括报纸 PDF、复杂 UI、短剧分镜、学术配图和信息图等偏生产力的场景。

不过,目前该模型还处于邀请测试阶段,并未正式向普通用户开放,实际生成效果暂时很难验证。它能不能达到 GPT Image 2、Nano Banana 2 或即梦 5.0 的水平,现在也不好判断。

按照千问以往的习惯,不知道Qwen-Image 3.0后续是否存在开源的可能。如果真能开源,即使综合能力没有完全追上目前第一梯队,也依然会有不小的吸引力。只是现阶段的状态多少有些含糊:消息已经宣布发布,外界却还没有一个可以直接体验的入口,具体水平只能先看官方展示。

以下均为Qwen-Image 3.0生成的图片:

不知道实际效果怎么样

还在邀请测试阶段,普通人想上手还得再等等

还在邀请测试阶段,实际效果暂时不好说