今天,阿里通义团队发布了他们第三代图像生成模型:Qwen-Image-3.0 。


官方博客用了一个字来概括这一代的核心进步,「实」。

不是好看,不是炫技,是「实」。内容丰实、细节真实、知识厚实。


具体来说:支持最大4.5k token的超长指令输入,可以在同一张图里塞进九宫格级别的复杂信息量,每个格子都是一张独立的信息图,而且是一次性生成,不是多张拼接。文字渲染精度做到了10px小字依然清晰可辨,LaTeX公式、学术论文排版无障碍。覆盖12国语言的原生渲染,支持100多种艺术风格,甚至能联网搜索实时信息直接生成天气预报图。


如果你看过我们之前对AI图像模型的报道,会知道这种「官方宣布重大突破」我们已经听了不少次。每一次新模型发布都在讲自己的新高度,但真正用起来怎么样,往往需要亲自上手才知道。

尤其是,对面的GPT-Image-2今年4月刚把Image Arena排行榜的第一名甩开第二名242分,这是该榜单有史以来最大的领先差距 。99%字符准确率、原生4K输出、3秒内出图、Thinking Mode自检机制,这些数字让Qwen-Image-3.0一出生就直接面对着一个几乎满级的对手。

所以我们决定做一件直接的事:用完全相同的Prompt,在Qwen-Image-3.0和GPT-Image-2上各跑一次,把结果并排摆出来看。

下面是我们实测的5个维度(所有测试案例均是Qwen生成在前)。

复杂排版:科学海报

先上最难的,Qwen-Image-3.0官方博客中重点展示了它的「内容可横展」能力,一次性生成包含九个独立信息图的复杂九宫格。我们设计了一张太阳系科普海报作为测试题:8个星球信息块围绕中心的太阳系插图排列,底部一条横跨全宽的banner列出了六个行星与太阳的平均距离。

先说结论:GPT-Image-2赢了这一局,而且赢得很干脆。

Qwen这边的问题不在于排版,排版本身没问题,文字没有重叠、格子排列整齐。问题出在了更根本的地方:它画错了太阳系。这幅本该是「太阳系示意图」的插图,生成的结果反而更像某种漫画风格的太空插画,行星的相对位置、大小关系、甚至连最基本的空间结构都不对。作为一个科普海报的核心信息载体,这种错误是不能接受的。


GPT-Image-2的版本则规规矩矩:8个信息块的文字全部正确,网格线清晰分隔了每个区域,底部长banner的超长文字完整渲染,整体排版规则、均衡,没有炫技但也没有出错。画风是专业科学插图的风格,不是漫画。


坦白说,这个结果挺让人意外的。Qwen-Image-3.0的「内容丰实」卖点里,首当其冲的就是复杂版面一次生成。但一张太阳系海报却把太阳系画错了,不是文字错了,是物理错了。这比单纯的文字排版出错更核心,因为它考验的不是「能不能渲染」,而是「知不知道自己在渲染什么」。

五种语言,一块屏

第二个测试是多语言文字渲染,Qwen宣称支持12国语言,GPT-Image-2宣称99%字符准确率。我们设计了一个国际机场场景,航班信息板同时包含中文、日文、韩文、英文、阿拉伯文五种文字。

结果:GPT-Image-2五种语言全部正确,Qwen-Image-3.0在阿拉伯文上出了问题。

具体来说,Qwen的日文、韩文、英文、中文都准确渲染,没有乱码也没有方块字,但阿拉伯文部分写错了。


而且从整体画面来看,GPT-Image-2的告示板有明显的颜色区块区分(不同行用了不同底色),更接近真正的航班信息屏;Qwen这块板子从头到尾一个颜色,视觉效果显得扁平。


一个有意思的细节:Qwen在机场场景本身的写实度上没有输,航站楼、人群、光影都在线。但文字的部分,GPT-Image-2这边确实更像一块真正挂在机场天花板下的出发屏。

谁更像真人?

第三个测试是写实人像,Qwen官方宣称「毛孔与发丝纤毫毕现,肌肤质感逼近摄影级真实」,GPT-Image-2在第三方评测中写实度拿下了97%的分数(ZDNET测试)。Prompt设定了一位70岁老人坐在窗边的阴天光影场景,点名要了85mm f/1.4的浅景深效果。

结果出人意料地接近。

两个模型都没有出现明显的AI感,没有塑料皮肤,没有过度光滑的年轻化美化,皱纹、晒斑、银色的胡茬都还原到位。光影的柔和过渡也符合「阴天窗光」的描述。


唯一的区别是面孔的种族特征:Qwen生成了一张亚洲面孔,GPT-Image-2生成了欧洲面孔。Prompt中没有指定种族,两个模型各自走了自己训练数据中「老年人肖像」的默认路径。


这一局我们判平手。如果要挑刺,两家都在同一个问题上没有犯错,这本身已经说明了这一代图像模型的写实功底。

会做UI的AI

第四个测试有意思了,Qwen官方博客用了一个非常炫的演示:一张图里从外到内依次嵌套了VSCode编程界面、千问聊天界面、微信聊天界面、手冲咖啡海报,四层「画中画」,UI仿真是他们重点展示的能力。


我们设计了一个更接地气的测试:一个带中文内容的暗黑模式社交App截图。底部导航栏、用户头像、点赞评论数据、emoji和话题标签、三条中文评论,这些元素缺一不可。

中文文字渲染上,两个模型都没有出错。评论区的中文、话题标签、emoji全部正常显示。

但Qwen犯了一个更低级的错误:逻辑错了。

在这张「截图」里,评论区每条评论的昵称出现在了评论内容的下面,而不是上面。用过任何一个社交App的人都知道,昵称在内容上面是基本的信息层级,你先看到是谁说的,再看到他说了什么,Qwen把这个层级搞反了。


GPT-Image-2没有犯这个错误,而且整体来看,GPT-Image-2的版本更接近一张真实的手机截图,按钮比例、卡片间距、文字大小都更自然。Qwen的UI元素虽然都在,但组合在一起的时候,缺少一种「这是一个真正被设计和上线过的App」的整体感。


有时候不是能力问题,是对交互常识的理解问题。

拉到极限,谁先崩?

最后一个测试是纯压力的,一个超宽画幅的未来生态城市:左侧是覆盖垂直花园的摩天楼群,中间是太阳能船穿行的河流,右侧是巨大的公园里有至少20个可见的人物,天空中有送货无人机和透明飞艇。Prompt明确要求了「8K quality」「ultra detailed」「wide panoramic aspect ratio」。

先比分辨率,GPT-Image-2直接输出了原生4K(3840×2160),Qwen的输出是2K级别,这一点上GPT-Image-2的硬件上限更高。


再比细节崩坏,两个模型在人脸上都没有翻车,20个人物的面部没有出现明显的扭曲或变形。但Qwen在个别人物的腿部出现了轻微的变形,GPT-Image-2因为生成的视角更远,一些远景人物的脸上多少有点不太自然。



速度方面,Qwen整体更快一些。

这一局的结论是:两个模型在极限复杂场景下都没有崩盘,但GPT-Image-2赢在了分辨率上限,Qwen赢在了速度。如果你需要一张能直接放进印刷品的高分辨率全景图,GPT-Image-2目前没有对手。如果你是快速迭代、批量出图的工作流,Qwen的速度优势会更明显。

五轮下来,谁更「实」?

我们把五个维度的结果拉通来看:

文字准确率:GPT-Image-2领先。测试01和02中,GPT在英文和五种语言混合渲染中保持全对,Qwen在阿拉伯文和科学知识的准确性上丢了分。

排版与信息密度:打平。两个模型在复杂排版的基础能力上都在线,Qwen的九宫格级信息承载能力确实存在,只是内容本身出了问题,不是排版的问题。

写实度:打平。人像测试中两者都到了「看不出AI感」的水平,面孔的种族差异是训练数据偏好问题,不是能力问题。

UI与交互逻辑:GPT-Image-2领先。Qwen的中文UI在文字层面没问题,但评论区昵称和内容的上下层级搞反了,这是一个交互常识问题,不是渲染精度问题。

极限输出:各有所长。GPT-Image-2原生4K分辨率上限更高,Qwen生成速度更快。

回到官方那个字,「实」。


来源:Qwen官方博客

内容丰实?Qwen-Image-3.0确实能装下4.5k token的信息量,排版层面过关了。但「装得下」不等于「装得对」,太阳系海报的翻车说明模型对知识内容的理解还没跟上它的排版能力。

细节真实?过了。人像测试证明了这一点,跟GPT-Image-2正面硬刚没落下风。

知识厚实?12国语言覆盖面确实广,但阿拉伯文出错说明覆盖的深度还不够均匀。UI评论区逻辑颠倒说明「世界知识」不只是知道一件东西长什么样,还包括知道它应该怎么用。


「实」这个字的承诺还没有完全兑现,它需要在对内容的「理解」而非仅仅是「渲染」上,再往前走一步。