这一集测评的是 OpenAI 最新的图像模型 GPT-Image-2.5-Sunburst,测试依然直接在 OpenRouter 的 Playground 上进行,用的还是那套 6 题的文生图 Benchmark。测下来的整体感觉是相当不错。

Q1 中文长文本排版支持(水彩风珠海 5 天行程插画):第一天「渔民岛鹈鹕海鲜」里的「鹈鹕」两个字错了;第二天「鲨」字的上半部分写错;第四天墙上博物馆的「博物」两个字错;第五天「横琴」的「琴」字错。整体感觉已经比之前测的几个模型好了很多。

Q2 推理和中文支持(桂林手绘三日行程图):这一题不给具体的行程描述,要求模型自己推理。三天行程的安排没有问题,说明它是有推理能力的;而且这次的中文文字仔细看了一下,好像没有找到什么错别字——它的中文能力比我们之前测的几个国产模型还要好。

Q3 同一角色多视角一致性(女孩四宫格不同角度):四宫格的排列是对的,图二没有问题;但图一和图三都画成了右手抱着猫咪(题面指定的是左手抱一只白猫),图四的方向也没做对——应该是 45 度角稍微侧身对着我们。总体来说已经不错了。(更正:视频里说的是「图一和图二没有问题、图三变成右手抱猫」,实际核对下来图一也是右手抱猫,这里按实际情况记述。)

Q4 物理常识(女孩落地镜自拍 + 水杯筷子折射):这一题也比之前几个模型的效果好了很多,比如从这个角度就能正常看到右边的杯子和桌子了。但问题还是有的:杯子里的水应该是满的。其他好像没有看出什么问题,筷子的折射这个难度比较高的也做对了。(更正:视频里提过的「手机取景器里,女孩自拍不应该能看到手机」不算问题 —— 对着镜子自拍应当用后置摄像头,取景画面本来就是镜中景象;题面现已补充「用后置摄像头」这一限定。)

Q5 柱状图和饼图图表生成:先看左边的柱状图,柱子的高度和纵轴的刻度基本上是对上的;再看右边的饼图,文字和比例看上去也没有什么毛病。

Q6 参考图和图片编辑(将多个人物参考图里左右两个男生的位置互换):左右男生的位置确实互换了,但下方还残留着原来白人男生握着手机的一只手,其他没有看到什么问题。

整体测评下来,感觉这个模型还是相当不错的。最终这个模型在这套 Benchmark 上的得分如何,我这里还没有算出来,晚点会在博客上公布,敬请查阅。大家看完之后觉得这个模型怎么样呢?评论区聊聊。