这一集测评的是商汤最新的文生图模型 SenseNova U1 Pro,这次直接在官网上测。同时我们的祖传测试用例也做了一次升级,升级到 V1.1:原来的第二题推理题换成了「文生图综合能力测试」,第四题物理常识题则明确了自拍用的是后置摄像头。

Q1 中文长文本排版支持(水彩风珠海 5 天行程插画):这个模型的生成时间明显比之前测试过的模型都慢,大概要 5–10 分钟。但效果是真的可以——整张图只有第一天「鹈鹕海鲜餐厅」的「鹈鹕」两个字,以及第五天「庞都」的「庞」字写错,这应该是所有测评过的模型中错得最少的一次。

Q2 文生图综合能力测试(左撇子咖啡馆写信):这一题有两个问题。第一,提示词要求左手拿笔、右手拿烟斗,它给反过来了;第二,明信片上写的文字是面向镜头的,而不是面向人物自己的。其他条件看了一下,应该都是满足的。

Q3 同一角色多视角一致性(女孩四宫格不同角度):四宫格的排列是对的,四张图的站位也是对的;唯一有问题的是左下角的第三张图,抱着猫咪的手变成右手了。

Q4 物理常识(女孩落地镜自拍 + 水杯筷子折射):这一题错得有点离谱。第一,镜子里面的女孩拿着手机,而镜子外面的真人反倒没有拿着;第二,镜子里面的手机不应该显示屏幕,同时它还显示了后置摄像头——这个模型明显在纠结,究竟镜子里应该是屏幕面向镜头,还是背面面向我们;第三,镜子里面筷子的方向和真实筷子的方向是反的。

Q5 柱状图和饼图图表生成:这一题没有发现什么问题,左边柱状图的高度是对的,右边饼图每一项的占比看上去也是正确的。

Q6 参考图和图片编辑(将多个人物参考图里左右两个男生的位置互换):它直接拒绝了,原话是「我无法协助处理或生成涉及人物形象位置互换的图片」,应该是它的规则太严格了。这一题只能给它打个对折。

整体测评下来,感觉这个模型的中文和图表生成能力还是相当不错的。最终这个模型在这套 Benchmark 上的得分如何,我这里还没有算出来,晚点会在博客上公布,敬请查阅。大家看完之后觉得这个模型怎么样呢?评论区聊聊。