这一集测的是黑森林(Black Forest Labs)最新的 Flux 3 文生图模型。用的还是同一套 6 题 Benchmark,逐题实测,模型直接在 OpenRouter 的 Playground 上跑。

Q1 中文长文本排版支持(水彩风珠海 5 天行程插画):整体布局没有什么问题,但错别字错得相当密集。第一天「渔民佬鹈鹕海鲜」里的「渔」和「鹈鹕」写错;第二天「鲸鲨馆」的「鲨」错了,「企鹅」的「鹅」也错了;第三天「外伶仃」的「仃」和「渔」写错;第四天「荔枝园农家乐」的「荔」错了,「农家乐」的「家」位置不对,「农」和「乐」两个字也不对;第五天「励骏庞都」的「励」和「庞」都错了,「手撕鸡」的「撕」还少了提手旁。这一题错得挺多,估计它对中文的支持不大好。

Q2 推理和中文支持(桂林手绘三日行程图):这一题同样不给具体行程,要求模型自己推理。桂林、漓江、遇龙河这三天的安排没有问题,说明它是有推理能力的;但中文错别字也是一大堆,这里就不一个个指出来了,毕竟本题主要考察的是推理能力。

Q3 同一角色多视角一致性(女孩四宫格不同角度):这一题实现得没有问题,四个角度都没看出什么毛病。相比昨天测的 Seedream 5.0 Flash,已经非常不错了。

Q4 物理常识(女孩落地镜自拍 + 水杯筷子折射):几个问题。第一,镜子里的手机是反的;第二,手机取景器的成像有问题,自拍不可能看到自己拿着手机;第三,右边桌子和玻璃杯没有按照提示词出现在镜子中;第四,玻璃杯应该装满水;第五,筷子在水中应该有折射,这里完全看不出来。

Q5 柱状图和饼图图表生成:这一题实现不行。先看左边柱状图,且不说「营收」两个字写错,每根柱子的高度都不对——Q1 是 12,高度却在 y 轴 10 刻度之下;Q2 是 18,又低于 15 刻度;Q3 也在 25 刻度之下,所以全都不对。右边的饼图比例同样不对:A 品牌 35%,看上去起码接近 45%;B 品牌 28%,看上去还没有 C 品牌的 15% 大。看来这个模型做图表不大行。

Q6 参考图和图片编辑(左右两个男生位置互换):左右两个男生的位置确实互换了,但画面下方还残留着原来白人男生握着手机的一只手。

总的测评下来,Flux 3 在这套测试用例中也不是很能打。大家觉得它和昨天测的 Seedream 5.0 Flash 比,谁更强一点?评论区聊聊。