昨天测了 GPT-6 Sol,粉丝们说想看一下比 Deepseek V4 Flash 还便宜的 GPT-6 Luna 在祖传测试用例上的表现。博客上对比了两个模型的价格,确实如此。好,那就来吧。还是在 PI 上接入,思考深度用 Max。

第一题强约束指令遵循句子生成测试,速度挺快的。结尾全部从1到10,全部通顺。但仔细看会发现,10个句子其实是同一个场景中连续的——一个叫小华的学生和老师在教室的场景,第一次见这种情况。句子都是通顺的。

第二题鹈鹕土星环骑自行车 SVG 测试,有几个问题。首先和昨天的 GPT-6 Sol 一样,转弯时用淡入淡出的方式掩盖没有顺利转弯的问题。第二,仔细看脚踏部分,鹈鹕的两只脚其实都在同一侧踩动,右脚没有被自行车挡住。

第三题复合弓射箭 SVG 测试,问题不少。首先人物手臂长度太长,和身高比例不协调,看上去挺吓人。其次弓箭似乎有自己的想法,明明平射,却先掉到地上,然后弹起来再诡异 地射中靶心。

第四题实现精美浏览器操作系统,感觉有点赛博朋克风格。右上角弹窗没有问题,Dock 栏应用也没有问题。太空射击游戏看上去是 3D 画面,但事实上只有 2D,因为只能上下左右移动,飞机也是从同一个平面过来的。

第五题 3D 赛车游戏测试,还是像昨天 GPT-6 Sol 一样,用铁皮裹在一起做成的一辆简陋的车,整个障碍物也不知所谓,跟着赛车像走迷宫一样,密密麻麻的,密集恐惧症患者就别玩了。

第六题无第三方库实现高颜值 Trello 看板,也是一贯 GPT-6 的风格,和常见的 Trello 不太一样。提示词是开放提示词,只要看板有实现就行。试了下基本功能,列表和卡片增删改拖动没有问题,唯一的问题是字太小看不清。

测完了,大家对这个模型怎么看呢?