Kimi K2.8 Preview 的测评报告终于来了。这次测试用的 key 由 B站网友「非著名思想公智」提供,评测依然放在 PI 平台上进行,尽量把 Harness 的影响降到最低,思考模式同样拉到最高。

不过在开始之前有个问题想先问大家:既然 Kimi K3 都已经出来了,为什么现在才推出 K2.8 Preview?知道的朋友可以在评论区聊聊。

推理能力测试

第一题是强约束指令遵循的句子生成,要求所有句子分别以「一到十」结尾。这一题有点大跌眼镜——十句里明显只有第一句和第四句符合结尾要求,通读下来这两句是通顺的。

第二题是新版 24 点,需要给出三个解。结果非常棒,三个解都完全符合提示词要求。

第三题是难度更高的新版密码锁推理,答案是 7294364,判断正确。

编程能力测试

第四题要求实现一个精美的浏览器操作系统。第一版点上去没有反应,毕竟花了几十分钟开发,直接判失败有点可惜,于是让它返修了一次,之后就能正常使用了。右上角的弹窗表现还算可以,Dock 栏里的应用功能也没什么问题,但压轴的太空射击游戏直接报错,这一项不行。

第五题是 3D 赛车游戏。车道方向就不对,游戏一开始就堆满了各种障碍物,两下就挂了,根本闪躲不了。正常的节奏应该是先来些简单的、再慢慢增加障碍物,这个实现确实不怎么样。

第六题是用无第三方库实现一个高颜值看板。UI 看上去比较有科技感,很对我的胃口;功能上任务和列表的增删改拖动都没有问题,是三道编程题里唯一让我满意的作品。

整体测下来,我不觉得这个 Kimi K2.8 有网上说的那么厉害。反正在 PI 上用我这套测试用例来测,算不上很能打。大家觉得呢?