Claude Opus 5.5 测评报告!究竟有多能打!
刚测完 GPT-6 Sol,粉丝们就催着要看 Claude Opus 5.5,当然要满足大家。这次在 PI 上接入,思考深度设为 xhigh,来真的。
第一题是强约束指令遵循测试,要求模型生成以”从1到10”结尾的通顺句子。Claude Opus 5.5 速度很快,结尾全部正确,句子通顺完整。值得注意的是,GPT-6 Sol 上期测试同样全对,但 Opus 5.5 生成的句子完整性和流畅度明显更胜一筹。
第二题是 SVG 鹈鹕骑自行车绕土星环测试。效果出来后直接卧槽——这应该是测评以来见过的最好实现,转弯顺滑程度令人惊艳。放大仔细看,能发现鹈鹕的脚和脚踏是连在一起的,小小瑕疵,瑕不掩瑜。
第三题复合弓射箭 SVG 测试,同样是目前所有测过模型中效果最好的。复合弓的上下滑轮转动方向、附弦方式、人物动作、箭的抛物线都没有问题,而且弓箭射出时连阴影都有,箭中靶子后靶子还会晃动,细节拉满。
第四题实现精美浏览器操作系统,看完同样是卧槽。UI 非常漂亮,左侧还有精致的 widgets。右上角弹窗 UI 精美,健康状态窗口略微闪烁但整体出色,应用列表功能正常。压轴的太空射击游戏更是惊艳——飞机终于有飞机该有的样子,敌机是真正的飞机形状而不是几块破石头,键盘可以上下左右随意移动,不是只能水平移动,向 Cloudopus 致敬。
第五题 3D 赛车游戏,确实没得弹。画面清晰漂亮不说,赛车真的像赛车,不像 GPT-6 Sol 随便用铁皮包着就当赛车。这模型确实厉害。
第六题无第三方库实现高颜值 Trello 看板,效果太漂亮了,功能完全没有问题。
整套测评下来,我的天呀,我觉得我这套测试用例在 Claude Opus 5.5 面前根本不够看。Claude Opus 5.5 于 2026年9月22日发布,在典型工作负载下性能与 Claude Fable 5.1 持平,但运行成本比 Opus 5 低 40%,默认 100万 token 上下文窗口,128k 最大输出,Always-on 自适应思考,专为长时间 Agent 编程和知识工作设计。大家有什么感叹的赶紧评论区说吧。


%EF%BC%81%E7%A9%B6%E7%AB%9F%E6%9C%89%E5%A4%9A%E8%83%BD%E6%89%93%EF%BC%9F.png)
%EF%BC%81%E7%BC%96%E7%A8%8B%E7%AF%87%EF%BC%81.png)








