GPT-6 跑分直接杀疯了!本期视频深度解读 OpenAI 官方放出的全套 benchmark 数据,看看 GPT-6 真正的强项在哪里。

推理能力

  • ARC-AGI-3 拿下 98.6%,近乎满分,主打原生智力和全新任务零提示摸索能力
  • Claude-Fable-5.1 得分 87.8%,GPT-6 大幅领先

数学实力

  • Frontier Math Tier4 斩获 97.6%,大幅抛离 Claude-Fable-5.1 的 87.8%,数学实力实测碾压

办公智能体

  • Agents Last-Exam 得分 59.3%,考察 AI 自主操控电脑完成复杂工作
  • 3D 建模型空间感知 BenchCAD 达到 95.9%,相比 Fable 5.1 高出十个百分点以上,空间能力提升巨大

编程基准

  • DeepSWE 仅 73%,略低于 Gemini-3.8-Flash 的 73.7%,编程表现反常偏弱

其他基准

  • Terminal-Bench-Science 拿到 64%,终端科研实操能力出众
  • Exploit-Bench 漏洞挖掘安全测试直接满分 100%

跑分解读完毕,后续我会尽量争取机会,用自家 V2.1 祖传测试用例做一轮实战测评,大家敬请期待……