GPT-6 究竟强在哪?各大benchmarks解读!
GPT-6 跑分直接杀疯了!本期视频深度解读 OpenAI 官方放出的全套 benchmark 数据,看看 GPT-6 真正的强项在哪里。
推理能力
- ARC-AGI-3 拿下 98.6%,近乎满分,主打原生智力和全新任务零提示摸索能力
- Claude-Fable-5.1 得分 87.8%,GPT-6 大幅领先
数学实力
- Frontier Math Tier4 斩获 97.6%,大幅抛离 Claude-Fable-5.1 的 87.8%,数学实力实测碾压
办公智能体
- Agents Last-Exam 得分 59.3%,考察 AI 自主操控电脑完成复杂工作
- 3D 建模型空间感知 BenchCAD 达到 95.9%,相比 Fable 5.1 高出十个百分点以上,空间能力提升巨大
编程基准
- DeepSWE 仅 73%,略低于 Gemini-3.8-Flash 的 73.7%,编程表现反常偏弱
其他基准
- Terminal-Bench-Science 拿到 64%,终端科研实操能力出众
- Exploit-Bench 漏洞挖掘安全测试直接满分 100%
跑分解读完毕,后续我会尽量争取机会,用自家 V2.1 祖传测试用例做一轮实战测评,大家敬请期待……










