Deepseek V4 Pro 重测报告!自家Harnesss上表现如何?
在 DeepSeek Harness 复测 DeepSeek V4 Pro,网上流传模型自家框架专属优化的说法实际效果存疑;拉满 max 思考深度,强约束指令测试结果甚至比 Codex 平台还要差,24 点、密码锁推理作答正确;编程项目中浏览器系统、太空射击游戏表现有所改善,但 3D 赛车滑行 BUG 严重,Trello 看板 UI 与功能依旧出彩,综合来看本次复测整体不及 Codex 上的表现,大概是模型本身存在缺陷……











