Deepseek V4 Pro 重测报告!自家Harnesss上表现如何?
发表于|更新于|大语言模型
在 DeepSeek Harness 复测 DeepSeek V4 Pro,网上流传模型自家框架专属优化的说法实际效果存疑;拉满 max 思考深度,强约束指令测试结果甚至比 Codex 平台还要差,24 点、密码锁推理作答正确;编程项目中浏览器系统、太空射击游戏表现有所改善,但 3D 赛车滑行 BUG 严重,Trello 看板 UI 与功能依旧出彩,综合来看本次复测整体不及 Codex 上的表现,大概是模型本身存在缺陷……
相关推荐

2026-05-27
Deepseek 原生 Codex 杀到!AI编程神器!
DeepSeek推出了原生Codex——一款对标OpenAI Codex的AI编程助手。与通过API接入的第三方方案不同,DeepSeek原生Codex深度整合了DeepSeek模型的能力,在代码理解、生成和调试方面更加高效。它支持类似Codex的Agent模式、TAB补全和自然语言交互。作为国产AI编程工具的重要里程碑,本视频全面测评DeepSeek原生Codex的能力和实际体验。 访问入口

2026-09-13
Deepseek V4.1 Flash 鹈鹕SVG测评报告!
本期视频把祖传测试用例升级到了 V2.2,其中第二、第三道题做了替换:原本的两道推理题换成「鹈鹕土星环骑自行车 SVG 测试」和「复合弓射箭 SVG 测试」,其余题目保持不变。这一集先用这两道新题试水,看看 DeepSeek 最新的 V4.1 Flash 表现如何。 第二题「鹈鹕土星环骑自行车 SVG 测试」出师不利。模型完全没有按照提示让鹈鹕沿着土星环骑行,看起来是对提示词里「土星环环形跑道」的理解出了问题。考虑到这是新题第一次测,我给了它第二次机会重新跑,结果依然不行——自行车踩到环道左右两侧时完全不懂得转弯,而是快要踩出环道的时候突然「闪现」回正确方向。不过值得一提的是,两轮测试里鹈鹕和自行车的结构都没有出现任何问题,画面本身是立得住的。 第三题「复合弓射箭 SVG 测试」同样暴露出三个明显问题:第一,拉弓时上下两个滑轮转动方向相同,但按真实复合弓的机械结构,上面滑轮逆时针时下面应该顺时针才对;第二,人物的两只手像麻花一样纠缠在一起,手部结构明显不对;第三,人物是直面屏幕,而不是面向靶子射击。 需要说明的是,本期只重测了升级后的第二、第三题,其他题目的分数继续沿用 V...

2026-08-02
Reasonix!Deepseek官方认可Harness!
DeepSeek 官方文档正式收录 Reasonix 接入方案,释放生态布局关键信号,自研 Harness 开发者内测开启,8 月随 V4 Pro 上线。二者分层布局抢占编程智能体赛道,Reasonix 深度适配底层 API,超高缓存节省调用成本,自带动态纠错、双模型切换、MCP 拓展等能力,轻量化适合个人开发者;官方 Harness 底层深度优化,面向企业复杂项目,轻重搭配完善代码开发生态,对标 Claude Code、Codex 同类工具… 访问入口

2026-08-28
Deepseek Harness 入门(15)!峰谷费用仪表盘!
这款 dsh-cost-meter 插件能帮你精准把控费用!安装之后左下角实时展示账号余额、当日消费金额,还会贴心提示距离峰谷收费切换的剩余时长,方便大家错峰使用节省成本。 每一轮对话结束,对话框下方立刻显示本次聊天产生的花费,哪怕只是发送一句 hi,也能看到产生了三分多钱的消耗。进入插件设置里的费用菜单,还可以查看详尽的用量报表、开启高峰期弹窗提醒,各类自定义选项十分丰富。 想精细化管控模型开销的开发者,不妨亲自上手体验一下。 访问入口 dsh-cost-meter 插件(峰谷费用仪表盘插件)

2026-09-08
Deepseek V4.1 测评报告!究竟有多能打?
Deepseek 全新内测 v4.1‑flash 中间版实测来了!模型标识为 deepseek‑v4.1‑flash‑expires‑on‑0910,直接搬出祖传全套测试用例,在 pi 环境把思考模式拉满开启测评。 第一题强约束指令生成测试,句子结尾全部满足 1‑10 格式,仅有第七句语句不通顺其余表现尚可。 第二题新版 24 点需要输出三组解法,三个答案全部正确。 第三题七位数密码锁推理也成功算出标准答案。 来到编程能力测试,第四题精美浏览器操作系统出现桌面空白,推测背景图加载失败,弹窗与 Dock 栏功能正常,但太空射击游戏直接报错无法运行。 第五题 3D 赛车游戏完成度很高各项功能运行正常。 第六题零第三方库 Trello 看板界面中规中矩,列表、卡片的增删改拖拽全部可以正常使用。 整套测评下来浏览器操作系统项目拖了后腿,否则可以拿到更高分数,不过作为 flash 版本整体响应速度十分出众,大家对这个模型有什么想法欢迎评论区留言。 访问入口

2026-08-29
Claude害了我孙割啊!各大语言模型怎么答的?
借着近期热议的孙宇晨与景甜事件,本期视频根据网传小作文还原出对应的提示词,实测多款热门大模型会给出怎样截然不同的抉择答案。 首先上场的 Claude 第一次回答选择「给」,结果让人意外,开启全新会话二次提问却变成「不给」。足以看出大语言模型属于概率模型,同一问题多问一遍结局就有可能彻底反转! 随后我们横向评测了一众主流 AI: ChatGPT 给出了「给」的答复 马斯克旗下 Grok、豆包、DeepSeek、千问、Kimi、GLM–5.3–Flash、文心一言均回复「不给」 腾讯元宝选择「给」 一场趣味吃瓜评测之余,也给所有人提了一个醒:千万不要把人生重大决策交给 AI,它输出的结果仅能当作参考,关键事情建议多次提问、跨模型交叉对比结果再下定论…… 访问入口
公告






