上期完成 DeepSeek V4 Flash 在 Codex 平台测评,本期统一拉满 High 思考深度接入 Claude Code 复测,用全套标准化用例横向对比模型真实表现:

  • 基础指令、24 点运算、密码锁逻辑推理全部答对,仅十条顺序句子存在单句通顺度瑕疵
  • 代码生成环节暴露统一痛点,所有大型开发任务耗时动辄数十分钟,判断是新模型上线调用高峰算力拥堵导致
  • 自制桌面操作系统成品完整性不及 Codex 版本,太空射击游戏交互简陋体验一般
  • 3D 赛车等待 44 分钟但画面与操控效果出色
  • 无第三方库 Trello 看板 UI 清爽,增删拖动全功能无异常

两次跨工具测评输出水准稳定没有大幅波动,能兼顾低成本开发需求,但重度代码项目等待成本偏高。程序员、AI 开发智能体玩家可结合自身任务轻重按需选择使用。