小米 MiMo X Pro 测评报告!真的能打吗?
小米 MiMo X Pro Preview 测评报告来了!作者申请内测权限等了两天没拿到,多亏群里周黑鸭哥哥帮忙跑完全套祖传测试用例还提供录屏,非常感谢。 第一题:约束指令句子生成 所有句子都按要求以 1 到 10 结尾,通读后发现 4、7、8、9 几句读起来不通顺,第 6 句表达也比较别扭,日常很少会这么描述。 第二题:新版 24 点要求三组独立解法 三组答案全部违规,都重复使用了题目限定数字,不符合规则。 第三题:七位数密码锁推理 顺利输出正确答案。 接着开始代码项目测评,浏览器操作系统系统弹窗正常,UI 中规中矩,Dock 栏应用运行没问题,但是太空射击游戏无法发射子弹,按键和鼠标点击都没有响应。3D 赛车游戏打开之后完全没有交互,看着就像一张静态图,直接测试失败。Trello 看板 UI 风格比较普通,卡片无法编辑标题,列表不能拖动,删除按钮显示禁用状态却可以点击删卡,存在明显异常,仅列表删除功能正常。 整套测试结束,周黑鸭同学反馈本次测评消耗掉 1% 的内测周额度,测评结果留给大家自己评判,欢迎在评论区聊聊你的看法…… 访问入口
Nex-N2.5 免费大模型测评报告!真的能打吗?
OpenRouter 上新的 Nex-N2.5 模型实测来了,目前可以免费体验,网传实力很强。这个出自国内团队 Nex AGI 的模型,名字我就不细说,避免测评结果不理想引来不必要的麻烦。本次接入 Pi 平台,思考模式拉满开始测试。 第一题:约束指令句子生成 — 生成速度偏慢,第五句没有按照要求以数字 5 结尾,其余句子读起来还算通顺。 第二题:新版 24 点任务 — 耗时很久,最后陷入思考死循环没能得出结果。 第三题:七位数字密码锁 — 推理顺利算出正确答案。 接着进行编程项目测试,浏览器操作系统弹窗功能正常,UI 属于中规中矩中等水平,但出现少见 bug,访问文件图标显示不全被面板遮挡,计算器 0 号按键圆角异常。压力太空射击游戏无法正常游玩,成品效果较差,3D 赛车游戏功能能跑,但道路漆黑辨别度很低,很容易翻车。Trello 看板是清新配色观感不错,不过存在文字重叠、卡片拖拽位置受限、找不到卡片删除按钮等问题。 整套测评体验下来模型有可取之处,但最大问题就是速度很慢,整套测评耗时超过五小时,对比 Deepseek V4.1 正式版一小时左右就能跑完,差距非常明显。大家...
Deepseek V4.1 Flash正式版测评!究竟有多能打?
Deepseek V4.1 Flash 正式版实测来了!模型刚上线就惦记着测试,抽时间在 pi 平台开启测评,尽量降低 harness 带来的干扰,思考模式直接拉满开始测试。 推理能力测试 第一题 · 强约束指令句子生成:要求全部句子以「一到十」结尾,通读全部语句都通顺达标。 第二题 · 新版 24 点:要求给出三组解法,结果三组答案全都违规——数字重复使用,不符合「每个数字只能用一次」的硬性规则。 第三题 · 七位数密码锁推理:高难度推理题顺利算出正确答案。 编程项目测评 浏览器操作系统:桌面带有动态动画效果,还有精致小组件,弹窗、Dock 应用运行正常,可惜压轴太空射击游戏无法交互,差了最后一步。 3D 赛车游戏:让人眼前一亮,是这么多轮测评里完成度顶尖的作品,画面精致,车辆模型完整,整体效果非常惊艳。 Trello 看板:采用深色 UI,审美因人而异,卡片拖拽动画效果一般,其余基础功能都正常可用。 整套测试下来,24 点推理题和太空射击项目留下遗憾,但 3D 赛车的代码实现确实足够亮眼。大家怎么看待 Deepseek V4.1 Flash 正式版的这套实测表现...
讯飞星火 X2.5 API测评报告!究竟有多能打?
想知道讯飞星火 X2.5 真实实力?接入 API 放到 pi 平台跑全套祖传测试用例!第一题强约束指令遵循句子生成测试,5、7、8 句不通顺,第十句口语化。第二题24点截断只算出一组解法。第三题高难度七位数密码锁推理顺利答对,推理能力让人意外。编程题:浏览器 OS UI 观感不错,右上角弹窗效果在线,Dock 正常,附带太空射击游戏可玩但偏难;3D 赛车正常但车速偏快;Trello 看板卡片拖动正常,列表拖动失效,输入标题有显示 bug。整体表现不错,全国产算力训练是亮点,适合对数据安全敏感的团队,大家怎么看这次实测结果呢…… 访问入口
Mercury 2.5测评报告!自回归大语言模型杀手?
扩散大语言模型这条路走得通吗?称生成速度上千 token 每秒的扩散大模型 Mercury 2.5 实测来了!粉丝点名让我测试这款刚在 OpenRouter 上线的 Diffusion LLM,这类模型和普通自回归模型不一样,不会逐个输出 token,而是一次性批量吐出多个 token,理论上速度直接拉满。 我在今年 3 月就测过旧版本,当时表现很差,期待新版本能有所改善。本次通过 OpenRouter 在 pi 环境接入,思考模式开到最高,逐项实测: 第一题·强约束指令生成:生成速度肉眼飞快,不用快进,但全部句子语句不通顺,直接翻车; 第二题·新版 24 点:要求三组解法,模型直接表示无法求解,要求去掉数字 2 才能作答; 第三题·七位数密码锁推理:给出的答案完全错误,三道推理题全军覆没。 接着测试编程任务: 浏览器操作系统缺少弹窗,仅计算器勉强可用; 太空射击游戏完全失效; 3D 赛车 UI 简陋,越过第一个障碍物之后不再刷新障碍; Trello 看板初始化界面异常,创建列表后无法新建卡片和拖拽。 整套测评下来,这款扩散大模型空有极速生成的噱头,推理和代码落地能...
GPT-Image 2.5最新测评报告!究竟有多能打?
GPT Image 2.5 全量开放,免费账号也能直接用!今天拿祖传图片测评用例实测,左侧图片菜单旁出现新标识,点开 template 模板看到对应 logo 就代表是最新版本。 第一道压轴题上传多人图片,要求互换左右两个人物位置,画面看似完成交换,但出现明显 bug——人物交换后还残存了多余的手部图像。 第二道测试中文能力,生成水彩风格珍珠海 5 天行程插画,整体画面尚可,但图内出现错字,更换提示词生成桂林手绘三日行程图,模型能自主推理规划行程,可文字错误字更多,能看出中文文字渲染依赖旧短短板明显。 第三题生成 3D Q 版两层咖啡杯造型星巴克建筑,画面效果惊艳,提示词遵循到位。 第四题上蚂蚁巢穴城市天气卡,构图观感很好,耗尽只能终止测评。这套实测能看出它图像生成有亮点,但中文文字渲染、图像物体编辑仍存缺陷,你觉得 GPT Image 2.5 表现如何,有优质测评用例欢迎分享,后续我加到祖传测评集里…… 访问入口
开源企业 AI 语音客服神器!一键搭建语音数字人!
企业搭建 AI 语音客服、数字人实时语音有新方案! 开源框架 LiveKit Agents,可将文本大模型转为支持通话的语音助手,GitHub 14k+star,几十行代码即可搭建,支持电话客服、自动外呼、数字人语音,结合 WeKnora 企业知识库实现智能问答与客服自动化。 自带端点检测避免抢话,支持多 Agent 业务接入,MCP 快速接入工具,支持私有化部署,Apache-2.0 协议可商用。 做语音机器人、数字人的企业可以跑示例体验一下…… 访问入口
Agnes 3.0 Flash测评报告!始料未及的结果!
Agnes 3.0 Flash 免费可用的大模型实测来了! 使用 pi 接入并开启思考模式,指令生成测试仅有半数句子通顺,24 点任务上下文中断,密码锁推理答案错误。全部编程测试项目接连报错、运行中断,服务稳定性很差。 整套测评下来,也就 API 免费勉强算得上优,其余能力一言难尽。你觉得这个模型还有哪些可用场景呢…… 访问入口
Deepseek V4.1 多模态测评!能打吗?
Deepseek V4.1 预览版多态实测来了!上一轮我们测试推理与编程能力,今天直接拿祖传多态测试用例检验图像能力,该模型暂不支持视频,所以只做图片测试。 首先传入《老无所依》电影截图片名询问影片名称,任务跑了二十多分钟,Deepseek Harness 浏览器几乎卡死,只能终止任务。过程中模型可以识别画面内容,但始终识别不出电影名字。换一张同影片简单截图,耗时五分钟多才成功识别出来。 接下来判断图片里对话亭相对黄色货车的方位,模型准确答出右侧,答案无误。 找不同题中,精确定位第一行第四列倾斜十二度,多观察能力可圈可点。再提升难度,统计画面里雄鸳鸯数量,雄性 5 只识别正确,雌性统计出错——把画面左侧的野鸭错误计入雌性鸳鸯数量。 原本准备两道视频测试题,受限于模型不支持视频输入无法开展。整体图片测试有亮点也有明显短板,大家觉得这个模型多模态水平到底如何…… 访问入口
怎么将自己的产品接入强大智能体?Qoder Agent SDK怎么玩?
千万别再从零手写 Agent 框架重复造轮子了!Qoder Agent Harness SDK 完美解决开发痛点,不用自己硬搓复杂的 Agent 循环和工具调用逻辑,传统大模型调用繁琐的底层代码全部内置封装,开箱即用,大幅缩减开发工作量。 同时支持 TypeScript(@qoder-ai/qoder-agent-sdk)与 Python(qoder-agent-sdk)双端 SDK 接入 支持自定义 MCP 服务接入各类业务功能,配置简单、上手门槛极低 内置流式响应输出、工具权限管控、代码理解与编辑能力,一行代码即可拉起智能体 通过 Personal Access Token(PAT)鉴权,可在 qoder.com/account/integrations 一键生成 轻松将成熟的 Qoder Agent 能力集成到自有业务中,性价比和实用性直接拉满 访问入口









