Qwen 3.8 Max 鹈鹕骑自行车SVG测评报告!
本期继续跑 Benchmark 里的两道 SVG 测试题——「鹈鹕土星环骑自行车」和「复合弓射箭」。上一集测的是 GLM 5.3 Flash,这一集轮到千问 3.8 Max 0902 上场。 第二题「鹈鹕土星环骑自行车 SVG 测试」,先看效果。鹈鹕和自行车的结构没有问题,但骑到右边之后,鹈鹕和自行车整个倒了过来。这一点和 GLM 5.3 Flash 刚好相反:GLM 是在上方跑道正常,一来到下面跑道就倒过来。 第三题「复合弓射箭 SVG 测试」同样有几个问题。第一,弓箭明显是反的;第二,人物的右手去拉弓的时候,是穿过了持弓的左手的,属于明显的穿帮。 其他题目这次就不重测了,分数继续沿用 Benchmark V2.1 的测评结果,只有第二、第三题换成本次的新得分。大家翻 Benchmark 数据的时候请注意这一点,我也会在页面上标注出来。 访问入口
GLM 5.3 Flash 鹈鹕骑自行车SVG测评报告!
本期继续跑 Benchmark 里的两道 SVG 测试题——「鹈鹕土星环骑自行车」和「复合弓射箭」。上一集测的是 DeepSeek V4.1,这一集轮到 GLM 5.3 Flash 上场,两道题都开到最高思考深度。 先说第二题「鹈鹕土星环骑自行车 SVG 测试」。GLM 5.3 Flash 花了 20 多分钟才出结果,而 DeepSeek 应该是 10 分钟之内就做好了,慢得太多。再看画面本身:鹈鹕和自行车的结构没有问题,也确实沿着土星环的环形跑道在骑,但一跑到右边就开始露馅——鹈鹕和车都变成了在跑道下面。可见它并没有真正理解「要在跑道上方骑行」,只是单纯想着要绕着轨道跑一圈。 第三题「复合弓射箭 SVG 测试」同样有几个问题。第一,弓的部件明显是反的;第二,人物射箭的手势完全不对,看起来像是在扯线,更像斯诺克架杆击球,而不是在开弓射箭。 其他题目这次就不重测了,分数继续沿用 V2 的测评结果,只有第二、第三题换成本次的新得分。大家翻 Benchmark 数据的时候请注意这一点,我也会在页面上标注出来。 访问入口
Deepseek V4.1 Flash 鹈鹕SVG测评报告!
本期视频把祖传测试用例升级到了 V2.2,其中第二、第三道题做了替换:原本的两道推理题换成「鹈鹕土星环骑自行车 SVG 测试」和「复合弓射箭 SVG 测试」,其余题目保持不变。这一集先用这两道新题试水,看看 DeepSeek 最新的 V4.1 Flash 表现如何。 第二题「鹈鹕土星环骑自行车 SVG 测试」出师不利。模型完全没有按照提示让鹈鹕沿着土星环骑行,看起来是对提示词里「土星环环形跑道」的理解出了问题。考虑到这是新题第一次测,我给了它第二次机会重新跑,结果依然不行——自行车踩到环道左右两侧时完全不懂得转弯,而是快要踩出环道的时候突然「闪现」回正确方向。不过值得一提的是,两轮测试里鹈鹕和自行车的结构都没有出现任何问题,画面本身是立得住的。 第三题「复合弓射箭 SVG 测试」同样暴露出三个明显问题:第一,拉弓时上下两个滑轮转动方向相同,但按真实复合弓的机械结构,上面滑轮逆时针时下面应该顺时针才对;第二,人物的两只手像麻花一样纠缠在一起,手部结构明显不对;第三,人物是直面屏幕,而不是面向靶子射击。 需要说明的是,本期只重测了升级后的第二、第三题,其他题目的分数继续沿用 V...
Sirchmunk!传统RAG已死!免向量自进化知识库!
做过 RAG 的人都懂那套流程有多累:PDF、Word、Excel 先解析,再切片、算 embedding,然后灌进向量库。索引建完半小时过去了,文件一改还得重跑。更麻烦的是,检索捞出来的经常是碎片——答不上来的时候,你都不知道到底是模型笨,还是上下文早被切没了。 Sirchmunk 干脆把这层直接撤了。它的判断是:切片等于把文章拦腰砍断,向量化等于把内容压成一串数字,而压缩就有损失;大模型本来就能读原文,何必先去看残骸?于是它靠关键词和文件路径一层层把范围收窄,先锁定是哪一段,再去读那一段。装完 pip、指向你的目录就能开口提问——比如「这鉴权在哪实现的」「去年那份合同付款条件怎么写的」。 配一个 OpenAI 兼容的接口即可使用。Deep 模式十几二十秒就能交出带原文出处的报告,Fast 模式两三秒就出结果。搜完的结果不会丢,会沉淀成一层层的知识树;同样的问题再问一遍,直接命中缓存,省下 Token。数据全程留在自己机器上,模型也可以换成本地的,Docker 四核 2G 就能跑,Apache 2.0 协议可商用。 做 AI 知识库和 RAG 的兄弟可以去试试,建议先拿你...
Arnis!用你家乡的地图玩《我的世界》!
你现在可以用家乡,或者说任何城市的地图来玩《我的世界》了。这个叫 Arnis 的开源项目,在 GitHub 上已经攒了 17,000 多颗星。 用法很直接:打开软件,在地图上框一块地,选好存档点,真实世界的山脉、河流、马路就按真地形搬进游戏了,连你家那栋楼也会一起出现,房屋内饰都能一并生成。 缩放比例自己调。你可以把老家县城做出来逛一圈,还原自己读过的学校,或者干脆让整座城市变成朋友联机的地图。 数据取自 OpenStreetMap 的路网,加上实测高程,所以地形起伏不是瞎编的。Windows、Mac、Linux 三个平台都能跑。 建议先拿家乡生成一遍——看着你走过十几年的那条街,一格一格出现在方块世界里。 访问入口
千问办公入门(25)!免API Key生成图片!
第 25 期《千问办公入门》继续聊技能(skill)的用法,这期要解决的是一个很实际的需求——在千问办公里直接生成图片,既不用跳出千问办公,也不用填写任何 API Key。 打开千问办公后进入技能列表,找到「图像创作」这个 skill。它是千问办公官方自己做的,所以我们不需要接入任何 key,装上就能用——对不想折腾 API Key 的用户来说,这是最省事的一条路径,站内就把生图这件事闭环了。 安装完成后,新建一个任务,用斜杠命令唤起这个 skill,接着就可以直接输入提示词让它生成图片了。比如让它生成一张「上海城市微缩图」,几步操作就走完了整个流程。 从实际体验看,生成速度相当快,出图质量也不错。对于一般的个人使用和日常办公需求来说,这个 skill 已经够用了;如果你的生图需求不算重度,就没必要再去单独接一套第三方生图服务。下集见…… 访问入口
Vocalremover!一键分离音乐人声和伴奏!自媒体神器!
今天要分享的是一款 vocal remover AI 工具,它可以把音乐分离成人声和伴奏两条音轨。 先听一下原始的音乐,再来听分离之后的人声——是不是很清晰?接着单独听伴奏,可以看到人声和伴奏已经完全分离开来了。 使用方式也非常简单,直接把音频上传上去,一键就搞定了。 这个工具最大的优势就是免费。市面上不少收费的 AI 工具同样能做到人声分离,但你得先打开那些工具、还得付费,一圈折腾下来并不轻松。所以这个免费方案就显得格外难能可贵。如果大家还是找不到入口,可以在评论区跟我说一声。 访问入口
Kimi K2.8 测评报告!真的能打吗?
Kimi K2.8 Preview 的测评报告终于来了。这次测试用的 key 由 B站网友「非著名思想公智」提供,评测依然放在 PI 平台上进行,尽量把 Harness 的影响降到最低,思考模式同样拉到最高。 不过在开始之前有个问题想先问大家:既然 Kimi K3 都已经出来了,为什么现在才推出 K2.8 Preview?知道的朋友可以在评论区聊聊。 推理能力测试 第一题是强约束指令遵循的句子生成,要求所有句子分别以「一到十」结尾。这一题有点大跌眼镜——十句里明显只有第一句和第四句符合结尾要求,通读下来这两句是通顺的。 第二题是新版 24 点,需要给出三个解。结果非常棒,三个解都完全符合提示词要求。 第三题是难度更高的新版密码锁推理,答案是 7294364,判断正确。 编程能力测试 第四题要求实现一个精美的浏览器操作系统。第一版点上去没有反应,毕竟花了几十分钟开发,直接判失败有点可惜,于是让它返修了一次,之后就能正常使用了。右上角的弹窗表现还算可以,Dock 栏里的应用功能也没什么问题,但压轴的太空射击游戏直接报错,这一项不行。 第五题是 3D 赛车游戏。车道方向就不对,游...
小米 MiMo X Pro 测评报告!真的能打吗?
小米 MiMo X Pro Preview 测评报告来了!作者申请内测权限等了两天没拿到,多亏群里周黑鸭哥哥帮忙跑完全套祖传测试用例还提供录屏,非常感谢。 第一题:约束指令句子生成 所有句子都按要求以 1 到 10 结尾,通读后发现 4、7、8、9 几句读起来不通顺,第 6 句表达也比较别扭,日常很少会这么描述。 第二题:新版 24 点要求三组独立解法 三组答案全部违规,都重复使用了题目限定数字,不符合规则。 第三题:七位数密码锁推理 顺利输出正确答案。 接着开始代码项目测评,浏览器操作系统系统弹窗正常,UI 中规中矩,Dock 栏应用运行没问题,但是太空射击游戏无法发射子弹,按键和鼠标点击都没有响应。3D 赛车游戏打开之后完全没有交互,看着就像一张静态图,直接测试失败。Trello 看板 UI 风格比较普通,卡片无法编辑标题,列表不能拖动,删除按钮显示禁用状态却可以点击删卡,存在明显异常,仅列表删除功能正常。 整套测试结束,周黑鸭同学反馈本次测评消耗掉 1% 的内测周额度,测评结果留给大家自己评判,欢迎在评论区聊聊你的看法…… 访问入口
Deepseek V4.1 Flash正式版测评!究竟有多能打?
Deepseek V4.1 Flash 正式版实测来了!模型刚上线就惦记着测试,抽时间在 pi 平台开启测评,尽量降低 harness 带来的干扰,思考模式直接拉满开始测试。 推理能力测试 第一题 · 强约束指令句子生成:要求全部句子以「一到十」结尾,通读全部语句都通顺达标。 第二题 · 新版 24 点:要求给出三组解法,结果三组答案全都违规——数字重复使用,不符合「每个数字只能用一次」的硬性规则。 第三题 · 七位数密码锁推理:高难度推理题顺利算出正确答案。 编程项目测评 浏览器操作系统:桌面带有动态动画效果,还有精致小组件,弹窗、Dock 应用运行正常,可惜压轴太空射击游戏无法交互,差了最后一步。 3D 赛车游戏:让人眼前一亮,是这么多轮测评里完成度顶尖的作品,画面精致,车辆模型完整,整体效果非常惊艳。 Trello 看板:采用深色 UI,审美因人而异,卡片拖拽动画效果一般,其余基础功能都正常可用。 整套测试下来,24 点推理题和太空射击项目留下遗憾,但 3D 赛车的代码实现确实足够亮眼。大家怎么看待 Deepseek V4.1 Flash 正式版的这套实测表现...









