GPT 6 Luna测评报告!打得过Deepseek吗?
昨天测了 GPT-6 Sol,粉丝们说想看一下比 Deepseek V4 Flash 还便宜的 GPT-6 Luna 在祖传测试用例上的表现。博客上对比了两个模型的价格,确实如此。好,那就来吧。还是在 PI 上接入,思考深度用 Max。 第一题强约束指令遵循句子生成测试,速度挺快的。结尾全部从1到10,全部通顺。但仔细看会发现,10个句子其实是同一个场景中连续的——一个叫小华的学生和老师在教室的场景,第一次见这种情况。句子都是通顺的。 第二题鹈鹕土星环骑自行车 SVG 测试,有几个问题。首先和昨天的 GPT-6 Sol 一样,转弯时用淡入淡出的方式掩盖没有顺利转弯的问题。第二,仔细看脚踏部分,鹈鹕的两只脚其实都在同一侧踩动,右脚没有被自行车挡住。 第三题复合弓射箭 SVG 测试,问题不少。首先人物手臂长度太长,和身高比例不协调,看上去挺吓人。其次弓箭似乎有自己的想法,明明平射,却先掉到地上,然后弹起来再诡异 地射中靶心。 第四题实现精美浏览器操作系统,感觉有点赛博朋克风格。右上角弹窗没有问题,Dock 栏应用也没有问题。太空射击游戏看上去是 3D 画面,但事实上只有 2D,...
大语言模型中Context Window和Maxtokens的区别
这里跟大家说一下大语言模型里面 Context Window 跟 Max tokens 究竟有什么差别。 我们上次测了小米的 MiMo 2.6 Pro,测试时说这个 128K 的 Max tokens 爆了,导致输出没法完成,Pi 那边报错 “response was truncated before completion”,即输出在完成之前被截断了。当时有粉丝留言说:你懂不懂啊,小米那个 Context Window 是 1M,不是 128K。 实际上,Context Window 是你多轮对话能容纳的总窗口,包含历史对话和系统提示词,是所有内容能丢进去的最大窗口。而 Max tokens,也叫 Max output tokens,是你单次输出包含思维链(thinking)和最终输出的总长度,不包含历史记录,是一次性的。 两者完全是两回事。在 thinking 思考阶段爆 Max tokens,在各种 Harness 里,包括 Claude Code、Codex、Deepseek Harness,你连压缩(compact)的机会都没有。 希望看了这个视频,大家能了解到大语...
Space Bunny大模型测评报告!是否能打呢?差评!
OpenCode 新上线的神秘模型 Space Bunny 测评报告来了。这次没法在 PI 里测,只能切换到 OpenCode,同时把这个模型的推理强度开到 high —— 这是它支持的最高 level。 第一题是强约束指令遵循的句子生成测试。看了一下,结尾确实都是从一到十,但只要认真读每一句就会发现,没有一句是通顺的,第一感觉就有点拉胯。第二题是鹈鹕土星环骑自行车的 SVG 动画,效果有点不忍直视,这次都不想找问题了,留给大家在弹幕和评论区一个个吐槽吧。第三题是复合弓射箭 SVG,同样没眼看 —— 这画的是忍者吧,难怪都不需要动、不需要拉弓,然后就突然有一支箭出现在靶子面前,完全是靠意念去控制,佩服佩服。 第四题是实现一个精美的浏览器内操作系统。UI 感觉有点 low,背景也是一片漆黑,太难看了;上方还一直有个「墙纸已更新」的提醒反复弹出来。右上角弹窗的配色也太烂,基本看不清文字。Dock 栏应用里,计算器的 UI 也很烂,下方按钮没法滚动下去。压轴的太空射击游戏只能通过鼠标控制位置和射击,玩下来很不好控制,但起码功能是没有问题的。 第五题是 3D 赛车游戏,功能上没有什...
VideoUse!AI自动剪视频!BrowserUse力作!
剪视频这件事正在被 Agent 重新定义。Browser Use 团队开源的 VideoUse(GitHub 上的 video-use)把剪辑变成了聊天的活:把素材原件丢进一个文件夹,跟 Claude Code、Codex 这些编程智能体说几句话,拿回来的就是剪好的视频。这个项目在 GitHub 上已经收了 2 万多颗星。 它最直接的能力,是替你做掉粗剪里最烦的那部分。素材里的「嗯」「啊」这些口头禅和 NG 停顿,它能自动识别并剪掉;每段画面自动调色;字幕也顺手烧好。口播视频、旅行 vlog、教程录课,丢进去就能让它开剪。 更进一步的是动画叠加。它会给每段动画单独派一个子智能体并行去做,而不是串行硬等,所以往片子里加动效不会把整条流程拖慢。 交付之前还有一道自检:AI 会把所有剪辑点自己过一遍,确认画面不跳、音频不炸,才让你预览。连剪辑记忆都落在 project.md 里,下周打开它还记得上次干到哪,不用从头交代一遍。 详细用法在 GitHub 的 README 里有说明。剪视频做自媒体的兄弟建议试一把——先丢 10 分钟最头疼的口播素材,看它剪得比你快不快。 访问入口
Claude Opus 5.5 测评报告!究竟有多能打!
刚测完 GPT-6 Sol,粉丝们就催着要看 Claude Opus 5.5,当然要满足大家。这次在 PI 上接入,思考深度设为 xhigh,来真的。 第一题是强约束指令遵循测试,要求模型生成以”从1到10”结尾的通顺句子。Claude Opus 5.5 速度很快,结尾全部正确,句子通顺完整。值得注意的是,GPT-6 Sol 上期测试同样全对,但 Opus 5.5 生成的句子完整性和流畅度明显更胜一筹。 第二题是 SVG 鹈鹕骑自行车绕土星环测试。效果出来后直接卧槽——这应该是测评以来见过的最好实现,转弯顺滑程度令人惊艳。放大仔细看,能发现鹈鹕的脚和脚踏是连在一起的,小小瑕疵,瑕不掩瑜。 第三题复合弓射箭 SVG 测试,同样是目前所有测过模型中效果最好的。复合弓的上下滑轮转动方向、附弦方式、人物动作、箭的抛物线都没有问题,而且弓箭射出时连阴影都有,箭中靶子后靶子还会晃动,细节拉满。 第四题实现精美浏览器操作系统,看完同样是卧槽。UI 非常漂亮,左侧还有精致的 widgets。右上角弹窗 UI 精美,健康状态窗口略微闪烁但整体出色,应用列表功能正常。压轴的太空射击游戏更是惊艳...
Codex X可视化了Codex编辑器小白秒变大神
Github 开源桌面工具 Codex-X,3800+ 星,可视化管理 OpenAI Codex 各种配置。支持一键切换参数,管理提示词与会话,自动备份、统计 Token,全平台覆盖。 核心功能: Provider / API 切换:支持 OpenAI、DeepSeek、MiniMax、GLM、千问等多个 Provider,连接测试一键完成 会话同步:按项目分组管理,支持搜索、同步和批量删除本地 Codex 会话 Skills / MCP 管理:统一管理 Skills 和 Model Context Protocol 服务器 提示词注入:可视化提示词库,支持创建、分类、导入和切换 TOML 配置编辑器:语法高亮、自动备份 跨平台支持 macOS、Windows、Linux 全桌面端。 访问入口
GPT 6 Sol 测评报告!究竟有都能打?
最新上线 GPT-6 Sol 测评报告来了,继续在 Pi 中接入思考拉到 xhigh,废话不多说开始。 第一题强约束指令遵循句子生成测试,结尾都是从 1 到 10 结尾的,句子都是通顺的。值得提一下的是,GPT-6 写的句子很少用成语和俗语,不像国内模型什么九九归一、腊八、数九之类的。 第二题鹈鹕土星环骑自行车 SVG 测试,转弯感觉还可以,但有几个问题:一是把手没有用翅膀扶着,很多模型实现都有不然车怎么稳定向前走;二是车轮感觉是反方向滚动的;三是左边转弯还是有点别扭。 第三题复合弓射箭 SVG 测试,复合弓和射箭整体还可以。唯一想吐槽的是弓箭竟然像有魔法一样,水平射出后嗖一下就开始抬升变成抛物线运动。慢镜头可以看到拉满弓放手时,弓箭没有跟着弦一起出去。 第四题实现精美浏览器操作系统,界面还挺 macOS 风格的,右上方弹窗功能没问题,Dock 栏应用也没问题。太空射击游戏看着按钮感觉只实现了左右移动,确实如此只能左右移动,但 3D 感觉是出来了,如果能支持上下移动就完美了。 第五题 3D 赛车游戏测试,功能没什么问题,但这车就是几个方块搭起来的……等等,难道是马斯克最新的...
Mimo 2.6 Flash 测评报告!怀疑小米发布错模型了!
上个视频测了小米 MiMo V2.6 Pro 版本,坦白说有点拉胯,还非常爱思考,动不动思考到 Max Tokens 爆了。这次准备测试下 Flash 版本,希望能有好的表现。测试依然在 Pi 中接入,思考模式同样打开。 第一题强约束指令遵循句子生成测试,排除结尾不是从 1 到 10 之后,第二句不符合要求,认真看了下第六、九、十句都不通顺,只对了 6 句。 第二题鹈鹕土星环骑自行车 SVG 测试,也是大半个小时去了,这个 Flash 看来也不 Flash。效果竟然比 Pro 版本还好:左转弯已经很顺滑,且这次车把有手扶着了。但仍有问题:左转弯是倒退着转弯的,类似溜冰时的转弯;扶着车把的手和踩车的脚还是太像人了,鹈鹕应该是翅膀而非人腿,关节也不该和人一样——整体还是一眼就能看出是 MiMo 家族生成的。 第三题复合弓射箭 SVG 测试,时间也挺长。坦白说实现比 Pro 版好多了,甚至比之前测试过的模型都好,复合弓是最像复合弓的一个。问题两个:上方下方转轮都是顺时针方向,以及没有看到副弦——只有一根弦的话,复合弓主体做得再好也只当普通弓箭用。 第四题实现精美浏览器操作系统,这...
Mimo 2.6 Pro 测评报告!结果可能不是你想要的!
一大早醒来,粉丝们就说小米 MiMo 2.6 发布了,赶紧测评,义不容辞。这次发布了三个模型:Pro、Flash、Ultra、Speed。由于担心测完钱不够,先测 Pro,保证旗舰版 Ultra 能测完。测试依然在 Pi 上接入,打开思考模式开干。 第一题强约束指令遵循——让模型生成以 1-10 结尾的句子,整体通顺,但第 10 句的表述总觉得别扭。咨询 Deepseek 后确认第 10 句确实不太通顺。 第二题 Saturn 环骑自行车 SVG 生成,等了约一个半小时才出结果。问题明显:转弯仍用淡入淡出过渡、鹈鹕全程没有扶着车把、脚太像人腿而非鹈鹕关节。思考时间如此之长,实现效果却不尽如人意,性价比存疑。 第三题复合弓射箭 SVG,同样等待大半个钟,问题更为严重:头与身体完全错位、右手握弓手掌反转为左手拉弦、弓弦在右手外侧导致无法正常开弓。一个半小时的等待,换来这样的成品,实在说不过去。 第四题实现精美浏览器操作系统,号称任意位置点击即可进入,实际点击毫无反应,调试模式显示存在严重 bug。第五题 3D 赛车游戏,车辆一直往路边栏杆死撞,不断充钱也未能改善。 第六题无第三...
Grok 4.7 测评报告!真的能打吗?
Grok 4.7 刚上线,这一期的测评依然在 Pi 平台上接入,思考强度直接拉到最 xhigh,还是那套祖传测试用例,逐题开干。 第一题是强约束指令遵循的句子生成测试。逐句看下来,所有句子的结尾都按要求落在 1 到 10 之间,句子本身也基本通顺,只有最后一句翻车了。口语里我们偶尔确实会那样说,但放到书面语里语法上就不太对——说「满分 100,他考了 90」没问题,前后呼应;但换成「这有苹果 10 个,他拿了一」,就明显别扭了,总感觉要补上「分」这个单位才舒服。大家觉得呢? 第二题是鹈鹕骑自行车的 SVG 测试(沿土星环轨道做 360° 环形骑行)。从最后的输出看,它转弯是通过淡入淡出方式解决的。实际效果有几个问题:一是转弯时的衔接明显不理想,看着接不上;二是车轮总感觉是反着转的;三是内层的土星环画反了——上方部分应该被土星挡住,面向我们的下方部分则不该被挡住。 第三题是复合弓射箭的 SVG 测试。复合弓和射箭整体还可以,唯一想吐槽的是那个小人:知道这只是个 SVG,但手也不至于长到脖子上吧,看着怪吓人的,这不是拍恐怖片。 第四题是做一个精美的浏览器操作系统。实际玩下来,右...









