Rea!可执行程序秒扒光!开源逆向黑科技!
看到别人 APP 里一个好用的功能,却拿不到源码,是很多做客户端的人都会遇到的窘境。现在有个新思路:直接对着 AI 说一句话,让它把那个 APP 拆到二进制层面,告诉你这个功能到底是怎么写的,甚至顺手帮你复刻一个。干这件事的开源项目叫 REA,目前在 GitHub 上已经攒了 12,000 多颗星。 REA 的形态是给 AI 编程助手用的一个 MCP 服务,装完之后重启一下 agent 就能用,不需要另外学一套界面。用法也很直白:直接跟它说想搞懂哪个软件里的哪个功能,它就会自己把那个软件扒开来看——没有源码也能看。它会先把可执行文件还原成能读的代码,再顺着调用关系,把整件事是怎么跑通的讲给你听。像人家的离线搜索是怎么做的、登录和本地存储是怎么设计的、一段可疑的联网行为藏在哪一行,都可以直接问它。 看明白之后,在同一个会话里就能让它照着你的项目做一个自己的版本,从「看懂」直接过渡到「照做」,不用在两个工具之间来回搬上下文。 它能摸的东西挺杂:Mach-O、ELF、PE 这些原生二进制,Mac 上的 APP,Electron 打包过的前端应用,手机上的 APP 和 IPA 也都...
Mistral Large 4.0 测评报告!中美之外的法国黑马?
这期应粉丝要求测评 Mistral 最新的 Mistral Large 4 模型。看网上各种 benchmarks,据说非常能打,那在我们这套祖传测试用例中表现如何呢?我们继续在 Pi 中接入,另外查了一下,它的思考模式最高只能去到 high。 第一题是强约束指令遵循句子生成测试——要求十个句子的结尾依次是 1 到 10,来看通顺度。认真看下来,第一、三、五、六、七、八、九句都不通顺,都是为了凑数字结尾,硬把句尾的单位去掉的;其实第十句也不大顺,感觉还是要加个「颗」字才好,大家觉得呢? 第二题是鹈鹕土星环骑自行车 SVG 测试,这个效果不行。第一,转弯肯定是不行的,都倒过来了;第二,到了上方的时候图形并没有挡住鹈鹕,让人感觉土星环没有环绕土星,也就是土星在土星环之外;第三,鹈鹕的翅膀在中间,那它是怎么凭空多出一只手来扶着车把的;第四,鹈鹕的脚没有踩到脚踏上。 第三题是复合弓射箭 SVG 测试。第一,箭头是反的;第二,人手一直像僵尸一样直直的,拉弓时也没见弯曲;第三,弓箭没有射中靶心。 第四题是实现一个精美的浏览器操作系统。这一个实现花了相当长的时间,估计快两个小时,原因有三...
Jeff!Jev开源平替!0.8B本地随便跑!
闭源 API 按毫秒卖钱的决策模型,有老哥自己烧卡训了个 0.8B 的开源平替:二十几毫秒出结果,还分文不收。这就是 Jeff,上线 10 天 GitHub 就攒了 1400 多颗星。 它对标的就是最近大火的 TypeSafe 那个闭源收费的 Jev——参数不公开,官方演示一次调用要 100 多毫秒。而 Jeff 连请求格式都跟 Jev 对齐,当平替接过去就能用,不用改客户端。 玩法是把大模型留着干重活,杂活全丢给它:比如这条评论是不是垃圾、客户这句话想干嘛、Agent 该调哪个工具。它直接给带概率的答案,没把握就转给大模型,最多能吃 254 个选项。 消费级显卡、自己电脑就能跑。相对于之前跟大家介绍过的拉雅(Laya),它不会选项一多就掉链子。想省推理成本的,可以先挑业务里最烧钱的那类高频判断换上去试一试。 访问入口
Nano Banana 2.1 测评报告!究竟有多能打?
这期我们测评刚发布的 Nano Banana 2.1,用的还是那套祖传测试用例。应粉丝要求,第三题「不同角度人物一致性」的题目做了更新,Benchmark 也随之升级到 V1.2。本次依然直接在 OpenRouter 的 Playground 上实测。 第一题是中文长文本排版支持测试——水彩风珠海五天行程插画。这道题的表现可能是之前测过的所有模型里最好的,文字整体只错了一处:第一天「渔民佬鹈鹕海鲜餐厅」里的「鹕」字缺失了。与文字无关的问题也有一个:第一天渔女的形象不对,珠海渔女应该是双手捧着东西举起来的。 第二题是文生图综合能力测试——左撇子咖啡馆写信,问题就比较多了。第一,提示词要求左手拿笔、右手拿烟斗,它反过来了。第二,杯子里的清水应该满到快溢出来。第三,墙上时钟要求显示 3:45,时针和分针都没有指对地方。第四,提示词要求明信片上写着清晰可读的「亲爱的阿珍:见字如面」,但这张 2K 的图我放到最大都看不清写了什么,字数也明显不对。第五,提示词要求窗玻璃映出执笔的左手,但因为它左手拿了烟斗,这一条也算错。 第三题是同一角色多视角一致性测试,女孩四宫格不同角度图片。首先这...
Coucou!AI编程神器!桌面悬浮卡通助手!
这个 GitHub 上开源的小工具叫 Coucou,能把 Claude Code 和 Codex 这些 AI 编程 Agent 的一举一动搬进你 Mac 和 iPhone 的刘海和灵动岛,甚至可以在你离开电脑时通过手机一键审批各种授权。开源仅一周,GitHub 上已经攒了 3800 多颗星。 有了这个小工具之后,Claude Code 等每读一个文件、每改一行代码,刘海上都实时看得见:动了哪个文件、加了几行、删了几行都标着,点开就是完整的 diff。权限请求弹出来就是 Allow / Deny / Always 三个按钮,随手一点就完了,不用来回切终端。想知道是哪个会话在等你,一下就能跳到那个终端。 人走开也不耽误:Mac 一锁,它就跟到 iPhone 的锁屏和灵动岛上,权限在锁屏上就能点头;人在外面用语音就能把下一条指令发回 Mac。 它现在盯着 Claude Code、Cursor、Codex、Gemini CLI、Antigravity 这些 Agent;CI 跑没跑过、部署上没上线,刘海里瞄一眼就知道。 天天挂在 Codex 和 Claude C...
Ideogram 4.5 测评报告!是否真的能打?
应粉丝要求,这一集用祖传测试用例测评一下最新的 Ideogram 4.5 模型,直接在官网上测。 Q1 中文长文本排版支持(水彩风珠海 5 天行程插画):几个问题。首先第一天的渔女形象就不符合真实情况,搞得像个自由女神一样——估计这个模型并不知道珠海渔女长什么样子;第二,每一天下面都是一大堆乱七八糟的文字,我数都数不过来。 Q2 文生图综合能力测试(左撇子咖啡馆写信):第一,提示词要求左手拿笔、右手拿烟斗,它反过来了,而且拿烟斗的方式很奇怪;第二,杯子里的清水应该是满到快溢出来的;第三,拿铁应该是半杯;第四,大家看一下墙上的时钟,要求时间是 3:45,时针和分针都没有指对地方;第五,提示词要求写的字「亲爱的阿珍:见字如面」清晰可见,但这张 2K 的图片我放到最大了,都看不清楚里面写了啥。 Q3 同一角色多视角一致性(女孩四宫格不同角度):首先这很明显不是四宫格布局;第二看站位,正面的有了、侧对着的有了,背对着的没有,3/4 视角的半身照也没有;第三,提示词要求左手抱着猫咪,这里没有一个是对的。 Q4 物理常识(女孩落地镜自拍 + 水杯筷子折射):问题有点多。第一,...
SenseNova U1 Pro 测评报告!结果有点意外!
这一集测评的是商汤最新的文生图模型 SenseNova U1 Pro,这次直接在官网上测。同时我们的祖传测试用例也做了一次升级,升级到 V1.1:原来的第二题推理题换成了「文生图综合能力测试」,第四题物理常识题则明确了自拍用的是后置摄像头。 Q1 中文长文本排版支持(水彩风珠海 5 天行程插画):这个模型的生成时间明显比之前测试过的模型都慢,大概要 5–10 分钟。但效果是真的可以——整张图只有第一天「鹈鹕海鲜餐厅」的「鹈鹕」两个字,以及第五天「庞都」的「庞」字写错,这应该是所有测评过的模型中错得最少的一次。 Q2 文生图综合能力测试(左撇子咖啡馆写信):这一题有两个问题。第一,提示词要求左手拿笔、右手拿烟斗,它给反过来了;第二,明信片上写的文字是面向镜头的,而不是面向人物自己的。其他条件看了一下,应该都是满足的。 Q3 同一角色多视角一致性(女孩四宫格不同角度):四宫格的排列是对的,四张图的站位也是对的;唯一有问题的是左下角的第三张图,抱着猫咪的手变成右手了。 Q4 物理常识(女孩落地镜自拍 + 水杯筷子折射):这一题错得有点离谱。第一,镜子里面的女孩拿着手机,而镜子外面...
GPT Image 2.5 Sunburst 测评报告!真的能打吗?
这一集测评的是 OpenAI 最新的图像模型 GPT-Image-2.5-Sunburst,测试依然直接在 OpenRouter 的 Playground 上进行,用的还是那套 6 题的文生图 Benchmark。测下来的整体感觉是相当不错。 Q1 中文长文本排版支持(水彩风珠海 5 天行程插画):第一天「渔民岛鹈鹕海鲜」里的「鹈鹕」两个字错了;第二天「鲨」字的上半部分写错;第四天墙上博物馆的「博物」两个字错;第五天「横琴」的「琴」字错。整体感觉已经比之前测的几个模型好了很多。 Q2 推理和中文支持(桂林手绘三日行程图):这一题不给具体的行程描述,要求模型自己推理。三天行程的安排没有问题,说明它是有推理能力的;而且这次的中文文字仔细看了一下,好像没有找到什么错别字——它的中文能力比我们之前测的几个国产模型还要好。 Q3 同一角色多视角一致性(女孩四宫格不同角度):四宫格的排列是对的,图二没有问题;但图一和图三都画成了右手抱着猫咪(题面指定的是左手抱一只白猫),图四的方向也没做对——应该是 45 度角稍微侧身对着我们。总体来说已经不错了。(更正:视频里说的是「图一和图二没有问...
Hy Image 3.5 Preview测评报告!真的能打吗?
这一集测评的是腾讯新出的图像模型 Hy Image 3.5 Preview,测试依然直接在 OpenRouter 的 Playground 上进行,用的还是那套 6 题的文生图 Benchmark。先给个提醒:答案也许不是你想要的,观看需谨慎。 Q1 中文长文本排版支持(水彩风珠海 5 天行程插画):这一题错得挺多。第一天渔女的形象就不对,「渔民老鹈鹕」和「海鲜」里的「鹈鹕」两个字写错;第二天「鲸鲨馆」三个字明显错;第四天「农家乐」的「农家」两个字错;第五天「励骏庞都」的「骏」和「庞」都错,「手撕鸡」的「撕」还少了提手旁。估计它对中文的支持还是不大好。 Q2 推理和中文支持(桂林手绘三日行程图):这一题不给具体的行程描述,要求模型自己推理。三天行程的安排没有问题,说明它是有推理能力的;但中文错别字同样不少,这里就不一个个指出来了,毕竟本题主要考察的是推理能力。 Q3 同一角色多视角一致性(女孩四宫格不同角度):很明显不是四宫格排列,而且没有看到 3/4 视角的半身照,这一题没做到。 Q4 物理常识(女孩落地镜自拍 + 水杯筷子折射):一共挑出四处问题。第一,镜子里...
Flux 3 模型测评报告!真的能打吗?
这一集测的是黑森林(Black Forest Labs)最新的 Flux 3 文生图模型。用的还是同一套 6 题 Benchmark,逐题实测,模型直接在 OpenRouter 的 Playground 上跑。 Q1 中文长文本排版支持(水彩风珠海 5 天行程插画):整体布局没有什么问题,但错别字错得相当密集。第一天「渔民佬鹈鹕海鲜」里的「渔」和「鹈鹕」写错;第二天「鲸鲨馆」的「鲨」错了,「企鹅」的「鹅」也错了;第三天「外伶仃」的「仃」和「渔」写错;第四天「荔枝园农家乐」的「荔」错了,「农家乐」的「家」位置不对,「农」和「乐」两个字也不对;第五天「励骏庞都」的「励」和「庞」都错了,「手撕鸡」的「撕」还少了提手旁。这一题错得挺多,估计它对中文的支持不大好。 Q2 推理和中文支持(桂林手绘三日行程图):这一题同样不给具体行程,要求模型自己推理。桂林、漓江、遇龙河这三天的安排没有问题,说明它是有推理能力的;但中文错别字也是一大堆,这里就不一个个指出来了,毕竟本题主要考察的是推理能力。 Q3 同一角色多视角一致性(女孩四宫格不同角度):这一题实现得没有问题,四个角度都没看出什么毛病...









