Vocalremover!一键分离音乐人声和伴奏!自媒体神器!
今天要分享的是一款 vocal remover AI 工具,它可以把音乐分离成人声和伴奏两条音轨。 先听一下原始的音乐,再来听分离之后的人声——是不是很清晰?接着单独听伴奏,可以看到人声和伴奏已经完全分离开来了。 使用方式也非常简单,直接把音频上传上去,一键就搞定了。 这个工具最大的优势就是免费。市面上不少收费的 AI 工具同样能做到人声分离,但你得先打开那些工具、还得付费,一圈折腾下来并不轻松。所以这个免费方案就显得格外难能可贵。如果大家还是找不到入口,可以在评论区跟我说一声。 访问入口
Kimi K2.8 测评报告!真的能打吗?
Kimi K2.8 Preview 的测评报告终于来了。这次测试用的 key 由 B站网友「非著名思想公智」提供,评测依然放在 PI 平台上进行,尽量把 Harness 的影响降到最低,思考模式同样拉到最高。 不过在开始之前有个问题想先问大家:既然 Kimi K3 都已经出来了,为什么现在才推出 K2.8 Preview?知道的朋友可以在评论区聊聊。 推理能力测试 第一题是强约束指令遵循的句子生成,要求所有句子分别以「一到十」结尾。这一题有点大跌眼镜——十句里明显只有第一句和第四句符合结尾要求,通读下来这两句是通顺的。 第二题是新版 24 点,需要给出三个解。结果非常棒,三个解都完全符合提示词要求。 第三题是难度更高的新版密码锁推理,答案是 7294364,判断正确。 编程能力测试 第四题要求实现一个精美的浏览器操作系统。第一版点上去没有反应,毕竟花了几十分钟开发,直接判失败有点可惜,于是让它返修了一次,之后就能正常使用了。右上角的弹窗表现还算可以,Dock 栏里的应用功能也没什么问题,但压轴的太空射击游戏直接报错,这一项不行。 第五题是 3D 赛车游戏。车道方向就不对,游...
小米 MiMo X Pro 测评报告!真的能打吗?
小米 MiMo X Pro Preview 测评报告来了!作者申请内测权限等了两天没拿到,多亏群里周黑鸭哥哥帮忙跑完全套祖传测试用例还提供录屏,非常感谢。 第一题:约束指令句子生成 所有句子都按要求以 1 到 10 结尾,通读后发现 4、7、8、9 几句读起来不通顺,第 6 句表达也比较别扭,日常很少会这么描述。 第二题:新版 24 点要求三组独立解法 三组答案全部违规,都重复使用了题目限定数字,不符合规则。 第三题:七位数密码锁推理 顺利输出正确答案。 接着开始代码项目测评,浏览器操作系统系统弹窗正常,UI 中规中矩,Dock 栏应用运行没问题,但是太空射击游戏无法发射子弹,按键和鼠标点击都没有响应。3D 赛车游戏打开之后完全没有交互,看着就像一张静态图,直接测试失败。Trello 看板 UI 风格比较普通,卡片无法编辑标题,列表不能拖动,删除按钮显示禁用状态却可以点击删卡,存在明显异常,仅列表删除功能正常。 整套测试结束,周黑鸭同学反馈本次测评消耗掉 1% 的内测周额度,测评结果留给大家自己评判,欢迎在评论区聊聊你的看法…… 访问入口
Deepseek V4.1 Flash正式版测评!究竟有多能打?
Deepseek V4.1 Flash 正式版实测来了!模型刚上线就惦记着测试,抽时间在 pi 平台开启测评,尽量降低 harness 带来的干扰,思考模式直接拉满开始测试。 推理能力测试 第一题 · 强约束指令句子生成:要求全部句子以「一到十」结尾,通读全部语句都通顺达标。 第二题 · 新版 24 点:要求给出三组解法,结果三组答案全都违规——数字重复使用,不符合「每个数字只能用一次」的硬性规则。 第三题 · 七位数密码锁推理:高难度推理题顺利算出正确答案。 编程项目测评 浏览器操作系统:桌面带有动态动画效果,还有精致小组件,弹窗、Dock 应用运行正常,可惜压轴太空射击游戏无法交互,差了最后一步。 3D 赛车游戏:让人眼前一亮,是这么多轮测评里完成度顶尖的作品,画面精致,车辆模型完整,整体效果非常惊艳。 Trello 看板:采用深色 UI,审美因人而异,卡片拖拽动画效果一般,其余基础功能都正常可用。 整套测试下来,24 点推理题和太空射击项目留下遗憾,但 3D 赛车的代码实现确实足够亮眼。大家怎么看待 Deepseek V4.1 Flash 正式版的这套实测表现...
讯飞星火 X2.5 API测评报告!究竟有多能打?
想知道讯飞星火 X2.5 真实实力?接入 API 放到 pi 平台跑全套祖传测试用例!第一题强约束指令遵循句子生成测试,5、7、8 句不通顺,第十句口语化。第二题24点截断只算出一组解法。第三题高难度七位数密码锁推理顺利答对,推理能力让人意外。编程题:浏览器 OS UI 观感不错,右上角弹窗效果在线,Dock 正常,附带太空射击游戏可玩但偏难;3D 赛车正常但车速偏快;Trello 看板卡片拖动正常,列表拖动失效,输入标题有显示 bug。整体表现不错,全国产算力训练是亮点,适合对数据安全敏感的团队,大家怎么看这次实测结果呢…… 访问入口
Mercury 2.5测评报告!自回归大语言模型杀手?
扩散大语言模型这条路走得通吗?称生成速度上千 token 每秒的扩散大模型 Mercury 2.5 实测来了!粉丝点名让我测试这款刚在 OpenRouter 上线的 Diffusion LLM,这类模型和普通自回归模型不一样,不会逐个输出 token,而是一次性批量吐出多个 token,理论上速度直接拉满。 我在今年 3 月就测过旧版本,当时表现很差,期待新版本能有所改善。本次通过 OpenRouter 在 pi 环境接入,思考模式开到最高,逐项实测: 第一题·强约束指令生成:生成速度肉眼飞快,不用快进,但全部句子语句不通顺,直接翻车; 第二题·新版 24 点:要求三组解法,模型直接表示无法求解,要求去掉数字 2 才能作答; 第三题·七位数密码锁推理:给出的答案完全错误,三道推理题全军覆没。 接着测试编程任务: 浏览器操作系统缺少弹窗,仅计算器勉强可用; 太空射击游戏完全失效; 3D 赛车 UI 简陋,越过第一个障碍物之后不再刷新障碍; Trello 看板初始化界面异常,创建列表后无法新建卡片和拖拽。 整套测评下来,这款扩散大模型空有极速生成的噱头,推理和代码落地能...
GPT-Image 2.5最新测评报告!究竟有多能打?
GPT Image 2.5 全量开放,免费账号也能直接用!今天拿祖传图片测评用例实测,左侧图片菜单旁出现新标识,点开 template 模板看到对应 logo 就代表是最新版本。 第一道压轴题上传多人图片,要求互换左右两个人物位置,画面看似完成交换,但出现明显 bug——人物交换后还残存了多余的手部图像。 第二道测试中文能力,生成水彩风格珍珠海 5 天行程插画,整体画面尚可,但图内出现错字,更换提示词生成桂林手绘三日行程图,模型能自主推理规划行程,可文字错误字更多,能看出中文文字渲染依赖旧短短板明显。 第三题生成 3D Q 版两层咖啡杯造型星巴克建筑,画面效果惊艳,提示词遵循到位。 第四题上蚂蚁巢穴城市天气卡,构图观感很好,耗尽只能终止测评。这套实测能看出它图像生成有亮点,但中文文字渲染、图像物体编辑仍存缺陷,你觉得 GPT Image 2.5 表现如何,有优质测评用例欢迎分享,后续我加到祖传测评集里…… 访问入口
开源企业 AI 语音客服神器!一键搭建语音数字人!
企业搭建 AI 语音客服、数字人实时语音有新方案! 开源框架 LiveKit Agents,可将文本大模型转为支持通话的语音助手,GitHub 14k+star,几十行代码即可搭建,支持电话客服、自动外呼、数字人语音,结合 WeKnora 企业知识库实现智能问答与客服自动化。 自带端点检测避免抢话,支持多 Agent 业务接入,MCP 快速接入工具,支持私有化部署,Apache-2.0 协议可商用。 做语音机器人、数字人的企业可以跑示例体验一下…… 访问入口
Agnes 3.0 Flash测评报告!始料未及的结果!
Agnes 3.0 Flash 免费可用的大模型实测来了! 使用 pi 接入并开启思考模式,指令生成测试仅有半数句子通顺,24 点任务上下文中断,密码锁推理答案错误。全部编程测试项目接连报错、运行中断,服务稳定性很差。 整套测评下来,也就 API 免费勉强算得上优,其余能力一言难尽。你觉得这个模型还有哪些可用场景呢…… 访问入口
Deepseek V4.1 多模态测评!能打吗?
Deepseek V4.1 预览版多态实测来了!上一轮我们测试推理与编程能力,今天直接拿祖传多态测试用例检验图像能力,该模型暂不支持视频,所以只做图片测试。 首先传入《老无所依》电影截图片名询问影片名称,任务跑了二十多分钟,Deepseek Harness 浏览器几乎卡死,只能终止任务。过程中模型可以识别画面内容,但始终识别不出电影名字。换一张同影片简单截图,耗时五分钟多才成功识别出来。 接下来判断图片里对话亭相对黄色货车的方位,模型准确答出右侧,答案无误。 找不同题中,精确定位第一行第四列倾斜十二度,多观察能力可圈可点。再提升难度,统计画面里雄鸳鸯数量,雄性 5 只识别正确,雌性统计出错——把画面左侧的野鸭错误计入雌性鸳鸯数量。 原本准备两道视频测试题,受限于模型不支持视频输入无法开展。整体图片测试有亮点也有明显短板,大家觉得这个模型多模态水平到底如何…… 访问入口









