蚂蚁百灵Ling 3.0 Flash 测评报告!几近全军覆没!
发表于|更新于|大语言模型
蚂蚁百灵 Ling 3.0 Flash 实测翻车!124B MoE 模型实测指令逻辑、推理、代码全拉胯,约束文本语序混乱不通顺,密码推理答错,游戏代码大量 bug 无法正常交互,看板编辑拖动功能全部失效…
其他模型测评排行榜请看这里:https://www.techgogogo.com/llm-benchmark/
相关推荐
2026-02-02
Kimi K2.5 结果不是我要的!测评报告!
昨天被刚出来的Kimi k2.5给惊艳到了,特意做了个视频分享了它根据我博客录制的视频就能帮我完美复刻出一模一样的网站。今天打算搬出我们得那套测试用例,探一探它推理和编程能力的深浅… 访问入口

2025-04-14
DeepCoder 14B开源编程模型:媲美o3mini!
Together AI 最新开源一个专门用来编程用的大语言模型,叫做DeepCoder-14B, 14B参数就能媲美openai o1和o3-mini的编程能力,着实令人兴奋!大家可以通过ollama在本地上跑,当然,配置差点的可以找个好的机器去做下量化再跑,或者找下网上是否有量化版本… 访问入口
2026-03-10
Openclaw QQ官方正式支持接入!三步轻松搞定!
OpenClaw现在官方正式支持接入QQ了!本视频教你”三步轻松搞定”OpenClaw与QQ的集成。第一步:安装QQ插件;第二步:配置API密钥和机器人参数;第三步:启动并测试。完成配置后,你就可以在QQ中直接向AI下达任务——管理群聊、自动回复、执行工作流等。对于使用QQ作为主要沟通工具的团队和个人来说,这是一个非常实用的AI集成方案。 访问入口

2024-12-22
Kimi视觉推理大模型:差评!
看网上都在吹Kimi的视觉推理大模型,说得神乎其技,可以取代OpnAI 200刀每月的专业版之类的,真有这么厉害吗?这里我们也来快速测试下。首先,我们来个简单都英语填空题,这种题一般的大模型都能做对,本来就是大语言模型的强项,仅作为最基本验证,它也是没有问题的。再看第二道题,来个脑筋急转弯,分析推理确实是一大堆的,答案也和预期一样,但是它是实打实的脑筋不转弯都从语言学等角度得出的答案,其实这里在中文语境中用脑筋急转弯思路就能很快得出答案,太阳公公嘛,那太阳肯定是男都啰。况且太阳叫做sun,儿子也读作son,也能得到印证。所以我推定它是不适合做脑筋急转弯的,起码不适合做中文的脑筋急转弯。下一道数学题,“一口井7米深,有只蜗牛从井底往上爬,白片爬3米,晚上下坠2米。问蜗牛几天能从井里爬出来?”这里要注意解题的关键点是最后一天可能它不会滑下来了。我们看它分析,前几天都没有问题,第四天,白天爬3米,就是到了6米,晚上滑下来2米,到了第4米,第五天,白片爬3米,4+3刚好7米,所以就爬出来了,就不用考虑晚上往下滑了。所以答案是5天就能爬出去。我们看它最终做了一大堆装模作样的推理,最终还...
2025-11-24
剪映VIP!就是个大坑!
本来我用的是老版本的剪映,想用智能抠像功能,买了VIP。心想着VIP都买了,就干脆剪映也升级了吧。已升级,发现智能抠像需要SVIP了,还需要额外给钱,我哪个天…
2025-07-31
即梦表情控制实战-上
即梦实战第15集,准备花两集时间玩下即梦视频3.0模型对人物的表情控制,废话不多说,赶紧去demo 访问入口
公告





