GLM 5 Agent 真能打吗?实测见真章!
发表于|更新于|大语言模型
GLM-5终于来了!号称全球开原模型综合排名第一,推理、代码、智能体全面领先。提供的Agent模式感觉相当哇塞。当然,这是官方说的。是否真的能打,我们还是得测试下才知道
相关推荐
2026-02-16
GLM 5 测评报告!推理编程有多强?
上个视频测评了刚出来的GLM-5的agent,说的如何如何的厉害,测两个cases花了我一个多小时时间,还有各种的幺蛾子。这一集我们来继续用我们的祖传测试用例测评下它的推理和编码能力… 访问入口://z.ai)
2025-11-24
Gemini 3 测评报告!非常炸裂!
gemini 3出来了,有多炸裂,大家看测评吧… 访问入口
2024-11-29
Claude Computer Use API - 大模型如真人操纵电脑
Claude Computer Use API是Anthropic为Claude模型推出的革命性功能,它让AI能够像真人一样操控电脑屏幕——移动鼠标、点击按钮、输入文字、滚动页面、浏览文件等。与传统的API调用不同,Computer Use API让Claude能”看”到屏幕截图,理解界面布局,然后自主执行操作。这意味着Claude可以帮你完成填写表单、查找文件、操作软件等一系列需要图形界面交互的任务,真正实现了”AI替你用电脑”。
2025-12-12
Trae Solo无需邀请码啦!
Trae-Solo取消了邀请码限制,现在所有人都可以直接注册使用了!此前Trae-Solo采用邀请制,需要邀请码才能注册使用。取消邀请码标志着产品正式向大众开放。本视频教你如何注册和使用Trae-Solo,以及它作为AI开发工具的核心功能和使用技巧。 访问入口
2025-10-21
蚂蚁百灵大模型测评!真是SOTA级别?
今天来玩下阿里蚂蚁团队新推出的Ling-1T 模型,这是一个突破性的万亿参数大语言模型,它独特之处在于,它宣称是一个“非认知”,也就是非推理模型,但却通过创新的“进化思维链”(Evo-CoT)训练方法,在多项复杂推理任务上实现了最先进的性能… 访问入口
2025-11-14
Kimi K2 Thinking!凭什么打败GPT-5?
Kimi K2 Thinking 杀到!这个模型有点不一样哦! 昨天聊为什么大家做开发都喜欢用 CLI 和 IDE 我就已经提了下它有点特别了。今天打算花点时间继续聊下它。这个模型厉害之处在于它和以前的思考模型有很大不一样,以前的模型都是在思考完成后,才开始干活,开始调用工具的,而 Kimi K2 Thinking 则是可以做到一边进行思考,一边调用工具,然后再根据工具的输出结果继续进行深入思考的。它这种“思考-行动-反馈-再思考”的循环模式,让它变成了一个真正的超级智能体… 访问入口
公告






