超越Kimi K2?GLM 4.5测评报告!
发表于|更新于|大语言模型
|浏览量:
上个视频介绍了号称在推理、智能体和编程能力都达到SOTA级别的原生智能体大模型GLM 4.5, 承诺会找些cases和大家一起去测评下是否真的这么厉害。 那就来吧,我们就分别测试下这几个能力
相关推荐
2025-07-31
GLM 4.5:原生智能体大模型!你的饭碗还稳吗?
称SOTA级别的原生智能体大模型GLM 4.5来袭!智谱AI近期重磅推出了其最新的旗舰基座模型系列:GLM-4.5与GLM-4.5-Air。这一代模型的核心目标是将前沿的推理、代码生成和智能体(Agent)能力进行深度统一,以应对更复杂、更多样化的应用场景 官方博客访问入口 在线使用入口
2024-11-29
MaaS开放平台深体验:强大工具模型开发实战
MaaS(Model as a Service,模型即服务)开放平台是阿里云等云厂商推出的AI模型服务平台,让开发者可以通过API调用各种大语言模型和AI能力。本视频深度体验了MaaS平台的各项功能,包括模型调用、工具链集成、开发实战等。涵盖了:如何注册和使用MaaS、支持哪些模型、如何调试和优化API调用、以及实际开发项目的全流程演示。对于想要在应用中集成AI能力的开发者来说,这是一份实用的MaaS入手指南。 访问入口
2025-11-14
空间智能和世界模型!大语言模型有什么问题? .mp4
空间智能和世界模型!大语言模型有什么问题?
2025-05-08
Kevin-32B:专写Cuda的开源大模型!
今天给大家扒一个特别硬核的开源模型——Kevin(这名字起得够随意的,据说是把Kernel和Devin硬凑出来的)。这玩意儿可不简单,是个专门折腾CUDA和GPU内核编程的AI,基于阿里的QwQ 32B参数的大模型微调来的。最离谱的是,它在斯坦福的Kernel Bench测试里直接干出了65%的准确率,把OpenAI的GPT-3.5(35%)和GPT-4 Mini(36%)按在地上摩擦,连自家基座QwQ-32B原版(23%)都给秒了 官方博客 Huggingface入口

2026-04-23
GLM 5.1!真的能打吗?真实测评报告!
GLM-5.1是智谱AI推出的最新一代大语言模型,本视频对其进行独立、全面的真实测评。测试涵盖:自然语言理解、编程能力、数学推理、多轮对话、中文专长和安全性等维度。通过与GPT-4、Claude 3、Qwen等国内外主流模型的横向对比,真实反映GLM-5.1的实力水平。对于关注国产大模型发展的用户来说,这是一份客观的评估报告。 访问入口
2026-03-22
CLI-Anything!将所有软件智能体化!AI 高手进阶之路!
CLI-Anything是一款革命性的工具,它能让AI Agent通过命令行操控你电脑上的任何软件——包括那些没有API的闭源应用。通过结合MCP协议和桌面自动化技术,CLI-Anything将每一个软件都”封装”成AI可以调用的工具,实现跨应用的自动化操作。这是AI高手进阶的必经之路——掌握了CLI-Anything,你就能让AI帮你操作Photoshop、Excel、浏览器等任意软件,完成真正的端到端自动化。 访问入口
公告





