文心4.5测评报告:编程能力很拉胯!
发表于|更新于|编程工具
这两天测评了Llama-4,感觉不尽如人意。今天打算用同一套测试用例测试下刚出来没多久的文心4.5和推理模型X1, 先测评4.5吧…
相关推荐
2025-05-03
文心Turbo 4.5测评:效果炸裂!
最近百度文心发布了最新的4.5 Turbo和推理模型x1 turbo,据说performance都有很大提升,这一集准备先测评下通用的4.5 turbo,下一集再测评下x1 turbo。废话不多说,我们赶紧去测评下… 访问入口
2025-12-25
中文大模型Top 1!文本能力天花板!
荣获”中文大模型Top1”称号的AI模型,在文本理解和生成能力上达到了”天花板”级别。本视频深入测评这款模型的中文能力——包括古诗词创作、文言文理解、中文修辞运用、成语典故引用等传统中文AI的难点。通过大量实际案例展示其卓越的中文文本处理能力,并分析它为什么能在中文领域超越其他模型。 访问入口
2025-05-03
文心X1 Turbo测评:与完美之间差个编程!
早上测评了文心最新的4.5 Turbo,表现还不错。承诺大家会再测试下最新推理模型X1 Turbo的,这次我将会用一套升级后的由浅入深的推理模型测试用例来测试下… 访问入口

2025-04-08
文心推理模型X1测评:和DeepSeek有很大差距!
看来无论是4.5还是x1,文心一言在编程方面都是一样的拉胯。所以总的来说,在我看来文心一言这些模型的能力和deepseek嘴型 v3.1 以及推理模型 r1还是存在比较大的差距… 访问入口
2024-11-29
MaaS开放平台深体验:强大工具模型开发实战
MaaS(Model as a Service,模型即服务)开放平台是阿里云等云厂商推出的AI模型服务平台,让开发者可以通过API调用各种大语言模型和AI能力。本视频深度体验了MaaS平台的各项功能,包括模型调用、工具链集成、开发实战等。涵盖了:如何注册和使用MaaS、支持哪些模型、如何调试和优化API调用、以及实际开发项目的全流程演示。对于想要在应用中集成AI能力的开发者来说,这是一份实用的MaaS入手指南。 访问入口
2025-11-25
Claude夺回王座!同时解决MCP难题!
前两天我们分享的谷歌 Gemini 3才大杀四方!今天 Anthropic 就祭出 Claude Opus 4.5 来夺回AI编程老大的皇冠。它不仅是 Claude 系列的又一次飞跃,更凭借其在多项关键基准测试中的卓越表现,一举登上编程、智能体和计算机使用(也就是computer use)能力领域的巅峰。Opus 4.5 在业界公认难度极高的 Swebench Verified 编程基准测试中,以超过 80% 的高分领跑,并在 OSWorld 和 Agentic Tool Use 等测试中同样位居榜首,充分证明了其在复杂任务执行、代码自动修复和系统级操作方面的超凡实力…展开更多 访问入口
公告





