市面上大模型琳琅满目,不少模型刚发布就宣称拿下各类基准榜单第一名,很多人冲动充值会员,实际体验却远不及宣传效果。

为此 AI产品狙击手 自制了大语言模型排行榜,使用同一套精选基准对各大模型统一评测,产出真实分数,一眼分辨模型实力与宣传水分。这套测试用例数量不多,但重在真实,主攻大模型核心的推理、编程能力。

点击单个模型,可查看每一项用例的评测详情以及打分缘由,还能跳转对应的实测视频。全部评测公开可追溯,你也可以使用相同测试用例自行复现验证,帮你甄别那些虚高宣传的大模型。