LLM的各种基准测试Benchmarks
发表于|更新于|学习
在评测大语言模型性能时,各种基准测试(Benchmarks)是衡量模型能力的重要标准。常见的基准测试涵盖了不同维度:MMLU(大规模多任务语言理解)测试模型在57个学科上的知识广度;GSM8K和MATH用于评估数学推理能力;HumanEval和MBPP测试编程能力;HellaSwag和WinoGrande评估常识推理;BENCH和MT-Bench则关注模型的对话质量。不同的基准测试各有侧重点,没有任何一个测试能全面反映模型能力,因此需要综合看待多个Benchmark的结果。本视频系统梳理了主流LLM基准测试的含义、测试方法和注意事项。
相关推荐
2025-10-09
Comet AI浏览器!安装使用指南!
如果有看我早上的《AI早报》的,应该知道Perplexity AI浏览器Comet现已全面免费开放使用。这款产品历经84天内测期和数百万用户的等待后正式向全球发布。安装方式也非常简单,来到官网… 访问入口

2026-07-17
Longcat 2.0 测评报告!真的那么能打吗?
Longcat 2.0是美团推出的长文本大语言模型,以其超长上下文处理能力著称。本视频对其进行全面测评,重点测试其长文本理解、长文档分析和多轮对话的连贯性。通过处理万字长文、复杂文档等任务,评估其是否真的如传说中”那么能打”,以及在长文本之外的常规任务上的表现。

2025-02-08
DeepSeek是怎么做到的?
首先,我们看数据,V3训练用了2788K的GPU Hours,相当于一块GPU用了近300多年,而他们用了2000块GUP,所以用了越2个月时间就训练出来了。对比下LLama 3.1 405B, 它们用了近3100万个GPU Hours来训练,deepseek的11倍还多,同时还要考虑deepseek用的GPU肯定是没有人家老美的性能好的,这也就是为什么V3的训练花费比海外这些同等级别模型低几个数量级的原因,从而打破老美的算力霸权,也打破了顶尖大模型只能掌握在OpenAI和谷歌这些屯了大量卡的大公司的垄断… 官网入口

2024-12-09
LTXV:开源免费视频生成AI工具
LTX Video(LT)是由Lightricks推出的开源视频生成AI模型,被广泛认为是最强大的开源视频生成工具之一。与Runway和Pika等商业化工具不同,LTX Video完全开源,可以免费使用和本地部署。它能够根据文字描述或图片输入生成高质量的视频内容,在运动流畅性、画面细节和文本对齐方面表现出色。对于AI视频创作者和研究者来说,LTX Video提供了一个不亚于商业产品的免费视频生成方案。 访问入口

2026-09-21
Laya大模型!Jev开源平替!本地轻松部署!
Jev 的平替就这么被开源了,兄弟们。看一下 GitHub 上这个叫 Laya 的项目:上线三天,4000 多颗星,pip 一行装上就能用。 用法是把它当决策层用:把邮件、工单这类原文倒进去,再用 choice、score、noul 这三种题型把要问的事情写清楚——比如这封邮件应该转给哪个部门?客户有多急?客户是不是想要退款?这条 prompt 是不是越狱注入?30 毫秒左右,所有答案一起回来。它不生成文字,所以你不用像调用大模型那样拿代码去解析结果,它也没法编点什么出来。 作者还拿它跟 Jev 对着测:Laya 答对了 76.6%,Jev 自己公布的是 72.7%,高那么一点点;速度就差得比较多了——Jev 200 多毫秒,而它 30 毫秒。同时 Jev 是个闭源接口,按调用量来收钱;Laya 你下载回来自己跑,不花钱。 作者在页面上也写清楚了哪儿不行:比如选项超过 20 个,它就不如 Jev 了;想更准确一点,得自己去训练一遍,脚本和教程作者都给了,免费显卡跑个四五小时就搞定了。而协议用的是 Apache 2.0,所以可以商用。 做工单分流、内容审核、AI 网办的兄弟,...

2026-07-18
即梦5.0图片编辑测评!打得过Nano Banana吗?
即梦5.0的图片编辑功能迎来重大升级,本视频对其进行全面测评,并与NanoBanana进行对比。即梦5.0在图片编辑方面新增了多项AI功能——包括智能修图、背景替换、风格迁移等。通过实际编辑测试,对比两款工具在编辑精度、效果自然度和操作便捷性方面的表现,帮你判断哪个更适合你的图片编辑需求。
公告





