大模型首Token为什么慢?KV Cache是什么鬼?
发表于|更新于|免费AI工具
本期视频深入浅出地讲解大语言模型首 Token 延迟的根本原因——KV Cache 的工作原理。为什么有时候模型要”想”半天才说出第一个字?KV Cache 如何影响推理速度和显存占用?看完这期你将彻底理解 Transformer 推理的底层机制,以及为什么 KV Cache 是大模型推理优化中最核心的技术之一。适合对大模型原理感兴趣的开发者与 AI 爱好者。
相关推荐
2025-09-09
Qwen3 Max Preview最新版测评!吊打Kimi K2?
上一个视频我们介绍了阿里最新推出的万亿参数的非推理模型Qwen3 Max Preview,看官方benchmarks的话吊打这个,碾压那个的。同时为了响应多个粉丝的需求,这里打算拿上两天测评Kimi K2 最新0905版本的cases来测评下,大家也可以和之前Kimi K2的测评视频对比着看。 好,开始吧 访问入口

2025-02-18
OmniParser v2:开源AI自动控制电脑完成任务
免费开源AI自动控制你的电脑执行你下达的任务啊。今天要介绍的是微软的OmniParser V2,其实大家如果还记得的话,我接个月前就介绍过OmniParser的v1版本了,这次的升级版本比v1快了60%,能理解更多的屏幕和浏览器上的元素,它的工作原理就是对电脑截屏,然后通过各种视觉大语言模来解析应该操作当前屏幕的哪个位置… Github入口

2025-01-31
Qwen 2.5-vl + Browser Use:打造本地Operator
通义千问版Operator啊!我们知道OpenAI推出的Operator震撼全球,可以像真人般操作浏览器去完成不同的任务。今天我们说下怎么用通义千问最新推出的开源免费的Qwen2.5-VL视觉大模型加上我们之前分享过的Browser Use来搭建本地跑的Operator… “Qwen2.5-vl API Server” github 入口 “Browser Use web-ui” github 入口

2025-02-21
Grok3推理模型测评:打败DeepSeek r1?
Grok3 reasoning model推理模型测试报告啊。今天终于发现可以在官网上免费用上Grok3了,鉴于上次在lmarena上测试的是early-grok-3,这次准备在官网上正式测试下,我们这次先测试的是推理模型。去到官网,看到这里已经是grok 3了,选择Think,打开推理模式… 访问入口

2026-08-01
Qwenwork入门(3)!工作台怎么选?
千问办公 Qwenwork 四大工作台完整讲解,通用、设计、幻灯片、写作分场景适配办公需求: 通用工作台:仅输出代码无实时预览,适合综合杂务 设计工作台:自带可视化画布可实时微调界面,以番茄时钟设计实测对比两者输出差异 幻灯片 / 写作工作台:PPT、长文创作也有专属专业编辑环境 选对应工作台能大幅提升创作效率,后续逐一拆解各工作台实操玩法。 访问入口
2025-08-07
一键生成老黄历视频!免费扣子工作流!
每天分享一个免费扣子工作流,今天要分享的是老黄历视频生成 扣子访问入口 工作流 第一步,扣子上新建工作流 第二步,拷贝上面工作流 第三步,粘贴到第一步新建工作流 第四步,配置好开始和结束节点
公告





