AirLLM!4G显存跑70G大模型!穷人Deepseek部署指南!
手头没有强劲显卡、又想本地部署几十上百 B 参数大模型的兄弟,这个开源项目值得看一下——不过有言在先,速度肯定是慢的。它就是 AirLLM,号称 4G 显存就能跑 70B 大模型,目前在 GitHub 上已经攒了 38K 多颗星。前两天分享的 FreeToken 用 4G 显存跑 35B 已经够厉害,AirLLM 更夸张。
用法简单到离谱:pip 装上 airllm,一行代码把 HuggingFace 的模型名传进去,就能在自己的游戏本上跑推理。原理说穿了不复杂——大语言模型由多个 Transformer 构成,每个 Transformer 又分多层,AirLLM 让显存里一次只放一层参数,其他参数躺在硬盘上,用的时候再搬进来。所以显存占用取决于「单层有多大」,而不是模型总大小。
关键在于:不用量化、不用裁剪,精度一点不打折。往上加码也不虚——405B 的 Llama 3.1 用 8G 显存就能跑,671B 的 DeepSeek V3 只要 12G,连 2.8 万亿参数的 Kimi K3 都号称 4G 以内能跑,Mac 上苹果芯片照样能玩。更狠的是,它现在还能在 6G 显存里微调 1250 亿参数的模型,准备好 LoRA 数据扔进去就行。
模型方面支持 Llama、Qwen、DeepSeek、ChatGLM、Mistral 这些主流全家桶。手里只有游戏本、又想折腾大模型的兄弟,可以去装一个,拿个 70B 的模型试试水。











