AirLLM
AirLLM

AirLLM

推理加速本地部署

4G 显存跑 70B 大模型,逐层加载不量化不裁剪

访问官网
收录: 2026-09-29·更新: 2026-09-29·开发框架

详细介绍

产品定位
AirLLM 是由 Gavin Li(GitHub 账号 @lyogavin)开源的大语言模型推理库,采用 Apache-2.0 协议发布,官方定位为 AirLLM 70B inference with single 4GB GPU。它面向显存资源有限的个人开发者、研究者和边缘设备用户,目标是在普通消费级显卡甚至较小显存环境中运行大规模语言模型,降低大模型推理与微调的硬件门槛。它不追求实时交互速度,而是强调以极低显存完成大参数模型推理,让原本需要多卡或高显存服务器才能加载的模型,在单张 4GB 等小显存 GPU 上具备可运行性。

核心功能
AirLLM 的核心能力是低显存大模型推理,并支持在有限显存下进行参数规模很大的模型微调。根据公开素材,它可以在 4GB 单卡上推理 Llama 3 70B 全精度模型,在约 8GB 显存下运行 Llama 3.1 405B,在约 12GB 显存下运行 DeepSeek-V3 671B;8B 模型显存占用约 1 至 2GB。它还支持 6GB 显存 LoRA 微调 1250 亿参数级模型,为预算有限但希望本地实验大模型的用户提供了可行路径。

技术特点
AirLLM 的关键技术特点是不压缩模型本身,而是改变模型参数的加载方式。推理时,显存只驻留当前正在计算的一层参数,该层计算完成后立即释放,再加载下一层,因此显存占用主要取决于单层参数大小,而不是模型总参数量。这种按层加载与释放的策略显著降低峰值显存需求,使超大模型可以在小显存 GPU 上运行。代价是推理速度较慢,大约每秒生成 1 至 3 个 token,因此不适合对延迟敏感的实时对话场景。

适用场景
AirLLM 适合显存有限但需要运行超大模型的实验、验证和离线任务。例如个人开发者在小显存显卡上测试 Llama 3 70B、Llama 3.1 405B 或 DeepSeek-V3 671B 等模型,研究者进行低资源环境下的模型能力探索,或在 6GB 显存条件下对 1250 亿参数级模型做 LoRA 微调。它也适合批量生成、离线推理、教学演示和原型验证等不要求实时响应的任务。若用于聊天机器人、实时问答或高并发服务,则需考虑其每秒 1 至 3 token 的速度限制,并可能需要结合缓存、批处理或更高性能硬件。