AirLLM:4GB 显卡就能跑 70B 大模型,穷人也配玩本地 AI
featuredImage: https://cdn.lpflpf.cn/covers/free-2026-08-10.png
跑一个 700 亿参数的大模型,得用什么显卡?
搁两年前,标准答案是 A100/H100——一张几十万,普通人连想都不用想。所以"本地跑大模型"一直被当成富哥专属。
AirLLM 这个项目就是来打破这句话的:它让 70B 的模型跑在单张 4GB 显卡上,不用量化、不用蒸馏,硬跑。2024 年它火过一轮,这周又杀回 GitHub 趋势榜(一周 +5.7k star),因为 7 月它干了一件更离谱的事:把 2.8 万亿参数的 Kimi K3 塞进了 3.72GB 显存。
穷玩 AI,是真的可以玩了。
原理就一句话:GPU 里永远只放一层
大模型是几十层堆起来的,传统推理得把整个模型塞进显存,70B 光权重就要 140GB。AirLLM 换个思路:用哪层,就从磁盘加载哪层,算完立刻换下一层。
显存需求从"整个模型"降到了"单层"。70B 的模型单层权重大约 4GB,正好是普通消费卡的水平。代价就是慢——每层都要读盘,推理速度跟 A100 没法比。但你要的是"在自己电脑上跑通",不是"跑得快",那它完全够用。
打个比方:别人雇一个团队驻场干活,你请一个人轮流干所有岗位。一个人慢,但一个人便宜。
现在能跑啥

看项目更新日志就挺有意思:
- 2026/07:Kimi K3(2.8T 参数)单卡 3.72GB 跑通——目前最大的开源模型
- 2026/06:v3.0 支持 FP8,DeepSeek-V3(671B)约 12GB,Qwen3-235B 约 3GB
- 2024/04:Llama3 70B on 4GB
- 2023/12:MacOS 也能跑 70B
注意最后两个数字:DeepSeek-V3 只要 12GB,一张 3090 就能带;Qwen3-235B 只要 3GB,核显都敢想。这放在 2024 年,是想都不敢想的事。
上手其实很简单
|
|
|
|
用法跟 transformers 差不多。第一次运行会把模型按层拆开存到本地磁盘——注意留够硬盘,70B 全精度要 140GB 左右。
几个有用的参数:
- layer_shards_saving_path:自定义拆分后的存储路径
- FP8 模式:显存再砍一半(DeepSeek-V3 从 24GB 降到 12GB 就是这么来的)
- MacOS 有专门支持,官方文档里写了
官方在 Kaggle 上放了一个完整示例(Platypus2-70B + 维基百科 RAG),跟着跑一遍,就能亲眼看到 4GB 显卡跑 70B。
实际跑一遍是什么体验
光看 README 没感觉,说下真正上手会经历的流程。
第一步是准备环境。一张 4GB 显存的显卡(GTX 1650 这种级别就行),外加至少 150GB 空闲磁盘——注意,是磁盘不是内存。很多人在这步卡住:模型下载 + 拆分,70B 全精度要占一百多 GB 硬盘,拆完之前跑不起来。
第二步是首次运行。AirLLM 加载模型时会先把权重按层拆分保存到本地,这个过程是纯磁盘操作,会等一阵子。拆分完成后,真正的推理才开始:你问它一个问题,它逐层从磁盘读权重、计算、再换下一层,GPU 占用始终不高,但你能明显感觉到它在"一卡一顿"地出结果。
第三步才是真正有意思的地方。等你看到那句完整的话被一个 70B 模型(而不是 7B 小模型)一个字一个字吐出来,而且它完全跑在你自己的电脑上、数据没出过机器——那种"这玩意儿我也有"的踏实感,是调 API 给不了的。
如果你想少走弯路,可以直接用官方的 Kaggle 示例:它跑在 Kaggle 的免费 GPU 上(不需要自己的显卡),环境都配好了,跟着 Notebook 一步步跑,Platypus2-70B + 维基百科检索问答,一次就能跑通。
一个提醒:别拿它当日常对话用。等一轮回答的时间够你泡杯茶,这是逐层加载的代价。但你要是想搞私有部署、做离线实验、或者单纯想看看 70B 和 7B 的回答质量差距到底有多大——它值得你折腾一晚上。
说点大实话
这工具不是万能药,优缺点都明显。
适合的人:
- 学生、个人开发者:手里就一张消费卡,想跑大模型做实验、搞私有部署
- 隐私敏感的场景:数据不想出本机,本地推理是唯一选择
- 想摸一摸超大模型但没预算的人:Kimi K3 这种 2.8T 的怪物都能跑,慢是慢点,能跑
不适合的人:
- 生产环境:每层都读盘,速度是硬伤,线上推理老老实实用 A100 或 API
- 高频交互:推理一次等半天,急死人
- 硬盘不够的人:70B 拆分后要 140GB 空间,先看看自己磁盘
AirLLM 的价值不在快,在"可能性"——让没有顶级硬件的人也能亲手摸到顶级模型。就冲这一点,它值得一个 star。
项目地址:https://github.com/lyogavin/airllm