AirLLM:4GB 显卡就能跑 70B 大模型,穷人也配玩本地 AI

featuredImage: https://cdn.lpflpf.cn/covers/free-2026-08-10.png

跑一个 700 亿参数的大模型,得用什么显卡?

搁两年前,标准答案是 A100/H100——一张几十万,普通人连想都不用想。所以"本地跑大模型"一直被当成富哥专属。

AirLLM 这个项目就是来打破这句话的:它让 70B 的模型跑在单张 4GB 显卡上,不用量化、不用蒸馏,硬跑。2024 年它火过一轮,这周又杀回 GitHub 趋势榜(一周 +5.7k star),因为 7 月它干了一件更离谱的事:把 2.8 万亿参数的 Kimi K3 塞进了 3.72GB 显存。

穷玩 AI,是真的可以玩了。

原理就一句话:GPU 里永远只放一层

大模型是几十层堆起来的,传统推理得把整个模型塞进显存,70B 光权重就要 140GB。AirLLM 换个思路:用哪层,就从磁盘加载哪层,算完立刻换下一层。

显存需求从"整个模型"降到了"单层"。70B 的模型单层权重大约 4GB,正好是普通消费卡的水平。代价就是慢——每层都要读盘,推理速度跟 A100 没法比。但你要的是"在自己电脑上跑通",不是"跑得快",那它完全够用。

打个比方:别人雇一个团队驻场干活,你请一个人轮流干所有岗位。一个人慢,但一个人便宜。

现在能跑啥

看项目更新日志就挺有意思:

  • 2026/07:Kimi K3(2.8T 参数)单卡 3.72GB 跑通——目前最大的开源模型
  • 2026/06:v3.0 支持 FP8,DeepSeek-V3(671B)约 12GB,Qwen3-235B 约 3GB
  • 2024/04:Llama3 70B on 4GB
  • 2023/12:MacOS 也能跑 70B

注意最后两个数字:DeepSeek-V3 只要 12GB,一张 3090 就能带;Qwen3-235B 只要 3GB,核显都敢想。这放在 2024 年,是想都不敢想的事。

上手其实很简单

1
pip install airllm
1
2
3
from airllm import AutoModel

model = AutoModel.from_pretrained("garage-bAInd/Platypus2-70B-instruct")

用法跟 transformers 差不多。第一次运行会把模型按层拆开存到本地磁盘——注意留够硬盘,70B 全精度要 140GB 左右。

几个有用的参数:

  1. layer_shards_saving_path:自定义拆分后的存储路径
  2. FP8 模式:显存再砍一半(DeepSeek-V3 从 24GB 降到 12GB 就是这么来的)
  3. MacOS 有专门支持,官方文档里写了

官方在 Kaggle 上放了一个完整示例(Platypus2-70B + 维基百科 RAG),跟着跑一遍,就能亲眼看到 4GB 显卡跑 70B。

实际跑一遍是什么体验

光看 README 没感觉,说下真正上手会经历的流程。

第一步是准备环境。一张 4GB 显存的显卡(GTX 1650 这种级别就行),外加至少 150GB 空闲磁盘——注意,是磁盘不是内存。很多人在这步卡住:模型下载 + 拆分,70B 全精度要占一百多 GB 硬盘,拆完之前跑不起来。

第二步是首次运行。AirLLM 加载模型时会先把权重按层拆分保存到本地,这个过程是纯磁盘操作,会等一阵子。拆分完成后,真正的推理才开始:你问它一个问题,它逐层从磁盘读权重、计算、再换下一层,GPU 占用始终不高,但你能明显感觉到它在"一卡一顿"地出结果。

第三步才是真正有意思的地方。等你看到那句完整的话被一个 70B 模型(而不是 7B 小模型)一个字一个字吐出来,而且它完全跑在你自己的电脑上、数据没出过机器——那种"这玩意儿我也有"的踏实感,是调 API 给不了的。

如果你想少走弯路,可以直接用官方的 Kaggle 示例:它跑在 Kaggle 的免费 GPU 上(不需要自己的显卡),环境都配好了,跟着 Notebook 一步步跑,Platypus2-70B + 维基百科检索问答,一次就能跑通。

一个提醒:别拿它当日常对话用。等一轮回答的时间够你泡杯茶,这是逐层加载的代价。但你要是想搞私有部署、做离线实验、或者单纯想看看 70B 和 7B 的回答质量差距到底有多大——它值得你折腾一晚上。

说点大实话

这工具不是万能药,优缺点都明显。

适合的人:

  1. 学生、个人开发者:手里就一张消费卡,想跑大模型做实验、搞私有部署
  2. 隐私敏感的场景:数据不想出本机,本地推理是唯一选择
  3. 想摸一摸超大模型但没预算的人:Kimi K3 这种 2.8T 的怪物都能跑,慢是慢点,能跑

不适合的人:

  1. 生产环境:每层都读盘,速度是硬伤,线上推理老老实实用 A100 或 API
  2. 高频交互:推理一次等半天,急死人
  3. 硬盘不够的人:70B 拆分后要 140GB 空间,先看看自己磁盘

AirLLM 的价值不在快,在"可能性"——让没有顶级硬件的人也能亲手摸到顶级模型。就冲这一点,它值得一个 star。

项目地址:https://github.com/lyogavin/airllm

0%