Liquid AI 发布 LFM2.5-2.6B:2.6B 参数在手机 CPU 上跑 Agent,单张 H100 一天吐 13 亿 Token
8 月 4 日下午,HuggingFace 官方账号转发了一条让端侧 AI 圈集体侧目的消息:“今天我们发布 LFM2.5-2.6B——一个完全在设备端运行的 Agent 模型。它能规划、能调用工具、能在手机、笔记本、PC 和机器人上完成多步任务,数据永不离开设备,每次运行的边际成本几乎为零。“发布方是 MIT 孵化的 Liquid AI。两天前它刚把模型权重挂上 HuggingFace(模型卡创建于 7 月 28 日),上线几天下载量已接近 5 万次、收获 137 个赞。这不是又一个"能跑的迷你模型”,而是一个把 Agent 工作流(规划、调工具、多步任务)整体塞进 2.6B 参数、并宣称在苹果 M5 Max 上达到每秒 220 Token 解码速度的开源模型——端侧 Agent 的"手机时刻”,可能真的来了。
背景:Liquid AI 是谁,为什么"端侧 Agent"是 2026 年的风口
Liquid AI 是 2024 年底从 MIT 孵化出来的明星创业公司,创始团队来自液态神经网络(Liquid Neural Networks)研究——CEO Ramin Hasani 和 MIT CSAIL 主任 Daniela Rus 是那套"用动态微分方程替代静态网络"理论的核心作者。公司先后完成数千万美元种子轮和 AMD 领投的数亿美元 A 轮融资,路线一直很"异类":不追参数规模,专攻架构效率。2025 年推出的 LFM2 系列(含 8B-A1B 等型号)用混合线性架构在长上下文和推理效率上打出了名号,而 LFM2.5 家族(230M、2.6B、8B-A1B)则把火力集中到了端侧部署。
“端侧 Agent"成为风口,背后是三条清晰的产业逻辑。第一是隐私:企业数据不能出设备,医疗、金融、办公场景尤其敏感;第二是成本:云端 Agent 每次调用都要付 Token 费,而本地推理的边际成本趋近于零——Liquid 官方博客的原话是:“当 Token 花费不再是约束,Agent 就可以全天候、大规模并行地跑在本地硬件上”;第三是延迟:本地推理没有网络往返,响应确定性远好于云端。同赛道里,Google 的 Gemma 4、阿里的 Qwen3.5-4B/9B、苹果的端侧基础模型都在抢这个身位,但绝大多数"小模型"只是"小号的聊天模型”,专门为 Agent 工作流(工具调用、多步规划)做强化训练并开源权重的,LFM2.5-2.6B 是第一批。
核心一:规格与架构——“短卷积 + 注意力"的混合路线
先看硬规格:LFM2.5-2.6B 是一个 2.6B 参数的稠密(dense)模型,上下文窗口 128K Token,预训练数据约 34 万亿 Token。为了更好支持非拉丁语系,Liquid 把词表就地翻倍到 128K(in-place tokenizer extension,而非从头重训)。与同门 8B-A1B 一样,它基于 LFM2 混合架构:30 层网络里,22 层是双门控短卷积块(double-gated short convolution blocks),8 层是分组查询注意力(GQA)——config.json 里的 layer_types 明确写着 conv/conv/full_attention 交替排布。
这里藏着架构上的关键原理:标准 Transformer 的注意力复杂度随序列长度平方增长,长上下文推理时 KV Cache 会吃掉大量显存和带宽。LFM2 用局部卷积层捕获短程依赖(类似 Mamba 系模型的"选择性状态空间"思路),只在少数层保留全局注意力,从而把长上下文的计算和显存需求大幅压低。这也是为什么一个 2.6B 的稠密模型敢给 128K 上下文——架构效率换来了"小身材、长记忆”。相比之下,同规模的稠密模型普遍只敢给 32K~64K,而 128K 上下文对 Agent 场景是刚需:工具调用轨迹、多轮规划记录、长文档处理,都需要"装得下"。

核心二:四阶段后训练——把"基础模型"炼成"Agent"
预训练只是起点。Liquid 官方博客披露了一条四阶段后训练管线,把 LFM2.5-2.6B-Base 炼成 Agent 专用模型,每一步都有明确的工程动机:
第一阶段:两轮 SFT。 先做全域覆盖的指令微调,再针对 Agent 技能(工具使用、网页搜索、软件工程、Agent 轨迹)做重点强化。两轮 SFT 的数据混合规模约为 8B-A1B 所用数据的 7 倍——小模型要补能力,全靠数据砸。
第二阶段:教师专业化(Teacher Specialization)。 从同一个 SFT 检查点出发,分别训练 6 个领域专家:指令跟随、数学、知识(含幻觉控制)、代码、工具使用、长上下文。每个专家用重加权数据做 SFT 后再用可验证奖励的强化学习(RLVR)单独打磨。分开训练的目的,是让每个专家在自己的领域里优化到极致,不受其他目标干扰。
第三阶段:MOPD(多领域在线策略蒸馏)。 这是整套管线里最有技术含量的一步。常规蒸馏(off-policy)是让学生模型学习别人生成的轨迹,而 MOPD 让学生模型在自己的策略下 rollout,再把 prompt 按领域路由给对应专家,由专家给出 Token 级的监督反馈。因为教师和学生从同一个 SFT 检查点出发,分布足够接近,密集的路由监督既能让小模型快速收敛,又不会训练失稳。
第四阶段:Agentic RL。 最后一步让模型在真实的 Agent harness 里做多轮强化学习——Liquid 直接把它放进 Hermes Agent、OpenClaw 等开源 Agent 框架的沙箱环境里,用 GRPO 优化,奖励函数由"LLM 裁判 rubric + 程序化检查 + 硬性安全闸门"三部分构成。训练时还专门设计了 Harness Proxy 把 Agent 框架当作黑盒,透明捕获 Token 级轨迹用于样本校验与回放(R3)。这意味着模型学到的不是"纸面上的工具调用格式",而是真实 Agent 环境里的交互模式——这是它工具调用成绩扎实的根本原因。

核心三:基准与速度——打四倍大的对手,CPU 上跑出 220 Token/秒
官方基准测试把 LFM2.5-2.6B 和最大 9.7B 的对手(gemma-4-E2B-it、gemma-4-E4B-it、Qwen3.5-4B、Qwen3.5-9B)放在一起比。结果很有意思:
| 基准 | LFM2.5-2.6B (2.6B) | gemma-4-E4B-it (8B) | Qwen3.5-4B (4.7B) | Qwen3.5-9B (9.7B) |
|---|---|---|---|---|
| AIME25(数学) | 51.87 | 34.27 | 49.33 | 56.07 |
| Multi-IF(指令跟随) | 80.07 | 77.35 | 55.67 | 62.55 |
| IFBench | 59.17 | 39.24 | 48.40 | 56.47 |
| BFCLv4(工具调用) | 56.88 | 46.39 | 50.56 | 60.13 |
| ToolSandbox | 77.83 | 65.00 | 75.55 | 76.44 |
| τ³-Bench Banking(Agent) | 5.67 | 4.12 | 5.45 | 5.15 |
| Claw-Eval(EN 平均) | 62.85 | 58.02 | 62.28 | 66.53 |
| BrowseComp+ (OpenClaw) | 26.89 | 15.90 | 24.46 | 27.23 |
结论清晰:指令跟随全胜、工具调用几乎全胜、Agent 任务与 Qwen3.5-9B 互有胜负且全面压过 Gemma 两个型号;数学略逊 Qwen3.5-9B;编码是唯一被大模型明显压制的短板(LiveCodeBenchv6 上 59.41 vs Qwen3.5-9B 的 69.86)。注意它的对手普遍比它大 2~4 倍——用 2.6B 打 9.7B 不落下风,靠的就是"为 Agent 任务专门训练"的专注度。
速度是它最亮眼的卖点。官方数据:M5 Max 上解码 220 Token/秒,AMD Ryzen AI Max+ 395 上 113 Token/秒,内存占用不到 2.5GB,手机上也能维持 30 Token/秒——够跑一个"即时响应"的 Agent。GPU 侧更夸张:单张 H100 在高并发下输出吞吐接近每秒 1.5 万 Token,一天能吐约 13 亿 Token。对端侧场景来说,CPU 数字才是关键:一个 2.6B 模型在笔记本 CPU 上跑出 200+ Token/秒,意味着本地 Agent 的体验已经接近云端。

核心四:上手指南——从 GGUF 到 OpenAI 兼容端点
Liquid 在生态支持上做得相当到位,发布当天就铺齐了 llama.cpp(GGUF 量化版)、MLX(Apple Silicon)、ONNX、vLLM、SGLang 和 transformers(≥5.0)六条路线,还给了 LM Studio 的接入文档。最省事的路径是 llama.cpp:
|
|
transformers 路线同样简单:AutoModelForCausalLM.from_pretrained("LiquidAI/LFM2.5-2.6B", device_map="auto", dtype="bfloat16") 即可加载,采样参数官方建议 temperature=0.1、top_k=50、repetition_penalty=1.1。接 Agent 框架更直接:把本地端点指给 Hermes Agent、OpenClaw 或 Pi 的模型配置即可,官方文档里有现成 guide。想先体验的话,HuggingFace 上有个 WebGPU 浏览器 Demo(Research Agent),打开网页就能看它在一个问题里完成检索、推理、总结的完整 Agent 流程。
深度分析:端侧 Agent 意味着什么,以及它的边界
把这颗"小钢炮"放进产业坐标,能看到三层意义。第一层,边际成本趋零会改变 Agent 的部署形态。 云端 Agent 的成本结构是"每次调用都要付钱",这限制了 Agent 的密度——企业不敢让几百个 Agent 同时跑。而端侧推理的边际成本趋近于零,Agent 可以像后台守护进程一样常驻、并行、全天候运行。Liquid 官方那句"大规模并行化、烧掉数百万 Token 而不增加一分钱成本"描述的不是噱头,而是一种新的软件形态:Agent 从"按次计费的服务"变成"装在设备里的能力"。第二层,架构路线之争有了新样本。LFM2 用"短卷积 + 稀疏注意力"的混合架构在端侧打出了效率优势,说明 Transformer 一统天下的局面正在被"按场景选架构"取代——这与 Mamba 系、RWKV 系、以及各家 MoE 小模型的探索互为印证。第三层,训练方法的工程价值被低估。MOPD(在线策略蒸馏)+ 在真实 Agent harness 里做 RL 的组合,很可能会成为小模型后训练的通用配方——“让模型在它将要运行的环境里学习”,这个朴素原则的执行细节(Harness Proxy、轨迹校验、R3 回放)值得所有做 Agent 的团队抄作业。
边界和争议也要说清楚。其一,编码是明确短板,官方自己都建议编码密集型任务用更大模型——它是"干活型"Agent(检索、办公、工具调用),不是"写代码型"Agent。其二,2.6B 的知识边界客观存在,复杂推理和长尾知识上无法与 30B+ 模型相比,官方定位就是"高频、高并发的边缘 Agent 工作负载"。其三,许可证有门槛:LFM Open License v1.0 基于 Apache 2.0,但含商用阈值——年收入低于 1000 万美元的实体可免费商用,超过阈值需向 Liquid 购买商业许可,且该许可并非 OSI 认证的开源许可,企业法务需要单独评估。其四,基准均为厂商自报,与 Qwen3.5、Gemma 的对比缺少第三方复测,社区口碑还需要时间验证。
落地:给你的行动清单
- 先跑 WebGPU Demo 验证效果:如果你的场景是"数据提取、RAG、工具调用、长上下文处理",花 10 分钟在浏览器里跑一遍官方 Demo,比看任何测评都直观。
- 用 GGUF + llama.cpp 做 PoC:Q4_K_M 量化版在 16GB 内存的 MacBook 上就能流畅运行,先验证 CPU 推理延迟能否满足你的产品交互要求。
- 把"本地优先、云端兜底"写进架构:简单高频任务走本地 LFM2.5-2.6B,复杂推理和编码走云端大模型,路由逻辑用 OpenAI 兼容端点统一封装,切换成本几乎为零。
- 评估许可证:如果公司年收入超 1000 万美元且有商用计划,先联系 Liquid 确认商业条款,别把合规风险留到上线后。
- 关注四阶段后训练配方:MOPD 和 Agentic RL 的工程细节(尤其 Harness Proxy 的轨迹捕获)对任何想训练垂直小模型的团队都有直接借鉴价值。
结尾
Liquid AI 用一颗 2.6B 的"小钢炮"给出了一个大胆的答案:Agent 不一定要住在云端数据中心,它可以住在你的口袋里。当推理成本趋近于零、数据不出设备、延迟以毫秒计,Agent 的形态就会从"网页里的聊天框"进化成"设备里的常驻能力"——这可能是继 ChatGPT 之后,AI 产品形态的又一次范式转移。架构上它证明混合线性模型不是学术玩具,训练上它展示了"在真实环境里学 Agent"的威力。搬砖程序员们,是时候把"端侧 Agent"列入你的技术雷达了:下一次面试官问起"你怎么看端侧 AI",你可以从 LFM2.5-2.6B 的 220 Token/秒讲起。