<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>模型量化 on 搬砖程序员带你飞</title>
        <link>https://lpflpf.cn/tags/%E6%A8%A1%E5%9E%8B%E9%87%8F%E5%8C%96/</link>
        <description>Recent content in 模型量化 on 搬砖程序员带你飞</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-CN</language>
        <managingEditor>lipengfei634626165@163.com (lpflpf)</managingEditor>
        <webMaster>lipengfei634626165@163.com (lpflpf)</webMaster>
        <lastBuildDate>Sun, 27 Sep 2026 07:30:00 +0800</lastBuildDate><atom:link href="https://lpflpf.cn/tags/%E6%A8%A1%E5%9E%8B%E9%87%8F%E5%8C%96/index.xml" rel="self" type="application/rss+xml" /><item>
            <title>27B 装进 5.95GB 之后：你的本地 Agent 该换引擎，还是该换信仰</title>
            <link>https://lpflpf.cn/posts/ternary-bonsai2-quantization-2026-09-27/</link>
            <pubDate>Sun, 27 Sep 2026 07:30:00 +0800</pubDate><author>lipengfei634626165@163.com (lpflpf)</author>
            <guid>https://lpflpf.cn/posts/ternary-bonsai2-quantization-2026-09-27/</guid>
            <description>&lt;img src=&#34;https://cdn.lpflpf.cn/covers/ternary-bonsai2-5gb-plain.jpg&#34; alt=&#34;Featured image of post 27B 装进 5.95GB 之后：你的本地 Agent 该换引擎，还是该换信仰&#34; /&gt;&lt;p&gt;先别急着惊叹——Prism ML 把 Qwen3.8-27B 的权重压成了 {-1, 0, +1} 三个值，语言塔 &lt;strong&gt;5.95 GB&lt;/strong&gt;，官方报告保住 FP16 基线 &lt;strong&gt;98.2%&lt;/strong&gt; 的成绩。这意味着 24GB 显卡第一次能常驻一个 27B 级推理模型做本地 Agent。但这不是免费的：你必须交出 llama.cpp 生态位改用它的 fork，而掉的那 1.8%，恰好掉在最要命的地方。&lt;/p&gt;&#xA;&lt;h2 id=&#34;172-bitsweight-是怎么凑出来的&#34;&gt;1.72 bits/weight 是怎么凑出来的&#xA;&lt;/h2&gt;&lt;p&gt;先说清楚这不是&amp;quot;又一个 K-means 换皮的 PTQ&amp;quot;。&lt;/p&gt;&#xA;&lt;p&gt;常规 2-bit 量化的思路是把权重挤进 4 个格子（2^2=4）。三值量化走得更狠：每个权重只剩 -1、0、+1 三个状态，信息论下限是 log₂3 ≈ &lt;strong&gt;1.585 bit&lt;/strong&gt;。听起来比 2-bit 还少，但裸三值没法用——所以每 &lt;strong&gt;128 个权重共享一个 FP16 scale&lt;/strong&gt; 做反量化缩放，摊下来实测 &lt;strong&gt;1.72 bits/weight&lt;/strong&gt;。27B 参数乘一遍，就是那个 5.95 GB（PQ2_0 打包为 7.21 GB，对照 FP16 约 54 GB）。&lt;/p&gt;&#xA;&lt;p&gt;真正让它区别于普通低比特量化的是 &lt;strong&gt;Hadamard 旋转基&lt;/strong&gt;：量化前先把权重矩阵旋转到误差更均匀的坐标系里，三值的表达力被重新分配。这个设计带来一个工程上很硬的约束——运行时要么精确匹配旋转流程，要么直接拒载。官方模型卡 Quickstart 里写得很明白：&lt;strong&gt;stock llama.cpp 会拒绝加载 PQ2_0/PTQ1_0，更危险的是它可能把文件当成 Q2_0 静默加载，然后输出乱码&lt;/strong&gt;。不报错、不警告、结果全错，这是所有做推理服务的人最怕的事故形态。从这个角度看，&amp;ldquo;强制绑 fork&amp;quot;反而是种诚实：它宁可让你装不上，也不让你悄悄跑错。&lt;/p&gt;&#xA;&lt;p&gt;代价也在这里：你用的不再是社区主干的 llama.cpp，而是 PrismML 维护的分叉（依赖 github.com/PrismML-Eng/llama.cpp）。这个后面算总账。&lt;/p&gt;&#xA;&lt;h2 id=&#34;982-的另一面它卖掉了哪-18&#34;&gt;98.2% 的另一面：它卖掉了哪 1.8%&#xA;&lt;/h2&gt;&#xA;    &lt;blockquote&gt;&#xA;        &lt;p&gt;均分只掉了 1.54 分，但分数不是均匀掉的——这恰恰是使用说明书。&lt;/p&gt;&#xA;&#xA;    &lt;/blockquote&gt;&#xA;&lt;p&gt;模型卡给了 14 项 thinking-mode 基准的对照，把它按能力类别拆开看：&lt;/p&gt;&#xA;&lt;table&gt;&#xA;&#x9;&lt;thead&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;能力&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;Bonsai 2&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;FP16 基线&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;th&gt;结论&lt;/th&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&lt;/thead&gt;&#xA;&#x9;&lt;tbody&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;数学&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;96.57&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;—&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;基本无感&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;编码&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;89.42&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;略低于它&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;&lt;strong&gt;反超基线&lt;/strong&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;指令跟随&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;略超&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;—&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;工具调用安全&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;知识推理&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;79.86&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;85.55&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;&lt;strong&gt;掉 5.7 分&lt;/strong&gt;&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&#x9;&#x9;&lt;tr&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;视觉&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;66.19&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;71.36&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&#x9;&#x9;&lt;td&gt;掉 5.2 分&lt;/td&gt;&#xA;&#x9;&#x9;&#x9;&lt;/tr&gt;&#xA;&#x9;&lt;/tbody&gt;&#xA;&lt;/table&gt;&#xA;&lt;p&gt;编码和数学是被保住的资产，知识记忆是被卖掉的部分。这符合三值量化的直觉：数学和代码是&lt;strong&gt;过程性能力&lt;/strong&gt;，靠的是推理链结构；事实问答是&lt;strong&gt;存储性能力&lt;/strong&gt;，靠的是权重里记住的具体参数——1.585 bit 的格子最先挤丢的就是后者。&lt;/p&gt;&#xA;&lt;p&gt;更有警示意义的是对照组。模型卡同页列了常规 IQ2_XXS&amp;quot;2-bit&amp;quot;量化：均分只有 &lt;strong&gt;72.59&lt;/strong&gt;，而且塌得极不均匀——MMLU 这类知识题还能拿 88.9，一到 AIME26 数学竞赛直接崩到 &lt;strong&gt;57.5&lt;/strong&gt;。也就是说，如果你随手拿一个常识问答测测 2-bit 模型，它会&amp;quot;看起来没问题&amp;rdquo;；等你把它接进数学或代码链路，才发现地基是空的。这种&lt;strong&gt;选择性塌陷&lt;/strong&gt;解释了为什么很多团队对低比特量化有信任危机：不是量化不行，是单点测试根本测不出来。&lt;/p&gt;&#xA;&lt;p&gt;由此得到一张迁移判断表——哪些云端流量值得搬回这台 5.95 GB 的本地模型：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;适合迁本地&lt;/strong&gt;：代码补全与 review、数学/逻辑推演、结构化指令跟随（工具调用编排）、对延迟敏感的高频小任务。&#xA;&lt;strong&gt;别迁&lt;/strong&gt;：企业知识库问答、事实型客服（幻觉风险放大 5.7 分的知识缺口）、多模态业务（视觉塔本身另计 ~0.63 GB 且掉分最狠）、需要超长上下文的场景——OpenRouter 上架版本 context 只有 &lt;strong&gt;262K&lt;/strong&gt;，远小于 Qwen3.8-27B 托管版的 1M。&lt;/p&gt;&#xA;&lt;p&gt;注意边界：这套基准是 PrismML 自测（EvalScope + vLLM/H100），第三方复现还需要时间沉淀。上线前用自己的任务集重测，没有商量余地。&lt;/p&gt;&#xA;&lt;p&gt;&lt;img alt=&#34;Bonsai 2 与常规量化在体积-质量平面上的位置：5.95GB 拿到 84.78 分&#34; loading=&#34;lazy&#34; sizes=&#34;(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px&#34; src=&#34;https://cdn.lpflpf.cn/images/posts/2026-09-27-bonsai2-density.png&#34;&gt;&#xA;&lt;/p&gt;&#xA;&lt;p&gt;这张散点图是全文主张的核心：横轴体积、纵轴 14 项均分，数据全部取自官方模型卡。Bonsai 2 落在一个此前不存在的区域——&lt;strong&gt;比 IQ2_XXS 还小 18%，却高出 12.19 分&lt;/strong&gt;；距离体积近三倍的 UD-Q4_K_XL（17.56 GB）只差 0.4 分。&amp;ldquo;更小且更好&amp;quot;在量化史上第一次同时成立，这才是它上 Hugging Face Trending 的原因。&lt;/p&gt;&#xA;&lt;h2 id=&#34;你的卡该拉哪个包ptq1_0-还是-pq2_0&#34;&gt;你的卡该拉哪个包：PTQ1_0 还是 PQ2_0&#xA;&lt;/h2&gt;&lt;p&gt;同一个模型给两种 GGUF 打包，选错等于白亏一截吞吐。模型卡的 Cross-Platform Throughput 表（batch size 1、无视觉塔）给出了明确分工：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;strong&gt;H100 / A100 / Blackwell（HBM 大卡）&lt;/strong&gt;：选 &lt;strong&gt;PQ2_0&lt;/strong&gt;。解码更快，且 prefill 在所有平台上都是 PQ2_0 占优——长上下文 Agent 首 token 延迟敏感的场合无脑选它。RTX 5090 上跑到 &lt;strong&gt;129.9 tok/s&lt;/strong&gt;。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;Ada 代卡 / L4 / 内存紧张的机器&lt;/strong&gt;：选 &lt;strong&gt;PTQ1_0&lt;/strong&gt;（5.95 GB 那个）。在这批卡上解码反而反超 PQ2_0，RTX 4090 达 &lt;strong&gt;91.1 tok/s&lt;/strong&gt;。&lt;/li&gt;&#xA;&lt;li&gt;&lt;strong&gt;笔记本&lt;/strong&gt;：官方给的参照是 M5 Pro 上 PTQ1_0 跑出 &lt;strong&gt;28.1 tok/s @ 34.1W&lt;/strong&gt;（整机 CPU+GPU 口径，背景负载可致约 4% 波动，Apple 平台缺少独立的 DRAM 轨电能测量）。日常 Agent 对话够用，代码补全的体感也已经过了&amp;quot;等得起&amp;quot;的门槛。&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;&lt;img alt=&#34;PTQ1_0 与 PQ2_0 按 GPU 型号的选用决策图&#34; loading=&#34;lazy&#34; sizes=&#34;(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px&#34; src=&#34;https://cdn.lpflpf.cn/images/posts/2026-09-27-bonsai2-packing-choice.svg&#34;&gt;&#xA;&lt;/p&gt;&#xA;&lt;p&gt;一条可以直接抄的启动命令（从 PrismML fork 的 release 页下载对应平台的二进制后）：&lt;/p&gt;&#xA;&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;&#xA;&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;2&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;3&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;4&#xA;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&#xA;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-bash&#34; data-lang=&#34;bash&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;llama-cli -m Ternary-Bonsai-2-27B-PQ2_0.gguf &lt;span class=&#34;se&#34;&gt;\&#xA;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;  -ngl &lt;span class=&#34;m&#34;&gt;99&lt;/span&gt; -fa on -c &lt;span class=&#34;m&#34;&gt;32768&lt;/span&gt; &lt;span class=&#34;se&#34;&gt;\&#xA;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;  --temp 1.0 --top-p 0.95 --top-k &lt;span class=&#34;m&#34;&gt;20&lt;/span&gt; --min_p 0.05 &lt;span class=&#34;se&#34;&gt;\&#xA;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;  -n &lt;span class=&#34;m&#34;&gt;16384&lt;/span&gt;&#xA;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;&#xA;&lt;/div&gt;&#xA;&lt;/div&gt;&lt;p&gt;两个参数有讲究：&lt;code&gt;-n 16384&lt;/code&gt; 是给 xhigh 思考链留的输出空间——这是个 reasoning 模型，采样上限给 256 token 会把思考过程拦腰截断，答案直接废掉；&lt;code&gt;-c 32768&lt;/code&gt; 则是因为&lt;strong&gt;老脚本里的 &lt;code&gt;-c 0&lt;/code&gt;（自动占满）会按 262K 全量分配 KV cache，直接把内存打爆&lt;/strong&gt;，这个坑在官方 demo 仓库 README 里有明确记载。顺带一提，这模型不支持 low reasoning effort，配置里选了也近似 xhigh，token 成本要按最长思考链预算。&lt;/p&gt;&#xA;&lt;h2 id=&#34;真正的账单fork-锁定-vs-0075m&#34;&gt;真正的账单：fork 锁定 vs $0.075/M&#xA;&lt;/h2&gt;&lt;p&gt;把话题从玩具评测拉回生产决策，桌上其实有两笔账。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第一笔：供应链赌注。&lt;/strong&gt; 跑这个模型的前提是 PrismML 的 llama.cpp fork 持续跟进上游。评估它而不是喊&amp;quot;注意风险&amp;quot;的方法有三个：看配套仓库 Bonsai-demo 的活跃度（自称 source of truth，&lt;strong&gt;3.1k star、50 贡献者、最近一次提交 2026-09-24&lt;/strong&gt;——发布三天内仍在动）；看社区是否收录了你的硬件组合实测；以及最实际的一条——&lt;strong&gt;pin 住一个 known-good 版本的二进制&lt;/strong&gt;，别让 CI 每天拉 latest，fork 项目的破坏性变更不会给你 deprecation 期。&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;第二笔：混合部署的分界线。&lt;/strong&gt; OpenRouter 已上架 &lt;code&gt;prism-ml/ternary-bonsai-2-27b&lt;/code&gt;，输入 &lt;strong&gt;$0.075/M&lt;/strong&gt;、输出 $0.50/M（访问日期 2026-09-27，下单前以实时页为准）；同门 Qwen3.8-27B 托管版是 $0.10/$1.80。输出价砍到不到三分之一，意味着&amp;quot;迁回本地&amp;quot;这件事本身也有了比价基准：本地机器的真实成本 = 电 + 折旧 + 运维，折算到每百万 token 再和 $0.50 比。高频、短输出、隐私敏感的流量走本地；知识密集、超长上下文、多模态的长尾留在云端——反正那三类本来也不该迁。&lt;/p&gt;&#xA;&lt;p&gt;这篇的结论浓缩成一句话：&lt;strong&gt;三值量化第一次让&amp;quot;本地跑旗舰&amp;quot;在经济和工程上同时成立，但它成立的边界（fork 锁定、知识塌陷、262K context）和它的卖点一样清晰&lt;/strong&gt;。选型的人现在该做的不是惊叹，而是拿自己的任务集去测那 5.7 分的知识缺口会不会砸到你的业务上。&lt;/p&gt;&#xA;&lt;p&gt;如果你的机器是 24GB 显存或 16GB 内存的笔记本，花二十分钟从 fork 的 release 页拉一个 known-good 二进制，按上面的速查表选打包格式，跑一轮自己的 eval——重点只看两类题：事实问答和数学。这两类的得分差，就是你这家公司的&amp;quot;能不能迁&amp;quot;判决书。&lt;/p&gt;&#xA;</description>
        </item></channel>
</rss>
