全球 Token 跌破 1 美元时,国产大模型反而把 API 涨价 3.6 倍:这场价格分裂,程序员该怎么站队?

同一周发生了两件看起来互相矛盾的事。

第一件:9 月 2 日,数据服务商 Silicon Data 的大模型 Token 支出指数首次跌破每百万 Token 1 美元,报 0.97 美元,较 5 月 2.05 美元的高点腰斩还多。指数编制方说得很直白——全球大模型推理均价正在通缩,OpenAI 都被逼得在 7 月底下调了两款 GPT-5.6 的价格。

第二件:几乎同一天,智谱宣布入驻天猫开店卖 Token,其 GLM Coding Plan 的 Pro 版月费从 149 元直接涨到 538 元,翻了 3.6 倍,还卖得动。紧接着 Kimi、MiniMax、阶跃星辰都传出入驻天猫的消息。

一个在降价,一个在涨价;一个在承压,一个在突围。这场"价格分裂"不是新闻拼盘,它其实是一面镜子,照出了大模型这门生意正在分化的底层逻辑——而作为天天调 API 的程序员,你正站在这场分裂的十字路口上。

为什么一边在通缩,一边在涨价?先看两股力量谁在发力

把两件事摆一起,很多人第一反应是"市场乱了"。其实恰恰相反,这是两套完全不同的经济逻辑在同时起作用,一点都不乱。

全球通缩这半边,是三记组合拳打出来的。

第一拳打在架构上。DeepSeek、月之暗面普遍用混合专家(MoE)架构,推理时只激活部分参数,一次调用的算力消耗从源头被压低。Kimi K3 有 2.8 万亿总参数,但每个 Token 只激活约 1040 亿参数——这是它能以相对低价提供"接近前沿"能力的技术底座。

第二拳打在定价机制上。今年 5 月,DeepSeek 把 V4-Pro 的缓存命中输入价永久降到每百万 Token 0.025 元,创下全球最低。缓存命中和未命中分开计价,等于给高频调用场景开了一扇折扣门。

第三拳最根本——开源。中国头部模型几乎全部开放权重,开发者可以免费私有化部署,API 定价的溢价空间被系统性压缩。当开源模型以接近零的边际成本供应市场时,闭源厂商敢不降吗?

高盛真正担心的不是价格本身,而是一组"剪刀差":8 月 OpenRouter 的 Token 使用量环比涨了 47%,用户的美元支出只涨了 7%。——AI 确实在被更多使用,可每个 Token 越来越不值钱。

国产涨价这半边,逻辑完全反过来:能力溢价。

智谱一季度把 GLM 的 API 价格累计上调约 83%,结果调用量不跌反增约 400%。月之暗面更激进,Kimi K3 的 API 定价几乎是国产天花板——输入 20 元、输出 100 元每百万 Token,是上一代 K2 的 5 倍,发布后直接挤爆算力,一度暂停新增订阅。

市场不是不接受贵,而是只愿意为"真变强了"付钱。中国模型公司正在证明一件事:低价能抢市场,但真正的前沿能力,也能卖出高端价。 当 Kimi K3 在编程和 Agent 能力上摸到全球新水平,它的价格就不再对标国产,而是对标 Claude 和 GPT——这么一比,20/100 反而显得便宜。

所以这场"价格分裂"的本质是:全球在比谁的 Token 生产成本更低(技术降本),中国头部在做能力溢价(价值升维)。 两条路没有谁对谁错,只是赛道不同。

说句扎心的:量价齐升,不代表卖 Token 的人都在赚钱

回到你天天看到的那句宣传——“量价齐升”。豆包大模型日均 Token 调用量突破 180 万亿,一年增长超 10 倍;摩根士丹利统计 2026 年二季度中国模型输出 API 均价涨到 21.9 元/百万 Token,同比涨超 60%。

量在涨,价也在涨,按常理所有卖 Token 的厂商都该赚钱。但爱分析用一张"五变量利润公式"戳破了这层窗户纸:

Token 利润 = 加权单价 × GPU 利用率 × Token 吞吐量 − GPU 月租 − 模型授权费

前面三个变量相乘是收入,后面两个是成本。把这五个变量往里一套,三类玩家的命运立刻分化:

  • 云大厂(阿里/火山):几乎五项全占——自研模型自主定价、无授权费、长期协议锁死 GPU 月租、专职推理优化团队。但最大的优势是GPU 利用率:对内对外同时供 Token,GPU 常年不闲着。阿里财报会上明确说 Token 业务毛利高,且随价格提升还会继续涨。
  • 模型厂商(智谱/月之暗面):优势只有定价权和抽成,GPU 利用率和服务器月租都不占优,毛利率被拉低一截,在盈亏平衡线附近挣扎。智谱的开放平台及 API 毛利率从去年的 -0.4% 艰难抬到 24.6%。
  • 独立厂商:五项里没有任何一项有定价权,全部暴露在市场价格下,结构性亏损几乎是必然。

云大厂最大的壁垒不是技术,是 GPU 永远不会闲下来。这是所有商业模式里最"润"的一种:无论需求怎么波动,算力都在出活。

这套公式对你的直接启示是:当你在选 API 供应商时,你不是在选"哪个模型最强",而是在选"哪家厂最不会因为撑不住而涨价或者跑路"。 云大厂敢长期锁价,独立厂可能某天就调价甚至关停。这直接影响你的成本稳定性。

程序员该怎么站队?算清三笔账,而不是看谁家新闻热闹

前面都是行业视角,下面落到你身上。当 API 在涨价、开源模型又强又贵时,你到底是继续用 API,还是扛一台机器自己部署?别凭感觉,算三笔账。

第一笔账:部署成本。 这是最容易被"开源免费"四个字忽悠的。Kimi K3 权重确实免费开放下载,但它的权重文件就有约 1.56TB。开发者社区测算,私有化部署 K3 的"验证档"最低要 8 张 B300,成本约 800 万人民币;官方建议的 64 卡超节点直接奔着 2000 万级去。腾讯混元 Hy3、MiniMax M3 这类旗舰,整机部署也在 160 万到 270 万之间。

结论很扎心:旗舰模型自部署不是"省钱",是"买矿机"。 对 99% 的个人和小团队,直接调官方 API 才是最划算的答案。

第二笔账:时延和稳定性。 自部署最爽的不是省钱,是延迟可控、数据不出内网、可以私有化定制。如果你做的是数据敏感的中后台(比如企业内部的知识库、代码审查),或者对首 Token 延迟有硬指标(比如客服机器人),自部署的价值远超省下的那点 API 费。反之,如果你只是调模型做内容生成、批量分析,API 的弹性扩容和 SLA 比自建强得多。

第三笔账:真实用量里的"缓存红利"。 这是大多数人忽略的省钱点。国产模型普遍把缓存命中和未命中分开计价,差价能到 10 倍甚至 40 倍。DeepSeek V4 缓存命中输入价低到每百万 Token 0.02 元,而 Kimi K3 缓存命中是 2 元、未命中是 20 元。

怎么做?把高频的系统提示词、few-shot 示例、长上下文前缀固定住,让它们稳定命中前缀缓存。对同一批 prompt 反复调用的场景(比如批量客服、批量审核、代码补全前缀),这个优化能把你的 API 账单砍掉一大半。

别被"每百万 Token 多少钱"吓到,也别被"开源免费"诱惑。真正的成本分水岭只有一个问题:你的调用里,有多少是稳定的、可缓存的高频前缀?

明天就能动手的三件事

说了这么多,落到你能立刻执行的动作上:

第一,打开你的代码,把高频的 system prompt 和长上下文前缀抽成常量,确认它们不走随机变化。 这是零成本、当天见效的省钱动作——只要你的调用里稳定前缀占比高,缓存命中价能帮你省下 60% 以上。

第二,给 API 调用加个"成本仪表盘"。 别等到月底账单吓一跳。用日志统计每个模型的调用量、Token 数、缓存命中率,按"单价 × 用量"排个序,你会立刻发现 90% 的钱花在哪几个调用上——这才是该优化的地方。

第三,给自己做一次"部署 or API"的决策清单: 数据是否必须出内网?首 Token 延迟是否硬指标?单月 Token 用量有没有到百万级?三个问题里只要有一个"是",认真考虑自部署(哪怕是小模型);三个全是"否",果断用 API 并把精力花在缓存优化上。

这场"价格分裂"不会很快结束——全球会继续卷成本,头部会继续赚溢价。但对程序员来说,它没那么玄乎:你要做的不是站队哪家公司,而是把每一笔 Token 花得明明白白。 模型天天变,账本是你自己的。

0%