中国大模型周调用量连续 14 周全球第一,前五全是国产:一场由 Kimi K3 引爆的定价权战争
8 月 4 日晚,OpenRouter 最新一周(7 月 27 日至 8 月 2 日)的模型调用量数据在中文科技圈刷屏:全球 AI 大模型调用量前五名,第一次全部是中国产品。DeepSeek-V4-Flash 以单周 7.22 万亿 Token 登顶,小米 MiMo-V2.5、腾讯 Hy3、DeepSeek-V4-Pro、智谱 GLM-5.2 依次排开——而大洋彼岸,OpenAI 的 GPT-5.6 Luna 靠着一纸"降价 80%“的公告,才首次挤进榜单第八。同一天,时代财经发布的长文把这场竞争概括成一个词:定价权。当中国厂商第一次在 AI 市场从"跟随者"变成"定价者”,硅谷连夜降价的姿态,比任何跑分都更能说明问题。
这组数据不是孤例,而是一个持续了 14 周的稳态。2025 年 3 月,全球前十大模型周调用量合计只有 1.24 万亿 Token,美国模型占据近七成份额;2026 年 2 月中旬这一数字飙到 13.95 万亿,中国调用量首次反超美国;到了 6 月第一周,中国大模型周调用量已达 14.19 万亿 Token,连续六周超越美国(IT之家援引每日经济新闻测算);7 月第一周,前六名已经全部是中国模型,DeepSeek-V4-Flash 连续七周位居榜首。再到本周(8 月 2 日当周),中国 AI 大模型的周调用量是 28.13 万亿 Token,美国的数字是 4.38 万亿——约 6.4 倍的差距。14 周,恰好覆盖了 DeepSeek-V4 系列发布、Kimi K3 问世、Anthropic 与 OpenAI 相继降价的全过程。这已经不是某个单点的胜利,而是整个中国开源模型生态的系统性突破——更重要的是,它的驱动机制正在从"技术追赶"切换为"商业定价"。
数据拆解:56.8 万亿 Token 的一周,发生了什么
先看总量。据《每日经济新闻》根据 OpenRouter 数据测算,上周全球 AI 大模型总调用量为 56.8 万亿 Token,环比小幅下滑 2.07%——大盘在高位震荡,但结构在剧烈变化。中国 AI 大模型周调用量 28.13 万亿 Token,环比下滑 14.76%;同期美国大模型 4.38 万亿 Token,环比暴增 87.18%。
榜单细节更有意思。第一名 DeepSeek-V4-Flash,7.22 万亿 Token,环比增长 13%,连续多周蝉联榜首;第二名小米 MiMo-V2.5,6.3 万亿 Token,环比下滑 40%;第三名腾讯 Hy3,4.82 万亿 Token,环比增长 22%;第四名 DeepSeek-V4-Pro,3.28 万亿 Token;第五名智谱 GLM-5.2,2.89 万亿 Token。前五名清一色中国开源模型,其中四个来自"开源即免费可用"的路线。 唯一上榜的美国新面孔是 GPT-5.6 Luna——OpenAI 在 7 月 30 日宣布对 GPT-5.6 系列降价 20%~80%,其中 Luna 从每百万 Token 输入 1 美元/输出 6 美元直接砍到 0.2 美元/1.2 美元,降价 80% 后,它的周调用量环比暴增 456%,冲到第八。
这意味着什么?美国模型的调用量单周 +87%,恰恰证明"降价"是有效的——价格弹性在开发者市场极其敏感。但反过来说,这也暴露了闭源阵营的尴尬:需要靠打八折甚至两折才能抢回份额,而对手的价格本来就只有自己的几十分之一。
Kimi K3 的"降维打击":1679 分登顶与三毛钱的缓存命中
这场价格战的导火索,是 7 月 16 日发布的 Kimi K3。在国际权威评测平台 Arena.ai 的 Frontend Code Arena 榜单上,K3 以 1679 分登顶,成为首个拿下该榜首的中国大模型——7 个前端领域拿下 6 个第一,仅游戏领域次于 Claude Fable 5。这个榜单用的是匿名真人开发者盲测、模拟真实项目开发,含金量与学术跑分完全两码事。连马斯克都公开点赞。

技术参数上,K3 总参数 2.8 万亿,采用 MoE 稀疏架构(896 个专家每次激活 16 个),上下文窗口 100 万 Token,自研 KDA 混合线性注意力让扩展效率比上一代提升约 2.5 倍,7 月 27 日权重全量开源。真正让硅谷睡不着觉的是它的定价:API 输出每百万 Token 100 元人民币、标准输入 20 元、缓存命中仅 2 元(约合 3 美元/15 美元/0.3 美元),仅为美国同类旗舰的几分之一。央视财经援引美联社的评价是:中国模型已与 OpenAI 前沿模型"几乎同样智能",成本却低得多。

连锁反应:从 Opus 5 腰斩到美股蒸发 4700 亿美元
K3 开源后的十天,是近两年 AI 行业最密集的降价窗口:
- 7 月 24 日,Anthropic 紧急发布 Claude Opus 5,每百万 Token 输入 5 美元、输出 25 美元,价格直接砍到此前评测第一的 Fable 5 的一半,并强调"降价未牺牲智能水平";
- 7 月 30 日,OpenAI 公布 GPT-5.6 系列降价 20%~80%,Luna 上线不到三周即打两折,还上线了速度可达标准处理 2.5 倍的 Fast mode(价格为 2 倍);
- 资本市场同步震荡:K3 发布后,7 月下半旬美股 AI 板块总市值蒸发约 4700 亿美元(折合人民币 3.2 万亿元),17 家投行连夜下调 AI 芯片企业目标估值;高盛合伙人发研报警示——若中国高性能低成本开源模型保持当前迭代节奏,美国 AI 企业长期高额资本投入将难以为继,全球算力无序扩张周期或将迎来拐点;
- 国内格局同样被改写:港股两家独立大模型上市公司中,智谱 AI(02513.HK)在 K3 发布后两个交易日最大回撤约 42.47%,市值蒸发超 2000 亿港元;摩根大通将其目标价从 2400 港元下调至 1600 港元,预期市盈率从 30 倍下调至 20 倍。
定价权背后的成本结构:这不是补贴战,是成本战
为什么中国厂商敢把价格打到这个位置?答案不在"亏本抢市场",而在成本结构。时代财经采访的风险投资人拆解了两层逻辑:算力侧,国内依托"东数西算"工程与绿电直供大幅压降电力开支,叠加国产芯片适配与云厂商长期包年折扣,摆脱了海外高价按需租赁算力的模式;工程侧,混合专家架构(MoE)、KV Cache 缓存压缩、动态批处理等技术把 GPU 利用率推到 70% 以上,“让每一次计算都物尽其用”。
第三方数据印证了这种结构性优势。Artificial Analysis 的估算显示,完成一项基准测试任务的平均成本:DeepSeek-V4-Flash 约 0.03 美元,Kimi K3 约 0.86 美元,GPT-5.6 Sol 约 1.86 美元,Claude Fable 5 约 3.15 美元——最大差距超过 100 倍。DeepSeek 的缓存命中单价低至每百万 Token 0.0028 美元(约 2 分钱人民币),是标准输入价的 1/50。OpenRouter 的数据分析师 Justin Summerville 预估,开源中国模型性能接近顶尖水平,成本却比 Anthropic 和 OpenAI 的模型便宜 60% 到 90%。
值得注意的是,价格战并没有消灭"性能溢价"。智谱 GLM-5 系列 2026 年上半年累计提价 83%,调用量反而暴涨 400%——在长程 Agent、复杂系统工程场景里,用户愿意为能力付费。这印证了竞争正在分层:极致性价比(DeepSeek)与极致能力(GLM、K3)各占一头,中间地带被快速压缩。
深度分析:从技术竞赛到定价权与生态的全面博弈
把时间线拉长看,这一轮变化的本质是竞争维度切换。2024—2025 年中美 AI 竞争的主线是"技术竞赛":谁的基准分高、谁的参数大。而 2026 年夏天的竞争主线变成了"定价权与生态":模型定价不再单纯由技术领先度决定,性价比、Agent 适配能力、工具协同兼容性、配套生态完善度成为选型核心标准。大模型正在褪去"高端技术奢侈品"属性,变成数字产业的基础设施。
背后有三个判断值得展开。第一,调用量是开发者用脚投票的真实需求,比任何榜单都诚实——28.13 万亿对 4.38 万亿的周调用量,意味着全球开发者已经用生产流量确认了中国开源模型的可用性。第二,降价是成本结构的战争,不是补贴战。中国厂商的优势来自算力获取、电力成本、工程优化三者的叠加,是结构性红利而非短期烧钱,这也是它"可持续"的底气。第三,开源权重给 API 定价装上了"地板价"——K3、V4-Flash 权重完全开放,开发者随时可以自托管绕过 API 计费,这倒逼所有闭源 API 把价格向"自托管成本 + 合理服务费"靠拢,海外模型的高溢价壁垒由此被彻底击穿。
反面观点同样存在。其一,美国单周 +87% 的反弹说明价格弹性巨大,闭源巨头靠降价仍有反扑能力,且 Luna 这类"廉价版"可能成为新的增长引擎;其二,价格战压缩利润空间,可能影响下一代模型的研发投入节奏;其三,政治风险高悬——7 月 22 日白宫科技政策办公室主任迈克尔·克拉齐奥斯公开指控月之暗面"蒸馏"了 Anthropic 的技术,美国财长贝森特甚至威胁动用制裁与"实体清单",若落地将直接冲击供应链与许可体系。不过英伟达 CEO 黄仁勋公开反对禁令,直言"中国大模型非常优秀,不应禁止"。这轮博弈的终局,远不止于价格。
需求端的迁移也在同步发生,这是比榜单更硬的证据。爱彼迎 CEO 布莱恩·切斯基公开表示公司"十分依赖"阿里巴巴的通义千问模型,称赞它"快速且便宜";广告巨头 WPP 的 CEO 辛迪·罗斯透露,公司拥有的 Agent 数量已多于员工,大量 Token 开支根本没有纳入原有预算;Uber 的 CTO 则坦言,公司四个月就烧光了全年的 AI 预算。当"算力账单"成为企业 CFO 的年度议题,模型的性价比就从技术参数变成了财务报表上的数字——这正是中国开源模型的机会窗口:性能差距缩小到 3 个月以内,价格差距却拉开到 60%~90%,企业没有理由不换。
国内市场的连锁反应同样值得记录。K3 的发布打破了"四小龙"的平衡格局:智谱与 MiniMax 股价剧烈波动的同时,里昂证券却重申对智谱 AI"跑赢大市"评级,认为"K3 加速了全球 API 价格发现,对 GPT-5.6 Sol/Fable 5 的定价压力大于对国内同业"——也就是说,这轮价格战最先受伤的是海外高溢价闭源模型,而不是同样卷的中国同行。摩根大通也判断,行业算力供给受限,市场并非零和竞争,智谱 GLM 系列仍处头部梯队。把这两家机构的判断合起来看:价格战不是内耗,而是对外收割定价权。
落地:给开发者的三点启示
- 选型进入"比价时代":用 OpenRouter 等聚合平台对比各模型的输入/输出/缓存三档价格,把"单任务成本"(而非单 Token 价格)作为评估指标,因为 Agent 场景的 token 消耗结构差异巨大。
- 把缓存定价写进架构:DeepSeek 缓存命中比标准输入便宜 50 倍,Kimi 便宜 10 倍——固定系统提示词、稳定 prompt 前缀、把变长内容后置,都是让缓存命中率翻倍的工程手段。
- 开源权重 = 议价权:K3、V4-Flash 都可自托管,重大业务线做一次 TCO 测算(自托管 vs API),你手里就永远有谈判筹码。
结尾
上一次中国产业在全球拿到"定价权",是光伏和动力电池;这一次,轮到了大模型。价格战只是表象,底下是工程师红利与制造红利的 AI 复刻——同样的技术、十分之一的价格、完整的开源生态。14 周领跑不会是终点,因为当"便宜"成为基础设施的默认属性,真正的创新才会在应用层爆发。对搬砖程序员来说,这大概是入行以来最好的时代:模型的账单在变薄,而能做的事在变多。