「牛来」真身是智谱 GLM-5.3-Flash:代码平了 Opus 4.8,价格只要 1/40,还跑在 10 万张国产卡上

一个匿名模型,名字叫「牛来」,在 OpenRouter 上挂了一周,流量冲到全球第二,把 DeepSeek 霸了 56 天的榜给终结了

海外开发者用得不亦乐乎,各种猜它到底是谁家的。tokenizer 指纹、视频特征、“trained by Z.ai"残留信息——三条线索全指向智谱。8 月 26 日晚,智谱掀牌:「牛来」就是 GLM-5.3-Flash,已开源。

320B 参数只激活 18B,代码和 Opus 4.8 打平

掀牌之后,大家才发现这周一直在用什么东西。GLM-5.3-Flash 是 GLM-5 系列第一个原生多模态模型,总参数 320B,可推理时每个 token 只激活 18B——典型的 Flash 思路,参数到位、推理瘦身。

数字开始往下砸:

  • Z.ai CodeBench 最高档 29.0 分,Claude Opus 4.8 是 29.5,差不到 1 分,写代码基本一个水平
  • Artificial Analysis 综合 57 分,跟 Opus 4.8 打平,压过自家上一代旗舰 GLM-5.2(53)和 DeepSeek V4 Pro(53)
  • 上下文 100 万 token,输出上限 128K

支撑这一切的是线性+稀疏注意力混合架构,官方说注意力计算量比 GLM-5.3 降 3 倍、KV Cache 降 4.4 倍——Flash 价格撑得起 1M 上下文,靠的是这个。

真正让圈里炸锅的:10 万张国产卡

模型本身强是一回事,真正让圈里炸锅的是另一个细节——智谱确认:匿名测试期间的全部推理流量,由国产芯片承载,规模超 10 万张。

半导体研究机构 SemiAnalysis 直接在 X 上评论:“所有流量均由国产芯片承载,硬件效率和单 token 成本已可与英伟达 GPU 相媲美。继 OpenAI 自研推理芯片之后,CUDA 护城河再度受到考验。”

智谱在技术文档里写了这套国产卡集群怎么跑起来的:在 SGLang 基础上自建推理引擎,W8A8 量化、混合缓存量化、节点内张量并行,再加生产级 EPD(Encode-Prefill-Decode)分离式架构——把多模态编码、prompt 预填充、逐 token 解码拆成可独立调度的工作池。和同硬件初始基线比,端到端性能提升了 3 倍。

供应商据晚点 LatePost 了解,或来自华为、摩尔线程与海光,智谱没确认具体型号。型号其实不重要,重要的是:一个中国公司的模型,用中国芯片,承载了每日 100 万亿 token 级别的流量,还说成本追平英伟达。这话放一年前没人信。

给开发者算笔实在账

对开发者来说,最实在的还是价格。拿个实际任务算:写一篇 1800 字技术长文,全流程约消耗 50 万 token(输出占两成)。

Claude Opus 4.8 大概 66 元,GLM-5.3-Flash 只要 1.6 元——66 对 1.6,够买瓶可乐。

这是按国内促销价(输入 0.4 元、输出 1.4 元/百万 token,促销两周,9 月 9 日截止;之后恢复输入 0.8、输出 2.8)。国际站标准价输入 $0.15、输出 $0.50/百万 token,MIT 协议全开源,商用无附加条件。横向比国产同行也便宜:调价后的 DeepSeek V4-Flash 谷时输入 1.5、输出 4.5,Z.ai 这次是冲着价格屠夫去的。

不过账得算全。单价便宜不等于总账单一定便宜——GLM-5.3-Flash 在 Artificial Analysis 里输出偏长,Agent 任务总成本还看上下文组织、缓存命中率、失败重试,token 便宜不代表每单都按比例省钱。57 分也是 Flash 的上限,不是 GLM-5.3 完整版(完整版 60 分),它的定位就是性能保住八成、成本砍到脚踝。跑国产卡意味着部分海外工具链适配还在路上,别指望所有现成框架开箱即用。“10 万张卡、成本追平英伟达"是智谱自述,SemiAnalysis 点赞不是背书,独立验证还得等。

想试的话

OpenRouter 搜 GLM-5.3-Flash 直接调,或 Z.ai 开个 key,中国区促销价到 9 月 9 日

值得多想一步的是这事的分量。DeepSeek 打的是低价模型,智谱这次打的牌更硬——低价模型 + 自证不依赖英伟达。这是"国产模型 + 国产芯片 + 真实流量"第一次三件事同时出现。下一轮竞争可能不只是模型比模型,而是整条国产算力栈能不能接住这些流量

模型 57 分打平 Opus 4.8,价格 1/40,全跑国产卡——这三个数字随便哪个单独出现都不稀奇,但它们是同一天从同一家公司嘴里说出来的。这就是「牛来」真正牛的地方。


搬砖程序员带你飞,专注 Golang / AI / 后端。每天一篇,讲清楚一个技术真相。

0%