9 项基准飙升,DeepSeek V4 只做了这一件事

7 月 31 日,DeepSeek 悄悄更新了 V4-Flash 正式版。

没有发布会,没有大新闻,更新日志就几行字。但懂行的人一看就明白:这次更新不简单。

模型结构没动,参数没动,上下文还是 1M。唯一变的,是 Agent 能力。

9 项 Agent 基准测试全线飙升,多项成绩反超 V4-Pro-Preview。一个"轻量版"打过了"重量版",这在模型圈可不常见。

为什么架构没变,能力却大涨?

先看数据。Terminal Bench 2.1 拿了 82.7,DeepSWE 54.4,DSBench-FullStack 68.7。

DeepSeek V4 封面图

这些测试和传统代码评测完全不同。传统测试只要求模型写一段代码,Agent 测试要求模型真正进入一个工作环境:读文件、理解代码仓库、调用终端、改程序、跑测试。它考验的不是"会不会写代码",而是"能不能干活"。

关键在于:DeepSeek 只重新做了后训练

284B 总参、13B 激活的 MoE 结构,和 Preview 版一模一样。能力提升全部来自后训练和 Alignment 优化。

这传递了一个信号:当架构红利见顶,数据和方法论才是拉开差距的地方。同样的底座,用不同的训练策略,Agent 能力能差出一大截。

更值得注意的,是原生支持 Codex API 格式

现在用 DeepSeek V4-Flash 可以直接配置成 Codex 的后端。这意味着什么?开发者熟悉的工具链不用换,底层模型直接换成国产的。API 调用方式不变,模型名设为 deepseek-v4-flash 即可。

还有个细节:这次公测仅限 API

App 和网页端暂时用不上,官方说 V4-Pro 正式版会尽快发布。对开发者来说,API 先行的策略反而是好事——先让真正干活的人用上。

给想试试的你,落地三步

  1. 官方 API 申请 key,模型名填 deepseek-v4-flash
  2. 想用 Codex 体验 Agent 能力,按官方脚本一键配置
  3. 跑几个 Agent 基准任务,感受下"能干活"和"会写码"的区别

架构没变,Agent 却强了一截。下一轮模型竞赛,比的或许不再是底座,而是谁能让模型真正"上手干活"。

0%