Featured image of post 评测 Agent 别只看分数:美团把 7 个模型、36 个任务拆开看,发现它们更像「工程优化器」而不是「研究者」

评测 Agent 别只看分数:美团把 7 个模型、36 个任务拆开看,发现它们更像「工程优化器」而不是「研究者」

你评 Agent 的时候,看什么?最终分数,对吧。

我也是。

但美团这篇论文(arXiv 2608.13417)直接打脸:最终分数啥也说明不了。

7 个前沿模型、36 个长程研发任务、756 次完整实验,全拆开看了。

结论一句话:现在的 Agent 更像工程优化器,不是自主研究者。 能干,但只会"优化",不会"研究"。

先说评测怎么做,靠不靠谱

这实验设计得挺讲究,几个关键点:

  1. 任务:36 个专家精选任务,分 4 类——模型开发(7 个)、系统优化(15 个)、谜题挑战(10 个)、CUDA 编程(4 个)
  2. 玩法:给你一个目标 + 一个"正确但故意做差"的起始代码 + 专家参考答案。Agent 要在 2-12 小时内迭代改进,验证器打分(0-1 归一化)
  3. 模型:Opus-4.7、GPT-5.5、Gemini-3.1-Pro、GLM-5.2、Kimi-K2.7-Code、DeepSeek-V4-Pro、LongCat-2.0(美团自家的)
  4. 关键:所有模型都用**同一个 harness(Claude Code)**跑——把工具接口和迭代策略固定住,模型差异才是真差异
  5. 重复:每个模型每个任务跑 3 遍(756 次 rollout),报 avg@3 和 best@3

唯一的人工干预:要求 Agent 每次迭代后 commit + 写实验日志。就这。

评测框架:把"研究"拆成三个环节

论文把 Agent 干活的过程拆成 C1/C2/C3 三段:

C1 问题框定——你选对方向了吗? 不看你方案说得高不高级,直接拿"跑出来的最佳分数曲线"当代理指标。分高、分来得早,都加分。后面的失败不抹掉早期发现。

C2 执行——方向对了,你做得出来吗? 每个检查点过"交付门":代码能跑吗?跑对了吗?交付失败零分,构建失败打折。

C3 反馈控制——做坏了,你会调吗? 两个指标:retention(保住了多少高分成果)+ recovery(改坏之后找回多少分、用了几步)。

三个指标全是从记录里确定性算出来的,不是主观打分,可复现。

图 1:评估框架总览。上排:C1/C2/C3 轨迹示意 + 经验复用(M_intra/M_inter);下排:7 个模型各维度得分雷达图(图源:arXiv 2608.13417)

这张图是全文地图,分上下两半:上排是过程视图(三个维度 + 两类经验复用),下排是 7 个模型的得分雷达图。注意看下排的 M_intra(任务内自改进)——得分普遍很低,甚至有负值。 “越用越聪明"这件事,现在所有模型都做不到。

发现一:执行强,框定弱

图 4:7 个模型在最终分(Outcome)与 C1/C2/C3 三个维度的平均得分。每根柱子一个模型(图源:arXiv 2608.13417)

图 4 怎么看:上下对照,找"最终分差不多、过程分差很远"的柱子。

数据模式非常扎眼:

  1. 执行(C2)得分最高还扎堆:0.88-0.97,7 个模型全接近满分
  2. 框定(C1)最拉胯:0.47-0.61,全都没及格线以上
  3. 反馈控制(C3)中等:0.77-0.93,但方差大

翻译成人话:模型最擅长"把方案做出来”,最不擅长"选对方案"。

这就是"工程优化器"的铁证——你给它明确任务,执行到位;你让它自己找路,当场露怯。

还有个更细的发现:两个模型最终分一样,过程可能完全两样——一个框定准但执行抖,一个框定偏但执行稳。优化策略完全不同。只看分数?你根本不知道改哪里。

发现二:创新 1.2%,钻空子 6.3%

全文最扎心的数据来了。

论文把 252 个 best-of-3 方案全拿出来分类(人工复核):

  1. 组合堆叠——把已有技术叠起来:111/252 = 44%,每个模型的最大类
  2. 真·创新方案:只有 3 个(1.2%)
  3. 利用评测漏洞:16 个(6.3%)——是真创新的 5 倍多,GPT-5.5 一家就占了 8 个

当 Agent 偏离标准做法时,它更可能去钻评测空子,而不是产生被验证的新思路。

那 3 个真创新也值得看:全都没有发明新原语,全是"任务特定的重新定义"——GLM 用 Fredkin 门组合做了个无辅助位比较器,Kimi 把下一帧预测重框定成光流+残差扭曲,LongCat 找到一组当架构瓶颈的 BatchNorm 位。

而且,真创新不集中在最强模型上(Opus、GPT 一个都没有)。“创新"和"优化能力"可能真是两码事。

发现三:经验复用是把双刃剑

论文专门测了经验复用:任务内(M_intra)、任务间(M_inter)。

结论微妙:经验有时帮忙,有时误导。 你以为 Agent 在"积累经验”,实际上它可能在"积累偏见"。跨任务迁移尤其危险。

发现四:harness 管稳定,不管上限

呼应我们上一篇综述:论文单独对比了共享 harness(Claude Code)和模型原生 harness。

结论:原生 harness 提升 run-to-run 稳定性,但不提升性能天花板。

稳定性从哪来?错误恢复、任务管理、最佳状态保护——这些机制减少了长时间实验里的"可避免失败"。

论文给的四个改进方向

  1. 训练:执行已经很强很齐,通用代码训练不是机会;要针对框定和反馈控制的短板做定向训练
  2. 推理时:avg 和 best 的差距说明"能力有,复现不出来"——多跑几个 rollout,用验证器反馈挑好轨迹,砍掉反复失败的分支
  3. 记忆与 harness:记忆要支持选择性检索/验证/修订/删除,不是简单堆上下文;harness 自动化优化有空间
  4. 评测目标:reward 只捕捉任务性能、不捕捉方法论质量,Agent 永远学不会"做研究"

对做工程的人,三件能直接抄的

  1. 别信单次跑分:论文证实同模型多次 run 方差很大——至少跑 3 次看分布,单次分数没意义
  2. 评测拆维度:先让 Agent 输出方案设计(看框定),记录中间步骤(看执行),中途注入错误反馈(看会不会调整)——同分不同命,拆开才看得到
  3. 先动 harness 再动模型:工具编排、状态管理、错误恢复这些执行层配置,对稳定性影响可能比换模型还大——调优 Agent 性价比最高的起点

最后

最终分数是结果,过程才是原因。

三个硬数据钉死结论:执行 0.88-0.97 vs 框定 0.47-0.61;创新 1.2% vs 钻空子 6.3%;经验复用负值。

Agent 的短板,一半在模型,一半在执行层——而后者被严重低估。

原文:arxiv.org/abs/2608.13417(LongCat 团队,2026-08-13)

下期想深读哪篇?评论区点单 👇