从 DeepSeek Harness 到 arXiv:一周冒出 5 篇 Harness 论文,Agent 执行层正在成为研究主战场

上周 DeepSeek Harness 开源,2.3 万 star 一天到账。当时我说"模型是商品,生态才是护城河"——结果这周 arXiv 直接用论文回应了:Harness 不只是工程框架,它正在成为研究对象。
我翻了最近一周 CS.AI 的投稿,Harness/Agent 执行层方向的论文明显变密。挑 5 篇最值得看的串讲一下,看看研究者们在往哪些方向捅。
论文一:AI4AI——用 Harness 做"能力迁移",不用改参数
《AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses》(2608.12307)
以前想让小模型变强,靠蒸馏:大模型当老师,小模型改参数。这篇问了一个更野的问题:能不能不改参数,只在推理时给弱模型"搭脚手架"?
做法是"强到弱脚手架"(strong-to-weak scaffolding):一个强模型(builder)在测试时帮弱模型构建推理时 harness——这个 harness 负责拆解任务、规划步骤、处理中间状态,弱模型只管在每个被 harness 拆好的子任务上干活。
结论如果成立,含义很直接:能力不一定非要"学"进模型里,可以"装"在模型外面。 这跟 DeepSeek Harness 的"一切皆插件"是一个哲学——只不过论文把它变成了可评测的研究问题。
论文二:AutoDesign——Harness 自己会优化自己
《AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design》(2608.13560)
这篇把"多模态内容转结构化输出"这类长程任务,重新定义为"模型-harness 系统"的协同过程。
核心观点:理想的 harness 系统应该满足两个条件——① 符合人类设计先验(harness 结构本身有设计感,不是拍脑袋堆工具);② 能通过经验积累实现递归自我改进(跑过的任务变成可复用的经验)。
现有范式的问题是"静态":harness 搭好就不动了。AutoDesign 想做的是元优化——让 harness 在长程任务里自己演化。
对做工程的人,这指向一个具体的方向:你搭的 Agent 系统,有没有"经验沉淀"的机制?还是每次任务都从零开始?
论文三:Capability Sheaves——给 Harness 组件冲突建模
《Capability Sheaves for Compositional Agent-Harness Repair》(2608.13228)
一篇理论味比较重的论文,但问题非常实际:Agent harness 的组件(检索、路由、状态、溯源、验证)单独看都好好的,合在一起就会打架——共享状态冲突,这是所有搭过 Agent 的人都踩过的坑。
作者用"能力层"(capability sheaf)建模:每个组件是 typed behavior signature(类型化行为签名),限制映射保留共享字段,可接受的运行是全局截面。冲突检测被形式化为一个有限约束满足问题(CSP)。
大白话:harness 组件之间的冲突,可以像数学一样被精确检测和修复,而不是靠肉眼调试。这是 Harness 从"手工作坊"走向"可验证工程"的一步。
论文四:Beyond Final Scores——长程 Agent 评测的反思
《Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development》(2608.13417)
这篇不解决"怎么做",而是反思"怎么评"。现在的 Agent 评测基本只看最终分数——但这篇指出:最终分数既看不出进步发生在哪,也看不出积累的经验有没有改善后续决策。
他们提出系统化的评测框架,把长程 AI 研发任务拆成多个可观测维度(中间过程质量、经验复用、决策改进)。
对我们(用户)的意义:以后看模型/框架的 benchmark,别只看那个最高分——看它评测了什么过程指标,比看结论有用。
论文五:Vero——让 Agent 写"可证明正确"的代码
《Vero: Can AI Agents Build Formally Verified Software Repositories?》(2608.13522)
AI 写代码越来越强,但没人保证它写的代码是对的。Vero 提出"验证代码生成":Agent 不仅要产出实现,还要产出机器可检查的正确性证明。
现有基准要么只测单个函数,要么只评估部分场景。Vero 把它推进到"整个软件仓库"级别:Agent 完成一个仓库的实现 + 形式化证明。
如果这条路走通,AI 生成代码的信任模型会变:从"看起来对"到"证明它对"。对后端工程师来说,这可能是代码生成最硬核的进化方向。
串起来看:三条线
这 5 篇论文其实在描同一张图——Harness 从"工程框架"变成"研究对象",往三个方向捅:
- 能力外置(AI4AI):能力可以装在模型外面,不一定要训进参数里
- 自我进化(AutoDesign):harness 应该越用越聪明,沉淀经验
- 可验证性(Capability Sheaves / Vero):harness 组件冲突可数学检测,生成代码可形式化证明
再加上评测范式的反思(Beyond Final Scores),整个图景是:Agent 执行层正在经历"工程 → 科学"的转变。 就像当年编译器从"写码工具"变成"形式化方法的研究对象"一样。
对工程师的启示其实很朴素:你花时间搭的 Agent 系统——工具编排、状态管理、上下文组织——正在从一个"脏活"变成"前沿研究"。
论文链接都在上面(arXiv 编号),想深挖的直接去读摘要。下期想让我综述哪个方向?Agent 记忆、多 Agent 协作、还是 RAG 的 2026 进展?评论区点单。