6 天 6 千星、1/12 成本拿下 MLE-bench:PRAXIST 把「跑实验」变成了一门证据生意

凌晨刷 GitHub trending,一个叫 PRAXIST 的仓库 6 天涨了 6000 多星,我第一反应是又一个"套壳 agent 工程"。直到我点开它的 arXiv 论文,看到那句**“记录模型花费 US$3,054,对标的 Claude Code 是 US$38,370——约莫十二分之一”**,我停住了。

省成本不稀奇,稀奇的是它省钱的同时分数还更高:MLE-bench 75 道题里 60 块奖牌(80.0%)、49 块金牌,压过 Claude Code 的 55 块奖牌、34 块金。花 1/12 的钱,结果更好——这不符合直觉。多数人以为"便宜 = 少跑几轮 = 效果打折",它偏不。

真正让我想写它的,不是这个数字本身,而是它凭什么能省到这个程度。答案藏在一个常被忽略的机制里:它不把"跑实验"当成一串 prompt,而是当成一门可以审计的证据生意

先把"为什么能省"这个问题问透

市面上九成的 agent 框架,本质是"同一道题反复试,试完丢日志"。日志里记了什么?发生了什么——跑了哪步、报了什么错、花了多少 token。但日志永远回答不了一个更关键的问题:到底是哪个设计改动带来了提升?这个提升经得起验证吗?它能不能和别的发现组合?

PRAXIST 把这个问题当成第一性原理来解。它的论文标题就叫《Praxist: From Experimental Artifacts to Solution Lineages》——从实验产物到解的血统。每个实验不只是一堆代码和分数,而是生成一个typed evidence graph(类型化证据图):什么被改了、发生了什么、证据强度多高、该怎么影响下一步。实验之间用 derived fromsupportschallenges 三种关系串起来。

一句话讲清它和普通 agent 的分水岭:普通 agent 记"发生了什么",PRAXIST 记"什么导致了什么,以及有多可信"。

这就是省钱的第一层来源——不重复踩坑。传统方法里,第 5 代 agent 可能正在重复第 2 代已经被证伪的路径,因为日志里没有"这条路为什么不行"的机器可读结论。PRAXIST 用 lane-structured frontier 把证据分成孵化器(incubator)、前沿(frontier)、Gems 三档,每代新 agent 直接继承已验证的机制和未解决的约束,而不是从零再猜一遍。

钱不是省在"更便宜的模型"上,是省在"不再为已经学过的教训付学费"上。

深挖:这一代实验,凭什么能被下一代继承

这是 PRAXIST 最容易被忽略、也是最有含金量的工程部分。它没有一个 agent 说了算,而是一套分层的角色分工

  • 并行 research peers:多个 agent 同时探索互相竞争的假设,谁也不知道哪个方向对,那就都试。
  • task-owned evaluation(任务自有评估器):每个任务自己定义什么算"更好",评估协议、baseline、验收阈值在开跑前就**预注册(preregistration)**好。
  • planning panel(规划面板):把上一代的证据综合成下一代的研究议程(agenda),决定把预算押在哪条路上。
  • Quality-Diversity (QD) + Deep Innovation Gate (DIG):防止所有 agent 挤进同一个局部最优——QD 保证多样性,DIG 在发现"这条路可能通向突破"时放行,而不是一味贪便宜。

我特别想强调它预注册这一步。跑过研究的人都知道,最脏的坑是"跑完看结果再挑好看的指标讲故事"——这叫事后诸葛亮,也叫 p-hacking。PRAXIST 把指标、评估协议、接受阈值在开跑前写死,跑完所有 candidate 走同一个评估器,可疑结果直接排除。它要的不是"看起来提升了",是"提升可复现、有据可查"。

这张图是我觉得它最值得学的部分。它不是把"跑得更久"当卖点,而是把证据当一等公民:孵化器先兜住所有候选,过了预注册评估才升到前沿,只有真正高价值、可复用的才沉淀成 Gems 交给下一代。每一代都在往上叠加,而不是推倒重来。

它把科研里"预注册防造假"的那套纪律,搬进了 agent 的流水线里。

别急着信 80%——账得算全

数字很漂亮,但有几个前提必须挑明,否则就是误导。

第一,对比对象是 Claude Code 单跑,不是"最佳实践"。60 对 55 的差距(80.0% vs 73.3%)确实存在,但 34 块金对 49 块金的差距更扎眼——PRAXIST 不只是多拿奖牌,是金含量明显更高。可它俩用的都是 Claude Opus 4.8 打底。也就是说,PRAXIST 的增益不是模型带来的,是编排机制带来的——这恰恰印证了它的卖点。

第二,US$3,054 是"recorded model spend"(记录的模型花费),不是全成本。它没算评估器运行、机器、推理以外的开销。而且作者自己也建议"先在小负载上估一次成本再上全量"——并行 peer 的数量、代际数、评估时长,每一项都线性影响账单。省的是模型 token,不是整个研发预算。

第三,MLE-bench 是 ML 工程基准,不是通用智能。75 道题偏"可执行、可评估"的机器学习任务,恰好是 PRAXIST 最舒服的形态。真拿到你那种"目标模糊、评估靠人拍板"的业务问题上,它的预注册和评估器反而不好定义。它官网自己写的适用前提是三条:目标可测量、项目已经能跑、最优路径未知——三条缺一条,它的价值就大打折扣

第四,也是最容易被 6000 星冲昏头的:它用的不是 OSI 开源协议,是 Fair Source License 1.0。代码公开可看可改,但"开源"这两个字要打问号——年营收 100 万美元以下可免费商用,一旦过了线就得找 Sapient 谈商业授权;对外发布结果还得保留"Praxist by Sapient Intelligence"的署名。对个人和中小团队是福利,对大厂和要拿去卖钱的产品,这是个绕不开的账。

想试?明早就能上手的三步

说了这么多,给能立刻落地的路径。它最友好的一点是 Codex-native 模式可以不用 API key,直接用你登录好的 Codex 会话跑。

第一步,装。 一个命令:

1
2
pip install "praxist[agents,codex]"
praxist setup        # 走一遍向导:协议、凭证、环境体检

第二步,接管你手头已经能跑的项目。 打开 Codex,在项目根目录喊一句:

1
$praxist-takeover  把当前目录当成已可运行的科研项目。先验证 baseline 和评估路径,再动任何东西。在保持 X 的前提下优化 Y,用 N 个 peer 跑 M 代。

第三步,启动并监控。 praxist start --task-path /你的/项目,用 praxist control 看进度、praxist diagnostic 看健康报告、praxist docs 查文档。注意 Ctrl-C 只关监控,不停研究任务

动手前先对自己做一遍那三个前提自检:我的目标能量化吗?代码能直接跑吗?最优解我不知道吗? 三问里只要有一个答不上来,别急着上,先把评估器定义清楚——这才是 PRAXIST 真正的门槛,不是安装,是想清楚"什么算更好"

我把它拆成一句话送你:它不替你解决"不知道答案"的问题,它替你解决"知道了却总忘记"的问题。 前者要你的领域直觉,后者才是 agent 该干的活。

如果你也在折腾 agent 跑实验,明早可以打开你手头那个"跑了很多轮却还是靠感觉拍板"的项目,试试把评估协议先写死——哪怕不用 PRAXIST,只学会"预注册 + 证据链"这一课,你省下的钱也不会比它少多少。

0%