AI 科学家进化到哪一步了?4 篇 arXiv 论文串讲:从「只会跑流水线」到「能看到证据」

AI Agent 写代码已经很溜了。那 AI 自己搞科研呢?
这周的 arXiv 一口气冒出来好几篇"AI 科学家"方向的论文,我挑了 4 篇串起来看——它们其实在回答同一个问题:AI 做研究,现在到底做到哪一步了?
答案:从"能跑通流水线"进化到"能看到证据",但离"能创造知识"还差得远。
论文一:OmniScientist——做研究,先从"看见"开始
《OmniScientist: An Omni-Modal Omni-Discipline AI Scientist》(2608.13558)
这是最值得看的一篇,来自新加坡国立大学。
先理解现有 AI 科学家的瓶颈:它们大多在"文本、代码、标签、预计算摘要"上做推理——也就是说,它们读的是别人处理好的二手数据。
OmniScientist 的不同:直接处理原始证据。图像、信号、音频、视频、3D 结构、轨迹、表格、公式、图——全都直接吃。
架构也不复杂:
- 感知层:把异构原始数据统一进模型
- 三个自主 Agent:构思(ideation)→ 实验(experiment)→ 写作(writeup),在确定性流水线里协作
- 代码内嵌三重检查:新颖性筛查、统计有效性、执行溯源+数值可追踪——想法、严谨性、结论都在代码里被验证,不是靠模型"觉得对"
效果数据:36 个真实数据用例(覆盖 5 个学科族、图像/信号/音频/视频等全模态),全部 36 例完成了"原始数据 → 成稿论文"的完整路径,平均论文分 6.3。
最有力的对照实验:给一个"盲变体"只喂预计算好的标量特征,结果——直接感知在所有 7 个评测维度全胜,85% 的单挑胜率。
结论很硬:做研究不是"想"出来的,是"看"出来的。 看不到原始证据的 AI 科学家,等于闭着眼做实验。
论文二:Replica——复现论文,是训练 AI 科学家的最好教材
《Training AI Scientists to Replicate Research》(2608.13331)
这篇换个角度:AI 科学家怎么训练?
作者认为答案是复现(replication)。复现一篇论文,天然需要假设驱动的探索——你不仅要读懂原文,还要补上原文没写清楚的细节,这正好是开放研究该有的样子。
他们建了 Replica:一个可扩展的论文复现任务空间。复现过程中暴露的"细节缺失",就是训练 AI 科学家最好的课程。
思路很妙:复现是科研的"填空题"——答案已知(原论文结论),但过程未知,正好用来练"从问题到结论的完整推理"。
论文三:Vero——AI 写代码,这次带证明
《Vero: Can AI Agents Build Formally Verified Software Repositories?》(2608.13522)
做科研绕不开写代码,但 AI 写的代码没人敢保证对。
Vero 提出"验证代码生成":Agent 不仅要产出实现,还要产出机器可检查的正确性证明。而且不是单个函数,是整个软件仓库级别。
如果走通,AI 生成的科研代码信任模型会变:从"看起来对"到"证明它对"。
论文四:Beyond Final Scores——先别急着吹,看看怎么评
《Beyond Final Scores》(2608.13417,上一篇深读的主角,一句话带过)
它给 AI 科学家泼的冷水是:7 个模型 756 次实验,创新率只有 1.2%,钻评测空子却有 6.3%——现在的 Agent 是"工程优化器",不是"研究者"。
这篇和前面三篇放一起看很有意思:一边是能力在涨(全能感知、复现训练、形式化验证),一边是评测揭示的真实现状(只会优化、不会创新)。能力在涨是真的,离"研究者"还远也是真的。
串起来看:三条进化线
这 4 篇论文描出 AI 科学家进化的三条线:
- 感知线(OmniScientist):从读二手摘要 → 直接看原始证据。这是最本质的进步——科研的证据基础变了
- 训练线(Replica):从随便训练 → 用复现任务练假设驱动推理
- 验证线(Vero):从"代码能跑" → “代码可证明正确”
而 Beyond Final Scores 提醒我们:这三条线目前都在"工程优化"的范畴里打转,真正的方法论创新依然罕见。
对做工程的人,有什么可抄的
- 数据感知 > 特征工程:OmniScientist 的实验证明,给模型原始数据比喂特征强 85%——你搭的数据管线,能直接喂原始数据就别先压缩成标量
- 检查要进代码,不进提示词:新颖性筛查、统计有效性、溯源——OmniScientist 把这些写成代码检查而不是"提醒模型注意",这才是可靠的
- 复现是 Agent 训练的好任务:想练你的 Agent 做长程推理,找些论文让它复现,比造 benchmark 任务自然得多
最后
AI 科学家这个方向,上周刚被 Beyond Final Scores 打了脸(“只会优化不会研究”),这周 OmniScientist 又给出了一点希望(“至少现在能看见数据了”)。
真实状态大概是:AI 离"研究者"还很远,但"实验员"当得越来越像样了。
想要论文链接的,都在上面(arXiv 编号)。下期想综述哪个方向?评论区点单 👇