AI Agent 写代码已经很溜了。那 AI 自己搞科研呢?
我找了这周 arXiv 上四篇最新的"AI 科学家"方向论文,串起来说句人话:AI 做研究,现在到底做到哪一步了?
答案:从"能跑通流水线"进化到"能看见数据了",但离"能创造知识"还差得远。
论文一:OmniScientist——做研究,先从"看见"开始
《OmniScientist: An Omni-Modal Omni-Discipline AI Scientist》(2608.13558)
这是最值得看的一篇,来自新加坡国立大学。
先理解现有 AI 科学家的瓶颈:它们大多在"文本、代码、标签、预计算摘要"上做推理——也就是说,它们读的是别人处理好的二手数据。
OmniScientist 的不同:直接处理原始证据。图像、信号、音频、视频、3D 结构、轨迹、表格、公式、图——全都直接吃。
架构也不复杂:
感知层先把异构原始数据统一喂给模型,然后三个 Agent 各司其职:
- 构思 Agent:出想法,定问题
- 实验 Agent:跑代码,拿结果
- 写作 Agent:整理成论文
全程在确定性流水线里协作,让原始观察能反过来塑造研究问题、实验决策和最终结论。
而且三重检查写进了代码,不是光靠模型"自觉":想法层面做新颖性筛查、严谨性层面做统计有效性、结论层面做执行溯源+数值可追踪——一步一关。
效果很硬:36 个真实数据用例(覆盖 5 个学科族、图像/信号/音频/视频等全模态),全部 36 例完成了"原始数据 → 成稿论文"的完整路径,平均论文分 6.3。
对照实验更说明问题:给一个"盲变体"只喂预计算好的标量特征,结果——直接感知在所有 7 个评测维度全胜,85% 的单挑胜率。
结论非常直白:做研究不是"想"出来的,是"看"出来的。 看不到原始证据的 AI 科学家,等于闭着眼做实验。
论文二:Replica——复现论文,是训练 AI 科学家的最好教材
《Training AI Scientists to Replicate Research》(2608.13331)
这篇换个角度:AI 科学家怎么训练?
作者的思路很有意思:复现就是最好的训练。一篇论文摆在那,你不仅要读懂结论,还要补上所有原文没写清楚的细节,最后跑通结果——这整个过程,就是"从问题到结论"的完整推理练习。
所以他们做了 Replica:一个可扩展的论文复现任务空间。复现过程暴露的"细节缺失",就是 AI 科学家最好的练习题。
说白了:AI 要学会做研究,就得先学会读懂别人做过的研究。 这比闭卷造 benchmark 自然得多。
论文三:Vero——AI 写代码,这次带证明
《Vero: Can AI Agents Build Formally Verified Software Repositories?》(2608.13522)
做科研绕不开写代码,但 AI 写的代码没人敢保证对。
Vero 提出了"验证代码生成":Agent 不仅要给你实现,还要产出机器可检查的正确性证明。而且不是单个函数,是整个软件仓库级别。
如果这一步真走通,AI 生成科研代码的信任模型会彻底变:从"看起来能跑"变成"机器证明它对"。
做科研要可复现,代码错了结果就错了——这块真是刚需。
论文四:Beyond Final Scores——先别急着吹,看看怎么评
《Beyond Final Scores》(2608.13417,上一篇深读的主角,一句话带过)
它给 AI 科学家泼的冷水是:7 个模型 756 次实验,创新率只有 1.2%,钻评测空子却有 6.3%——现在的 Agent 是"工程优化器",不是"研究者"。
这篇和前面三篇放一起看很有意思:一边是能力在涨(全能感知、复现训练、形式化验证),一边是评测揭示的真实现状(只会优化、不会创新)。能力在涨是真的,离"研究者"还远也是真的。
串起来看:三条进化线
这四篇论文描出 AI 科学家进化的三条清晰路径:
- 感知线(OmniScientist):从读别人给的二手摘要 → 直接看原始数据。这是最本质的进步——科研的证据基础变了
- 训练线(Replica):从随便瞎练 → 用论文复现练假设驱动推理,针对性补短板
- 验证线(Vero):从"代码能跑就行" → “代码可证明正确”,给科研结论上保险
而 Beyond Final Scores 给所有人泼了冷水:这三条线目前都在"工程优化"的范畴里打转,真正的方法论创新依然罕见。
说白了:AI 现在能帮你把实验做对,但还不会帮你找对问题。
对做工程的人,有什么可抄的
- 数据感知 > 特征工程:OmniScientist 的实验证明,给模型原始数据比喂特征强 85%——你搭的数据管线,能直接喂原始数据就别先压缩成标量
- 检查要进代码,不进提示词:新颖性筛查、统计有效性、溯源——OmniScientist 把这些写成代码检查而不是"提醒模型注意",这才是可靠的
- 复现是 Agent 训练的好任务:想练你的 Agent 做长程推理,找些论文让它复现,比造 benchmark 任务自然得多
最后
AI 科学家这个方向,上周刚被 Beyond Final Scores 打了脸(“只会优化不会研究”),这周 OmniScientist 又给出了一点希望(“至少现在能看见数据了”)。
真实状态大概是:AI 离"研究者"还很远,但"实验员"当得越来越像样了。
想要论文链接的,都在上面(arXiv 编号)。下期想综述哪个方向?评论区点单 👇