北大开源 OpenAI4S:9.9 元豆包 API 复刻 Claude Science,科研 Agent 终于进入工作流

一个科研场景:把一篇论文的关键结果交给 AI,让它用真实数据、真实计算完整复现一遍,产物可检查、可复用。这听起来是 Claude Science 的活——Anthropic 的订阅制科研 Agent。但 7 月 6 日,北京大学—元空智能AI联合实验室开源了一个项目,把这件事的成本打到了每月 9.9 元人民币。

项目叫 OpenAI4S(Open AI for Scientist),仓库地址 github.com/PKU-YuanGroup/OpenAI4S,MIT 协议。一句话定位:用最便宜的国产模型 API,复刻 Claude Science 的科研工作流。

背景:科研 Agent 的"玩具期"为什么还没结束

过去两年,科研 Agent 的产品不少,但绝大多数停在演示阶段。原因有三。

第一,算力贵。跑一次蛋白质折叠或单细胞分析,要么租云端 GPU,要么自建集群,科研团队付不起,个人研究者更付不起。第二,token 贵。前沿模型的 API 按量计费,一个科研任务动辄几十轮工具调用,账单吓人。第三,不可信。模型输出的"实验结果"常常是编的——没有真正跑代码,只是"想象"了一个结果。这三点不解决,科研 Agent 就永远是 demo。

OpenAI4S 的三板斧,恰好对着这三个问题:模型侧用 9.9 元/月的豆包套餐,算力侧支持接入自有 GPU(BYOC,Bring Your Own Compute),可信侧用一套"代码即行动"(Code-as-Action)架构加"不伪造"策略。项目 README 里那句话很直接:“code is the action, the kernel is the environment”——代码是行动,内核是环境。

核心一:两个行动平面,各干各擅长的活

OpenAI4S 最核心的设计是"双行动平面",这也是它与传统"工具调用"式 Agent 的分水岭。

平面一:JSON 工具调用(控制面)。 负责确定性编排:工作流调度、权限管理、元数据、外部服务接入、人工审批。这些事要求结构化、可审计,适合原生 tool call。

平面二:Python/R 代码单元(科学面)。 负责真正的科研计算:数据分析、探索、仿真、长时间运行的科学任务,全部在常驻内核(persistent kernel)里执行。Python 单元运行时还可以通过内核内的 host API 同步调用宿主能力;R 是独立的常驻分析通道。

为什么必须这样分?看一个例子:传统 ReAct 式 Agent 读文件、过滤、排序、画图,要经历约 14 轮"推理-调用-返回"的往返,每轮都把中间结果塞进上下文;OpenAI4S 用一段代码单元完成同样的流程——一个 10 万行的 DataFrame 全程留在内核内存里,只有最终产物进入上下文。往返次数从 14 次降到 1 次,上下文干净,计算真实发生在内核里,而不是模型"想象"出来的。

核心二:零依赖的纯标准库内核,34 个科研 Skills

OpenAI4S 有个反常规的坚持:引擎和 Web 服务全部用 Python 标准库实现——http.server 加手写的 WebSocket,不依赖任何框架;LLM 客户端只用 urllib 直连 OpenAI、Anthropic、Gemini 协议。这意味着核心代码在任何有 Python 3.10+ 的环境都能跑,没有版本地狱。

模型接入是"一行切换":同一个 host.llm 接口,支持火山方舟的 ark 协议(豆包、GLM、Kimi、DeepSeek、MiniMax),也支持官方 chatgpt、claude、gemini。官方推荐的最便宜路径,就是火山方舟"Small"套餐,9.9 元/月,约合 1.4 美元——README 里的原话是"比一杯咖啡还便宜"。

内置 34 个科研 Skills,覆盖主流方向:结构生物学(AlphaFold2、ESMFold2、Boltz、Chai-1、OpenFold3、ProteinMPNN)、基因组学(ESM-2、Evo2、Borzoi)、单细胞(scGPT、scVI)、分子对接(DiffDock)等。关键设计是:这些 Skill 是"代码配方"(recipes of code),不是 JSON 工具 schema——一个 Skill 就是一段可执行的科研流程代码,用户自己写的 Skill 放在数据目录下,不能覆盖内置的可信版本。

核心三:“不伪造"策略与可复现产物

科研 Agent 最大的信任问题是幻觉。OpenAI4S 用两个机制应对。

一是 no-fabrication 策略:在 host.fold 等涉及科学产出的操作上,严格执行"不伪造”——没有真实计算就不产出结果。二是产物版本化:运行记录(Action Ledger)是 append-only 的,所有执行尝试、生成生命周期、用量与完成记录都可追溯重建;每个产物带版本与来源(provenance),界面里有 Action Timeline 时间轴,Notebook 默认只读。这意味着"Agent 干了什么"全程可查,实验结果可以原样复用。

演示案例很能说明问题:人胰岛素(UniProt P01308)从 UniProt/RCSB 数据库取真实数据,到 3D 结构预测与可复现报告,全流程真实计算。另一个演示是青蒿素与紫杉醇的溶解度预测——plan-mode 研究模式下的完整工作流。

深度分析一:9.9 元背后的算力经济学

“9.9 元复刻 Claude Science"这个卖点,很多人会看成噱头,但它其实点破了一个结构变化:科研 Agent 的成本大头,正在从 token 转向算力。

模型侧,豆包级别的中端模型在代码执行、数据操作上的能力已经够用,每月 9.9 元近乎免费。算力侧,OpenAI4S 的 BYOC 设计——通过 ssh: 或内置的 NVIDIA NIM 集成把 GPU 任务分发到自有服务器——把最贵的部分留给了用户已有的硬件。换句话说,这个项目赌的是:科研团队缺的不是 GPU,而是把 GPU 用起来的软件层。这个判断和当下推理引擎、本地部署工具的流行是同一条逻辑线。

当然,也要泼一盆冷水:9.9 元套餐的模型能力上限,决定了它更适合"分析、复现、管线化"类工作,而非"从零提出新理论”;Claude Science 级别的顶级模型在开放探索类任务上仍然领先。开源复刻的意义不在"持平",而在"把门槛打下来"。

深度分析二:科研 Agent 进入工作流的三个标准

OpenAI4S 值得关注,还因为它无意中给"科研 Agent 进入工作流"立了三个可检验的标准。

真实数据与真实计算。 结果来自内核里真实跑过的代码,不是模型编的。可检查可复用。 每个动作有账本,每个产物有版本,复现不需要重跑整个对话。版本化产物。 结果可以作为后续研究的输入,而不是一次性输出。对照这三条,市面上大量"科研 Agent"产品其实还在玩具期——它们能聊天、能写计划,但交不出可复现的产物。这或许是这个项目 760 次提交背后真正的野心:定义科研 Agent 的"合格线"。

反过来看,也有明确的未解问题:34 个 Skill 覆盖的是生物信息学为主的领域,物理、化学、材料等方向的覆盖还薄;本地沙箱(macOS 用 Seatbelt、Linux 用 bubblewrap)的隔离强度依赖系统配置,Windows 原生不可用;172 个 star(截至 8 月 8 日)说明它还在早期,社区生态尚未成形。它目前更像"给科研团队的一把趁手工具",而非"面向大众的成品"。

落地:两件现在就能做的事

  1. 有科研或数据分析需求的团队,花一小时试跑git clone 后跑 setup.sh,用火山方舟 9.9 元套餐配一个模型,把一篇你熟悉论文的复现流程丢给它,对照 OpenAI4S 的账本检查它的每一步是否真实执行。重点体验"代码单元 vs 多轮工具调用"的差异。

  2. 关注 Code-as-Action 范式。OpenAI4S 背后是 CodeAct 论文(《Executable Code Actions Elicit Better LLM Agents》)的思路:用代码作为统一行动接口。这个范式正在从论文走向产品,无论你是否用 OpenAI4S,理解"为什么代码单元比工具调用更适合长任务"都有价值——它是下一代 Agent 架构的分水岭之一。

结尾

OpenAI4S 的 README 第一行写着:“Replicating Claude Science in two cuts or less”——用最少的成本复刻 Claude Science。这个项目最有意思的地方,不是"复刻"二字,而是它定义了一套可执行的科研 Agent 标准:真实计算、可检查、可复用、不伪造。当科研 Agent 从"能聊天"进化到"能交作业",AI 进入实验室的方式就变了:不再是一个会写综述的助手,而是一个真正上手跑数据的同事。9.9 元的价格只是一个信号——这个门槛,正在以肉眼可见的速度降低。

(信息来源:OpenAI4S 官方 README 与文档(github.com/PKU-YuanGroup/OpenAI4S,2026-07-06 开源)、docs/architecture.md 与 docs/skills.md、GitHub API 数据快照(2026-08-08,172 stars / 20 forks / 760 commits)、CodeAct 论文(Wang et al.,2024))

0%