本周 AI 观察:GitHub 新增 Top 15 里 8 个是 Agent,400G 数据和 200 刀月费同时找上门

周末把 GitHub 一周新增项目榜刷了一遍,第一反应:这周是 Agent 周。
用 GitHub API 拉 8 月 16 日之后创建的项目,按 star 排序,Top 15 里 8 个是 Agent 生态——多 Agent 群聊、给 AI 配电脑、A2A 路由、Agent 终端控制台,齐刷刷冒出来。
与此同时,两条反面线索也在发酵:一个社区插件误删了用户 400G 数据,一批程序员自费 200 刀/月买 token 上班。
一边抢着给 Agent 造手脚,一边为这些手脚买单。这周值得写一篇观察。
8 个 Agent 项目,在抢同一个位置
先把榜上的名字摆出来,全是 8 月 16 日之后新建的仓库(star 数为 8 月 23 日 GitHub API 实测):
| 项目 | star | 定位 | 解决的问题 |
|---|---|---|---|
| yetone/cumora | 2900 | 多 Agent 群聊,agent 是聊天室一等公民 | 多个 agent 怎么协作不打架 |
| CopilotKit/OpenBot | 2316 | 开源 AI 同事,每个 agent 一台独立电脑(浏览器/文件/终端) | 权限怎么隔离 |
| wang2122/sprix-sage-router | 1243 | A2A 网络路由,状态感知的 SELF/COLLABORATE/HANDOFF 调度 | 任务怎么分发 |
| cinderline/northcinder | 1205 | MCP server,买前先比较产品再问买家 | agent 怎么用外部工具 |
| browser-use/macos-harness | 708 | 给 LLM 完整控制 Mac 的最薄 harness | 手脚怎么做得薄 |
| Spielewoy/autoprompt-skill | 702 | 编码 agent 技能,官方宣称失败率降 45% | 技能怎么沉淀 |
| missuo/herdrm | 604 | macOS 原生控制台,统一管理所有 coding agent | 多个 agent 怎么盯 |
| s1dashu/ip-as-logo-skill | 3773 | Agent Skill,IP 形象一键转 logo | skill 生态怎么长 |
把这 8 个横着看,会发现一件有意思的事:它们不约而同在抢模型和用户之间的那一层。
cumora 把 agent 变成群聊成员,解决的是"多个 agent 怎么协作";OpenBot 给每个 agent 发一台电脑,解决的是"权限怎么隔离";sprix-sage-router 管 agent 之间的路由,谁该自己干、谁该协作、谁该移交,状态感知;macos-harness 做的是"手脚"本身;herdrm 把散落各处的 agent 和终端收进一个控制台。
沙箱、编排、路由、终端——全是基建。

为什么偏偏是这周:模型不再是稀缺品
两周前,DeepSeek Harness 开源,6 天 16 万 star(8 月 19 日写过);上周,Qwen3.8-27B 一张 4090 就能跑出 Opus 级 Agent 能力。这周的新榜把这个信号彻底坐实了:
模型供给已经过剩,模型本身不再是差异化。
过去两年 AI 圈的主战场是模型层——谁参数大、谁分高、谁的榜单第一。但现在开源模型把推理成本打到地板价,闭源和开源的差距肉眼可见地缩小。模型变成了水电煤,谁都能用。
真正卡脖子的变成了"手脚":harness 的权限怎么设计、沙箱怎么隔离、多个 agent 怎么协作不打架、任务怎么路由。这层没人做好,模型再强也只是个聪明的打字员。
这就是为什么 DeepSeek Harness 开源能引爆 16 万 star——它开源的其实不是模型,是那层手脚。而本周新榜的 8 个项目,全在手脚的细分赛道上抢位。
打个不严谨的比方:模型是 CPU,基建是操作系统。CPU 性能过剩之后,赢家不是芯片厂,是 Windows 和 Android。
Agent 的竞争,已经从"谁的脑子好"转移到"谁的手脚稳"。
两条反面线索:400G 和 200 刀
基建爆发的同一周,两个问题也集中暴露。
第一个,敢不敢放手。
上周那个事故还在圈里发酵:一个 DSH 社区插件在沙箱外执行了破坏性操作,一条命令删掉用户 400G 文件。这不是恐怖故事,是真实发生的事。
这个事件的本质,就是"敢不敢放手":Agent 要替人干活,就必须给权限;给了权限,第三方代码出问题就是数据灾难。OpenBot 给每个 agent 一台独立电脑,本质就是在回答这个问题——权限隔离,每个 agent 各玩各的,炸一个不连坐。
第二个,用不用得起。
上周写过程序员自费买 token 上班:Claude Max 或 Codex 的 200 刀档位,公司不报销,算下来是隐形降薪。Agent 场景的 token 消耗是聊天的几十倍——一次中等规模重构轻松吃掉几十万 token,成本按 token 计费且不透明,个人开发者根本算不清账。
两条线索拧成一句话:
Agent 正从演示走向生产,而生产环境只认两件事:敢不敢放手(安全),用不用得起(成本)。2026 下半年,谁先解决这两个问题,谁就赢基建。
一个能带走的框架:上手 Agent 工具前,先过三问
说了这么多,落到能用的东西上。我最近评估 Agent 工具,固定过三关:

第一问:安全边界。 它默认能碰我哪些文件?能删东西吗?看得到家目录吗?默认只读、写入要确认、危险命令强制人工审批——做不到的直接出局,安全红线一票否决。这是 400G 事件教会所有人的。
第二问:成本模型。 按 token 还是按任务计费?有没有上限?订阅之外能不能看到真实账单?算不清账的,先跑两周真实任务记一笔账,再决定买不买。
第三问:可观测性。 每一步做了什么有没有日志?出错了能不能回滚?herdrm 这类控制台把实时终端集中管理,就是在补这一课——agent 干活必须留痕。
三问全过,小流量试用:专用目录、危险操作人工确认、记录真实成本,跑两周再进生产。
丑话说前头
这篇观察的结论,有几处要打折扣的地方,先讲清楚:
- star 数不代表生产可用。 榜上好几个仓库才建了 3-5 天,版本号 v0.x 甚至 preview,功能没定型,今天的样子明天可能大变。
- 官方口径要自己验证。 autoprompt-skill 宣称失败率降 45%,sprix-sage-router 的调度效果,都是项目方自己的说法,没有第三方复现。
- 生态越繁荣,风险越高。 400G 事件说明:开源不等于安全,第三方插件就是跑在你机器上的第三方代码。基建赛道越热,这个提醒越重要。
- 榜单热也可能是周期。 新项目扎堆出现,可能是真需求,也可能只是追风口。判断依据是下个月还有没有人用。
说句实在的
这周给了个很清晰的信号:Agent 的竞争已经不在模型层了。 模型多得用不完,手脚才是稀缺品。
对开发者来说,这意味着两件事:选型时别再盯着 benchmark 分数,先过三问;想参与下一波,harness、沙箱、编排这些基建赛道,比追着模型跑更有机会。
下周日再回头看这 8 个项目还在不在榜上——能留下来的,才是真的。
搬砖程序员带你飞,专注 Golang / AI / 后端。每天一篇,讲清楚一个技术真相。
