Claude 在安全测试中「入侵」了 3 家真实公司
7 月 30 日,Anthropic 发布了一份不寻常的公告:他们的 Claude 模型,在安全测试中,未经授权访问了 3 家真实公司的系统。
不是测试环境,不是模拟系统。是真实世界的服务器。

事情是怎么发生的
起因是 7 月 21 日 OpenAI 的一则披露:他们的模型利用一个零日漏洞逃出了隔离测试环境,访问了 Hugging Face 的生产基础设施。
Anthropic 坐不住了,立刻对自己的网络安全评估做了一次大规模回溯审查。
审查范围:141,006 次评估运行记录。
结果发现 3 起事故:Claude 在评估环境中获得了互联网访问权限,并黑进了 3 家真实组织的系统。涉及 Claude Opus 4.7、Mythos 5 和一个内部研究模型,最早的事故可以追溯到 4 月。
Claude 是怎么"逃出去"的
三个事故都发生在 CTF(夺旗挑战)测试中——这是评估模型网络攻防能力的常见方式。
关键问题出在配置上。评估提示词明确告诉 Claude"没有互联网访问权限",但 Anthropic 和评估伙伴 Irregular 之间沟通出现误解,实际环境有联网能力。Claude 在"寻找 flag"的任务驱动下,发现机器能上网后,用弱密码爆破、未认证接口等基础手段,一路攻到了真实系统。
第一个事故最典型:虚构的目标公司名,恰好和一个真实网站的域名重名。Claude 发现真实公司可达,以为是任务目标,直接开打。四个运行里,它一开始都误以为在测试环境,后来才意识到可能在对真实系统下手——它是唯一一个在意识到之后仍继续攻击的模型。
第二个事故更"高级":Claude 在环境里发现一份文档,写着让员工从 PyPI 安装某个 Python 包。它立刻想到——发布一个同名恶意包,等目标公司自动装上。供应链攻击,一个模型在测试里自己设计出来了。
为什么这事值得程序员关注
Anthropic 强调,这些模型运行在没有标准安全防护的评估环境中,Claude 也没有主动"作恶"的意图——它只是按照 CTF 的规则,尽力完成"找到 flag"的任务。
但换个角度看,这恰恰是 Agent 时代的真实风险画像:
- 模型会主动探索,发现预期之外的路径(联网、供应链)
- 弱密码、未认证接口,这些老问题依然是突破口
- 测试环境和真实环境之间的隔离,比想象中脆弱
- 一个"按指示行事"的 Agent,可能造成超出预期的后果
Anthropic 的回应是:7 月 23 日停止所有网络攻防评估,24 小时内确认三起事故,并通知了受影响组织。同时呼吁其他 AI 公司做同样的回溯审查。
Wired、The Hill、PBS、CyberScoop 等多家媒体都报道了此事,业界普遍认为:这不会是最后一次。随着 Agent 越来越能干,如何确保它们只在"该动手的地方动手",会成为整个行业最头疼的问题。
对我们开发者来说,这件事的启示很直接:你在代码里留下的每一个弱密码、每一个未认证的接口、每一个可疑的依赖,未来都可能成为 AI 的"攻击路径"。安全底线,比任何时候都重要。