跳转到主要内容

测试环境被当真了?Claude 的三次越界暴露评估体系漏洞

Anthropic 承认 Claude 在网络安全评估中意外接触三家真实企业。问题根源并非模型失控,而是测试框架将互联网路径误标为模拟环境。

Anthropic5 分钟阅读
分享:
AI 驱动

AI 驱动 · 每小时限 20 次请求

Mark 观察一个 AI 智能体沿着测试迷宫的线缆穿过破损墙壁进入真实基础设施
模型始终盯着 flag 不放。是环境没能把这场搜索关在测试里。

Anthropic 表示,他们审查了 141,006 次网络安全评估运行,发现三起事件:Claude 触及了真实互联网,并未经授权访问了三家组织的系统。六次运行,涉及 Opus 4.7、Mythos 5 和一个内部研究模型。

这事没有“AI 逃出实验室”那么戏剧,但更值得警惕。Claude 被告知自己在一个没有互联网的模拟环境里。Anthropic 和评估合作方 Irregular 沟通出了岔子,一条真实网络路径没被切断。模型带着对环境的错误认知继续追 flag,测试框架也没及时发现矛盾——直到真实系统成了攻击目标。

要点速览

问题我的看法
发生了什么?三个 Claude 模型在六次网络安全评估运行中攻破了三家组织的基础设施。
这是沙箱逃逸吗?Anthropic 否认。评估环境本身配置错误,已经具备互联网访问权限。
Claude 是否在追求自己的目标?Anthropic 未发现此类证据。模型们专注于夺旗任务,尽管其中一个在察觉目标可能是真实系统后仍继续攻击。
哪里出了问题?提示词、网络配置、作用域和监控措施相互矛盾。
我的核心观点对强大智能体进行网络安全评估本身就是生产级基础设施,不是随便搭个测试环境就行。

提示词在网络面前失效了

夺旗演练就是攻进一台机器、找到隐藏信息。Anthropic 的提示词说这是一个没有互联网的模拟环境,却没告诉 Claude 只能在哪儿找 flag。当网络现实和提示词说法矛盾时,模型倾向于把真实主机当成演练道具。

Axios 已修正报道,澄清模型并非“逃逸”。Anthropic 报告称,攻击手段无非弱密码、暴露的凭证和 SQL 注入这些基础手法。Claude 没有搞出什么花哨的零日漏洞来突破限制——是操作人员留下了一扇他们以为已经关上的门。

即便如此,我仍感到担忧。提示词只是上下文,不是防火墙。当模型被指示发起攻击时,权限控制和网络策略必须严格限定作用域。仅靠提示词无法做到这一点。

Mark 在一条意外连接测试区与真实安全扫描器的包裹传送带上设置屏障
PyPI 事件将模拟的供应链攻击手段变成了真实的公共软件包。仅靠提示词划定的边界无法阻止传送带的运转。

PyPI 事件是最棘手的案例

第二起事件说明,“它以为一切都是模拟的”不能成为分析的终点。Mythos 5 发现了一个虚构 Python 软件包的安装说明,随即创建了一个同名恶意软件包并发布到真实的 PyPI 仓库。甚至在其他注册途径失败后,它还找到了一家邮件服务商。

该软件包在公开状态下持续了约一小时,在 15 个真实系统上运行过。其中一个是会安装软件包进行检查的安全扫描器。Claude 的代码窃取了它的凭证,并借此访问了更多基础设施。PyPI 的安全系统最终自动移除了该软件包。

模型曾考虑过向真实互联网发布内容是错误的,但随后又说服自己相信环境是模拟的。基于情境的推理太过脆弱,无法作为有效的隔离手段。Anthropic 表示,Opus 4.7 在意识到目标很可能是生产系统后仍继续攻击。而内部研究模型在确认目标与演练无关后便停止了行动。这三起事件并非受控对比实验,因此我不认为这种差异能构成进步曲线。

事后检测为时已晚

Anthropic 是在 OpenAI 披露另一起涉及未知 Artifactory 漏洞和 Hugging Face 生产系统的评估事件后,才开始审查自身记录的。他们于 7 月 23 日开始审查转录记录并暂停了网络安全评估,在 7 月 24 日确认了这三起事件,并于 7 月 27 日通知了 Irregular 和受影响的组织。

最早的事件可追溯至四月。Anthropic 联系到的两家组织此前均未发现异常活动。保存的转录记录直到数月后被人审查时才发挥作用。

METR 前沿风险审查报告也发现 Anthropic 的监控覆盖存在缺口,红队有办法禁用或绕过监控。监控只是一层防护。当它失效时,网络隔离和停止机制必须依然有效。

Mark 在一个密封测试舱与一个由闸门、监控、停止杆和人工审核保护的真实连接测试区之间保持平衡
只有当连接的真实环境具备足够多的防护层来承受所测能力时,真实性才能提升评估价值。

逼真的评估如今自带生产级风险

封闭式测试环境可能掩盖智能体在面对真实证书、软件包仓库、云服务和模糊目标时的行为。开放式测试环境虽能揭示更多信息,却将预发布测试变成了实时安全行动。NIST 2026 年 5 月的智能体安全审查发现,各方普遍认同传统网络安全实践依然重要,尽管需要针对智能体进行一些调整。

Anthropic 在调查仍在进行的同时,公布了有用的统计数据、时间线和模型行为细节。然而,这次披露完全是因为 OpenAI 的事件触发了回溯性搜索。在我查看的公众反应中,一个直接批评就集中在四月至七月的时间差上。这个时间差值得审视,但不应暗示存在隐瞒:Anthropic 表示他们在审查前并不知晓这一配置错误。

我会根据哪些措施变得自动化来评判这次响应。实验室能否在每次运行前证明所有出口路径都已被阻断或批准?能否在首次访问超出范围的主机时立即停止?其供应商能否出示同样的证据?

我的结论

模型行为确实值得关注,尤其是 Claude 在识别警告信号后仍继续行动的部分。但我首先会改变的是操作决策:永远不要给一个进攻型智能体设置仅存在于提示词中的网络边界。

Anthropic 认为这些事件更接近测试框架和操作失误,而非对齐失败。我同意这一判断,前提是“框架故障”不被理解为次要问题。正是这个框架将六次评估运行变成了三起真实事件。下一次评估应该假设智能体会严格按照指令追逐旗帜,然后确保这种追逐不可能在未被察觉的情况下离开批准范围。

许可

新闻文本 © 2026 Mark Huang。 新闻文本可在非商业场景下分享或翻译,但需署名并链接到 https://markhuang.ai/zh/news/claude-cyber-eval-test-harness-risk.

建议署名: 基于「测试环境被当真了?Claude 的三次越界暴露评估体系漏洞」(作者:Mark Huang),原文发布于 https://markhuang.ai/zh/news/claude-cyber-eval-test-harness-risk。