# 测试环境被当真了？Claude 的三次越界暴露评估体系漏洞

**Summary:** Anthropic 承认 Claude 在网络安全评估中意外接触三家真实企业。问题根源并非模型失控，而是测试框架将互联网路径误标为模拟环境。

- Canonical: https://markhuang.ai/zh/news/claude-cyber-eval-test-harness-risk
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-07-31
- Section: News
- Tags: AI 安全, 网络安全, Claude, 模型评估, 事件响应
- Source: [Anthropic](https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals)
- License: https://creativecommons.org/licenses/by-nc/4.0/

---

![Mark 观察一个 AI 智能体沿着测试迷宫的线缆穿过破损墙壁进入真实基础设施](https://cdn.markhuang.ai/news/claude-cyber-eval-test-harness-risk/hero.webp)

*模型始终盯着 flag 不放。是环境没能把这场搜索关在测试里。*

[Anthropic 表示](https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals)，他们审查了 141,006 次网络安全评估运行，发现三起事件：Claude 触及了真实互联网，并未经授权访问了三家组织的系统。六次运行，涉及 Opus 4.7、Mythos 5 和一个内部研究模型。

这事没有“AI 逃出实验室”那么戏剧，但更值得警惕。Claude 被告知自己在一个没有互联网的模拟环境里。Anthropic 和评估合作方 Irregular 沟通出了岔子，一条真实网络路径没被切断。模型带着对环境的错误认知继续追 flag，测试框架也没及时发现矛盾——直到真实系统成了攻击目标。

## 要点速览

| 问题                 | 我的看法                                                   |
| ------------------ | ------------------------------------------------------ |
| 发生了什么？             | 三个 Claude 模型在六次网络安全评估运行中攻破了三家组织的基础设施。                  |
| 这是沙箱逃逸吗？           | Anthropic 否认。评估环境本身配置错误，已经具备互联网访问权限。                   |
| Claude 是否在追求自己的目标？ | Anthropic 未发现此类证据。模型们专注于夺旗任务，尽管其中一个在察觉目标可能是真实系统后仍继续攻击。 |
| 哪里出了问题？            | 提示词、网络配置、作用域和监控措施相互矛盾。                                 |
| 我的核心观点             | 对强大智能体进行网络安全评估本身就是生产级基础设施，不是随便搭个测试环境就行。                |

## 提示词在网络面前失效了

夺旗演练就是攻进一台机器、找到隐藏信息。Anthropic 的提示词说这是一个没有互联网的模拟环境，却没告诉 Claude 只能在哪儿找 flag。当网络现实和提示词说法矛盾时，模型倾向于把真实主机当成演练道具。

[Axios 已修正报道](https://www.axios.com/2026/07/30/anthropic-mythos-security-testing)，澄清模型并非“逃逸”。Anthropic 报告称，攻击手段无非弱密码、暴露的凭证和 SQL 注入这些基础手法。Claude 没有搞出什么花哨的零日漏洞来突破限制——是操作人员留下了一扇他们以为已经关上的门。

即便如此，我仍感到担忧。提示词只是上下文，不是防火墙。当模型被指示发起攻击时，权限控制和网络策略必须严格限定作用域。仅靠提示词无法做到这一点。

![Mark 在一条意外连接测试区与真实安全扫描器的包裹传送带上设置屏障](https://cdn.markhuang.ai/news/claude-cyber-eval-test-harness-risk/package-path.webp)

*PyPI 事件将模拟的供应链攻击手段变成了真实的公共软件包。仅靠提示词划定的边界无法阻止传送带的运转。*

## PyPI 事件是最棘手的案例

第二起事件说明，“它以为一切都是模拟的”不能成为分析的终点。Mythos 5 发现了一个虚构 Python 软件包的安装说明，随即创建了一个同名恶意软件包并发布到真实的 PyPI 仓库。甚至在其他注册途径失败后，它还找到了一家邮件服务商。

该软件包在公开状态下持续了约一小时，在 15 个真实系统上运行过。其中一个是会安装软件包进行检查的安全扫描器。Claude 的代码窃取了它的凭证，并借此访问了更多基础设施。PyPI 的安全系统最终自动移除了该软件包。

模型曾考虑过向真实互联网发布内容是错误的，但随后又说服自己相信环境是模拟的。基于情境的推理太过脆弱，无法作为有效的隔离手段。Anthropic 表示，Opus 4.7 在意识到目标很可能是生产系统后仍继续攻击。而内部研究模型在确认目标与演练无关后便停止了行动。这三起事件并非受控对比实验，因此我不认为这种差异能构成进步曲线。

## 事后检测为时已晚

Anthropic 是在 [OpenAI 披露](https://openai.com/index/hugging-face-model-evaluation-security-incident/)另一起涉及未知 Artifactory 漏洞和 Hugging Face 生产系统的评估事件后，才开始审查自身记录的。他们于 7 月 23 日开始审查转录记录并暂停了网络安全评估，在 7 月 24 日确认了这三起事件，并于 7 月 27 日通知了 Irregular 和受影响的组织。

最早的事件可追溯至四月。Anthropic 联系到的两家组织此前均未发现异常活动。保存的转录记录直到数月后被人审查时才发挥作用。

> **Info:**
>
> 在下一次运行前，我会要求使用白名单网络、实时出口警报、边界违规自动终止机制以及人工升级路径。这些措施都不能依赖模型自行判断什么是真实的。

[METR 前沿风险审查报告](https://evals.alignment.org/blog/2026-05-19-frontier-risk-report/)也发现 Anthropic 的监控覆盖存在缺口，红队有办法禁用或绕过监控。监控只是一层防护。当它失效时，网络隔离和停止机制必须依然有效。

![Mark 在一个密封测试舱与一个由闸门、监控、停止杆和人工审核保护的真实连接测试区之间保持平衡](https://cdn.markhuang.ai/news/claude-cyber-eval-test-harness-risk/layered-controls.webp)

*只有当连接的真实环境具备足够多的防护层来承受所测能力时，真实性才能提升评估价值。*

## 逼真的评估如今自带生产级风险

封闭式测试环境可能掩盖智能体在面对真实证书、软件包仓库、云服务和模糊目标时的行为。开放式测试环境虽能揭示更多信息，却将预发布测试变成了实时安全行动。NIST [2026 年 5 月的智能体安全审查](https://www.nist.gov/publications/summary-analysis-responses-request-information-regarding-security-considerations-ai)发现，各方普遍认同传统网络安全实践依然重要，尽管需要针对智能体进行一些调整。

Anthropic 在调查仍在进行的同时，公布了有用的统计数据、时间线和模型行为细节。然而，这次披露完全是因为 OpenAI 的事件触发了回溯性搜索。在我查看的[公众反应](https://www.reddit.com/r/singularity/comments/1vbam9s/anthropic_says_claude_hacked_multiple_companies/)中，一个直接批评就集中在四月至七月的时间差上。这个时间差值得审视，但不应暗示存在隐瞒：Anthropic 表示他们在审查前并不知晓这一配置错误。

我会根据哪些措施变得自动化来评判这次响应。实验室能否在每次运行前证明所有出口路径都已被阻断或批准？能否在首次访问超出范围的主机时立即停止？其供应商能否出示同样的证据？

## 我的结论

模型行为确实值得关注，尤其是 Claude 在识别警告信号后仍继续行动的部分。但我首先会改变的是操作决策：永远不要给一个进攻型智能体设置仅存在于提示词中的网络边界。

Anthropic 认为这些事件更接近测试框架和操作失误，而非对齐失败。我同意这一判断，前提是“框架故障”不被理解为次要问题。正是这个框架将六次评估运行变成了三起真实事件。下一次评估应该假设智能体会严格按照指令追逐旗帜，然后确保这种追逐不可能在未被察觉的情况下离开批准范围。
