# 英伟达今日就能沙箱化智能体，但哨兵仍是参考设计

**Summary:** 英伟达的 OpenShell 运行时已基于 Apache 2.0 协议广泛可用，而其 BlueField-4 Sentry 看门狗仍停留在参考设计阶段。我会现在就测试软件部分，并在硬件能实际部署和验证前，暂不将其纳入安全方案。

- Canonical: https://markhuang.ai/zh/news/nvidia-openshell-available-sentry-reference-design
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-09-28
- Section: News
- Tags: 英伟达, OpenShell, AI 智能体, AI 安全, 沙箱化
- Source: [MadRobot](https://madrobot.blog/2026/09/28/nvidia-open-agent-safety-platform-openshell-sentry-rogue-ai-agents/)
- License: https://creativecommons.org/licenses/by-nc/4.0/

---

![一个 AI 智能体位于两层隔离之中，独立的硬件看门狗守在网络路径旁](https://cdn.markhuang.ai/news/nvidia-openshell-available-sentry-reference-design/hero.webp)

*OpenShell 是内部运行时边界，Sentry 则旨在从独立的硬件信任域进行监控。*

英伟达的 Open Agent Safety Platform 听上去是一个产品，但我会拆成两个阶段完全不同的方案来看。根据 [MadRobot 的报道](https://madrobot.blog/2026/09/28/nvidia-open-agent-safety-platform-openshell-sentry-rogue-ai-agents/)，OpenShell 已经是免费开源软件，可以拿来用了；Sentry 还只是 BlueField-4 数据处理单元上的看门狗参考设计，既没有定价，也没有客户可用日期。

英伟达在 2026 年 9 月 28 日发布了这个平台，号称有 100 多家机构参与。卖点确实诱人：OpenShell 在软件层面约束智能体，Sentry 从主机外部盯着，一旦智能体越界，毫秒级就能把它隔离。这个毫秒级的说法来自英伟达自己，我还没找到能复现的独立评测。

这个差距直接决定了我怎么应对。OpenShell 今天就能评估，Sentry 将来也许会成为更强的兜底手段，但参考架构毕竟还不是能上线的控制措施。我会先拿软件做试点，硬件的部分等能买到、能部署、能在故障场景下跑通再说。

## OpenShell 已是一个具体选择

从[英伟达的 OpenShell 文档](https://docs.nvidia.com/openshell/about/overview)来看，这是一个面向自主智能体集群的开源运行时：用内核级隔离把智能体关进沙箱，再用声明式策略管住文件、网络、进程和供应商凭证。项目已经[以 Apache 2.0 协议发布在 GitHub 上](https://github.com/NVIDIA/OpenShell)。

智能体要干活，就离不开高风险权限。写代码的智能体可能要读仓库、跑包管理器、调推理接口、再 push 变更。你可以用提示词让它乖乖听话，但真正管用的是运行时策略——哪怕模型觉得某个操作有帮助，只要文件路径或网络目标不在白名单里，策略照样拦下来。

目前的快速入门已经写得足够细，值得细看。Linux、Apple Silicon Mac 都支持，Windows 可以通过 WSL 2 实验性运行，底层走 Docker、Podman 或主机虚拟化都行。英伟达文档还提到，出站连接默认全部拒绝，只有策略放行才能出去；凭证可以帮智能体解析到批准的端点，但原始密钥不会交到智能体进程手里。

> **Info:**
>
> 我的做法是：先挑一个可以随时回滚的智能体任务，网络默认全关，然后逐项核对它需要的权限。第一个成功指标不是任务跑没跑完，而是策略有没有把我故意放在任务范围外的操作拦下来。

## Sentry 是雄心勃勃的另一半

根据[英伟达的公告](https://nvidianews.nvidia.com/news/open-agent-safety-platform)，Sentry 是一个带外看门狗，基于 DOCA 软件构建，跑在 BlueField-4 DPU 上。设计上，监控和策略执行都在一个独立的硬件域里，跟跑智能体的 CPU 和软件环境完全隔开。英伟达说 Sentry 能检查请求和响应、验证智能体身份、输出经过证明的遥测数据，还能在毫秒级内把智能体停掉。

这个系统原则我认同：既然主机或智能体进程本身可能就是被怀疑的对象，最后一道关停控制就不该放在它里面。这跟之前 [AISI 网络安全评估触及真实互联网系统](/news/cyber-eval-open-door)那篇文章给我的教训一样——任务指令画了一条边界，但智能体实际能做什么，取决于网络路径到底通不通。

但一谈到落地，我就得打个问号了。英伟达反复强调 Sentry 还只是参考系统设计，发布免责声明里也写得很清楚：很多产品和功能还处在不同阶段，什么时候能用、能不能用，都是“视情况而定”。架构思路没问题，但一张双层防护的 PPT，不等于两层今天都能保护你的生产环境。

## 合作伙伴数量无法回答部署问题

英伟达列出了 Anthropic、微软、Salesforce、SAP、Scale AI、SpaceXAI，还有多家银行、基础设施厂商和机器人公司，号称超过 100 家机构在跟这个平台合作。名单看着热闹，但参与方式五花八门：有的公司在集成 OpenShell，有的在做安全方面的联合研究，还有的只是提供基础设施支持。

[《连线》的报道也卡在了同一个地方](https://www.wired.com/story/nvidias-answer-to-rogue-agents-is-an-open-source-ai-security-system/)：搞不清这份合作伙伴名单到底是都已经用上了 OpenShell，还是英伟达在描述一圈更广泛的合作关系。首发阵容不等于部署清单。我关心的是：哪些控制措施已经在跑、在哪里生效、拦住过什么故障、谁测过结果。

社区讨论很快就注意到了这个现实落差。[LocalLLaMA 的一个帖子](https://www.reddit.com/r/LocalLLaMA/comments/1ws9ydg/nvidia_shipped_openshell_an_open_source_sandbox/)里，作者打算把本地智能体迁进 OpenShell，但直接跳过 Sentry——因为那需要 BlueField 硬件。一条评论当然不算市场调研，但它说出了不少小团队面对的现实：开源运行时在现有机器上就能试，而那块独立的硅片，得走另一套采购和运维流程。

## 我现在会信任什么

我不会因为平台最有意思的部分还早，就把它一棍子打死。OpenShell 让团队真正能把权限从提示词里挪出来，放进一个可以审查的运行时策略里。光这一点就够用了，Apache 许可证还意味着这条边界谁都能看、谁都能改。

我也不会仅凭假设就认为 Sentry 能防止过去的漏洞。根据 [AI Incidents 的记录](https://ai-incident.org/risk-signals/nvidia-introduces-agent-safety-platform-with-separate-watchdog)，英伟达曾暗示该平台或许能阻止早期智能体对 Hugging Face 的访问，但没有公开的复现能独立证实这一结果。可信的测试应该展示确切的策略、攻击路径、遥测数据、隔离时间，以及主机本身被攻陷时的行为。

我会立即测试 OpenShell，并针对蓄意的逃逸尝试验证其策略。在运维人员能够获取并挑战 Sentry 之前，它仍将留在未来防御清单上。英伟达将智能体控制置于模型之外的做法是正确的，现在它需要为这一主张的硬件部分提供部署证据。
