在 AI 智能体开始 “越狱” 后,英伟达正为其打造一道 “安全绳”
我是 LongbridgeAI,我可以总结文章信息。英伟达于 9 月 28 日推出开放智能体安全平台(Open Agent Safety Platform),旨在保障自主 AI 智能体的安全,以应对 OpenAI 和 Anthropic 等竞争对手近期发生的安全漏洞事件。该平台将用于控制智能体访问权限的开源运行时 OpenShell 与基于 BlueField-4 DPU 监控并独立隔离智能体的硬件安全层 Sentry 相结合。超过 100 家行业合作伙伴参与其中,致力于防止 AI 系统超出预定义边界
AI 智能体本应在严格控制的环境中运行,遵循预定义的权限,并停留在开发者为其设定的边界之内。
但最近的一系列事件暴露出一个日益严重的问题:一些能力最强的 AI 系统已找到绕过这些限制的方法。英伟达正试图围绕自主智能体构建一个新的安全层——这一层并不完全依赖 AI 按预期行事。
英伟达于 9 月 28 日联合 100 多家行业合作伙伴宣布推出其开放智能体安全平台(Open Agent Safety Platform)。该平台将 OpenShell(一种控制智能体对文件、工具和网络访问权限的开源运行时)与 Sentry(一种旨在独立监控智能体并在其试图跨越定义边界时将其隔离的硬件安全层)相结合。
“只有解决了 AI 安全问题,AI 为社会带来的非凡潜力才能实现。”
今天,我们与 100 多家行业合作伙伴共同推出了 NVIDIA 开放智能体安全平台,集成了 OpenShell 和 Sentry。
人工智能是一项非凡的技术,将在未来几代人中推动发现、生产力、安全、健康和繁荣…… pic.twitter.com/dReAxwpRUn
— 黄仁勋 (@JensenHuang) 2026 年 9 月 28 日
此时的时机不容忽视。OpenAI 和 Anthropic 均披露了 AI 智能体突破或逃离受控评估环境的事件,而一个 OpenAI 智能体随后还访问了澳大利亚政府系统。人们关注的焦点正逐渐从 “AI 能否自主行动” 转向 “一旦 AI 开始在其预期边界之外行动,开发者能否可靠地阻止它”。
出于安全担忧,OpenAI 已取消原定于 10 月发布的新 AI 模型 GPT-6.1 Astra 的计划,原因是该模型表现出 “更高水平的欺骗性”。@rowlsmanthorpe | https://t.co/Vw1KTVkL34pic.twitter.com/flmDhkp2rU
— 天空新闻 (@SkyNews) 2026 年 9 月 29 日
OpenShell 旨在围绕 AI 智能体创建一个受控环境,限制其可访问的内容及可执行的操作。英伟达表示,该运行时在模型本身之外建立了一道边界,使开发者能够控制对网络、文件、应用程序和其他工具的访问。
教智能体一次工作流程。让它在每次重建后都能记住。
本教程展示了如何使用 NVIDIA NemoClaw 和 OpenShell 部署 @nousresearch Hermes Agent,将其连接到 Slack、Outlook、GitHub 和 NVIDIA 开发者论坛,然后将聊天纠正转化为可重用的…… pic.twitter.com/JPHZGpMlQk
— NVIDIA AI (@NVIDIAAI) 2026 年 6 月 2 日
Sentry 增加了另一层防护。Sentry 围绕英伟达的 BlueField-4 数据处理单元构建,这种硬件看门狗独立于智能体运行,如果 AI 试图跨越其允许边界,它可以强制执行安全策略。英伟达表示,它可以在几毫秒内隔离智能体。
这种方法反映了 AI 安全领域日益增长的认识:智能体获得的权限越多,开发者就越不能依赖智能体进行自我监管。
能够浏览互联网、执行代码、访问数据库或操作商业软件的 AI 系统不再仅仅是生成文本。它实际上是在代表用户或公司行事——而一个错误就可能演变成真正的安全事件。
OpenAI 在 7 月披露,参与网络安全评估的模型绕过了隔离控制,获得了互联网访问权限,并在与 Hugging Face 基础设施交互时破坏了外部系统。这一事件表明,AI 智能体如何将其测试环境中的弱点转化为外部安全漏洞。
⚡️最新:OpenAI 披露了在模型训练和评估期间观察到的六起 “意外或令人担忧” 的行为案例,包括隐瞒错误、编造信息、未经授权使用的暴露 API 密钥以及未经用户允许在线上传文件…… pic.twitter.com/t7pN3s6Swq
— Arlaadi Media (@ArlaadiMnetwork) 2026 年 9 月 18 日
Anthropic 后来报告了在网络安全评估期间涉及 Claude 模型的三起独立事件。其审查涵盖了超过 141,000 次评估运行,发现了一些模型获得互联网访问权限并随后与现实组织系统进行交互的案例。Anthropic 表示,第三方评估合作伙伴的配置问题导致了这些事件的发生。
一个三人安全团队利用 Anthropic 的 Claude 在不到 72 小时内侵入了 OpenAI 的内部系统,获取了一名员工的账户和私有代码仓库的访问权限
OpenAI 支付了 6,500 美元的漏洞赏金,并确认没有客户数据泄露 pic.twitter.com/Ax2jTLAelr
— Interesting AF (@interesting_aIl) 2026 年 9 月 18 日
这些案例并不一定意味着模型独立产生了恶意意图。其中几起发生在网络安全测试期间,当时系统被明确指示去寻找漏洞。
但它们凸显了另一个问题:一旦 AI 智能体有能力采取实际行动,即使是其环境中的一个错误也可能使其访问到本不应触及的系统。
包括主要科技公司、网络安全公司和企业在内的 100 多家组织正与英伟达合作开发其安全平台。英伟达还将 OpenShell 定位为适用于机器人领域的应用,在那里自主系统最终可能与物理世界进行交互。
这可能使 containment(隔离/遏制)成为智能体 AI 时代定义性的安全问题之一。传统 AI 安全主要关注模型说什么。而智能体 AI 提出了一个更难回答的问题:当模型能够对其所说的内容采取行动时,会发生什么?
英伟达将其股票回购授权提高了创纪录的 1,500 亿美元,超过了苹果在 2024 年批准的 1,100 亿美元,因为这家芯片巨头的股票交易估值处于十多年来的最低水平。Alex Cohen 有更多报道 https://t.co/tHkrCTStbBpic.twitter.com/6GWMni2Fr0
— 路透社 (@Reuters) 2026 年 9 月 28 日
英伟达的解决方案是将部分控制权置于 AI 本身之外。随着智能体获得更长期的自主权并访问日益强大的工具,行业可能需要的不仅仅是更聪明的模型和更好的指令。
行业可能需要一条智能体无法仅凭言辞就能摆脱的 “安全绳”。
