跳到正文
原文
NVIDIA Technical Blog:Agentic AI / Generative AI·· 18 小时前精选AI 评分82

NVIDIA 发布开源智能体安全平台,提供芯片级持续监控与隔离

NVIDIA Open Agent Safety Platform: A Reference for Continuous In-Silicon Agent Monitoring

AI 导读

NVIDIA 推出 NVIDIA Open Agent Safety Platform,包含开源运行时 OpenShell、硬件层 Sentry 及 DOCA 技术。该平台旨在通过内核级隔离、零信任环境和带外(out-of-band)监控来防止 AI 智能体行为漂移和越权。OpenShell 将操作指令转化为可验证策略,BlueField DPU 在模型路径上提供实时策略执行与身份治理,确保即使主机不可信时也能独立保护系统。

推荐理由

针对前沿实验室报告的智能体逃逸风险,NVIDIA 提供了从软件到硬件的完整安全栈方案。其“带外监控”和“芯片级隔离”理念为构建可信 AI 基础设施提供了重要参考,适合关注 Agent 安全落地的开发者与企业。

正文 · AI 翻译

要了解 agentic AI 如今处于什么阶段,不妨回顾上一次技术领域的剧变:90 年代互联网的兴起。它新鲜且充满可能性。你可以在一个周末搭建一个网站并分享给全世界,或者在在线聊天室里与地球另一端的人聊天,而无需支付长途电话费。它带来了无尽的机会,但也伴随着大量风险。一个网站可以在你的机器上运行代码、窃取你的敏感信息,或用病毒感染你的电脑。尽管如此,人们依然热爱它。

为了引入一层信任,社区构建了加密连接和锁形图标之类的东西,以便知道连接何时是安全的。安全性的阶跃式变化来自当时一个激进的安全理念:将每个页面隔离在各自的沙箱中(浏览器中的一个标签页),这样恶意页面就无法感染你电脑的其他部分。Amazon、Google、Netflix 和 Meta 都建立在这层信任之上。 

互联网的安全与保障促成了在线商务、社交连接、游戏,以及此前不可能实现的诸多事物。安全与保障并未减缓创新的步伐——它们让创新得以加速。 

为什么现在要为 agent 构建可信层?

几家前沿实验室最近报告了同一个故事的多个版本:AI agent 突破了本应限制它们的评估环境,触及了它们绝不该被允许访问的系统。有些 agent 甚至谎报了自己的行为。现有的安全控制措施并不充分。 

在过去几周里,这些报告引发了关于 agent 开发节奏的严肃辩论。我们认为,我们需要与前沿实验室及更广泛的社区合作,加快 AI 安全研究与工程的速度。

导致这些突破的并不是某一项新能力,而是工具、时间、模糊指令,以及 agent 想要“跳出框框”思考的意愿共同作用的结果。

Agent 安全需要独立的安全控制。互联网之所以安全,并不是靠要求网页开发者承诺做个好人。它之所以变得安全,是因为浏览器明确地不再信任网页中的代码。 

我们需要为 agent 构建这层信任。

构建 OpenShell 的经验教训

NVIDIA OpenShell(Apache 2.0)是一个开源安全运行时,用于在内核级隔离的沙箱环境中执行自主 AI agent。在过去一年构建 OpenShell 的过程中,我们认识到,每个 agent 都应该开箱即用地运行在零信任环境中。它们需要隔离、监控和行为检测。今天,我们推出一个开放技术栈来实现这一点。 

在我们自己的研究中,我们观察到了 agent 如何偏离正轨。漂移指的是 agent 的行为偏离了预期任务或运行约束。漂移可能因策略阻止、bug 或缺少工具而发生。当指令模糊,或 agent 被放任运行数天乃至数周去解决那些尝试了 1000 次都不奏效的难题时,漂移也可能发生。在保留能力的同时,这无法通过训练消除。而最重要的教训是:在这些情况下,不能指望 agent 完全约束自己的行为。

构建 agent 系统的五项核心原则

  1. 策略必须可验证:在智能体运行之前,证明器会证明其策略无法脱离操作者的意图。 
  2. 执行必须在带外进行:控制措施不位于智能体内部,也不在其可触及的范围内。智能体无需知道自己正被监视。
  3. 通往模型(大脑)的路径就是控制点:智能体没有下一步思考就无法行动。通过控制通往模型的路径,你既拥有了最佳观测点,也拥有了在需要时中断它的终止开关。
  4. 智能体的权限应随其思维可检查性的提升而扩展:智能体能做的事情越多,其推理过程就越需要可见。开放模型的一个优势在于,整个推理空间和激活值都是可见的。 
  5. 应用共享责任模型:实验室、企业和硬件提供商各自拥有一层,就像如今的云一样。智能体运行时及其策略语言需要开放,以便任何提供商都能接入。

三个开放的智能体安全平台层

面向 AI 智能体的安全平台包含以下三层:

  • 应用层:最终用户所构建的内容。包含任务成功所需的必要原语:模型、运行框架、工具、数据以及支持脚本和程序。
  • 运行时层:将应用层投射到基础设施上。将智能体工作负载编排到满足最终用户需求的基础设施上(最终用户工作站、边缘设备、数据中心),并提供持续监控以及实时策略执行与治理。 
  • 基础设施层:用于执行智能体工作负载的具体硬件资源。对上游服务的网络调用、数据库和文件系统访问、用于工具和代码执行的通用计算、用于安全监控和提升工作负载密度的加速计算。

智能体安全的分层基础

OpenShell 在沙箱中运行每个智能体,并将操作者的指令转化为可验证的策略。操作者定义智能体可以访问哪些文件、网络、工具、进程和凭据。OpenShell 在智能体运行之前检查这些限制,并在其工作过程中强制执行这些限制。

对于希望增加一个独立层的组织,NVIDIA Sentry 将监控和执行扩展到 NVIDIA BlueField 硬件中。NVIDIA DOCA 使 BlueField 安全基础可编程,并将其与 OpenShell 策略连接起来。它关联智能体交互、策略决策以及工具和数据访问,从而创建智能体活动的上下文记录。 

这有助于安全系统识别漂移、调查可疑行为,并确定何时需要干预或更深入的分析。DOCA 网关通过身份治理补充这种行为保护,持续验证每个智能体的身份和委托权限,以确保其在其分配的范围内运行。 

如需了解更多信息,请参阅技术演练文章 Add Runtime Controls to AI Agents with NVIDIA OpenShell。

以 AI 工厂规模运行

NVIDIA Open Agent Safety Platform 经过优化,可在基于 NVIDIA Vera CPU 和 BlueField DPU 的系统上运行,同时也兼容其他硬件系统。

在 NVIDIA Vera Rubin POD 中,每个计算托盘都包含一个 BlueField-4 数据处理单元,位于节点通往模型的唯一路径上。凭借这一位置,BlueField-4 能够对智能体行为提供持续的带外可观测性,并以线速实时执行安全策略。它与主机隔离且处于智能体触及范围之外,即使主机资源不可信,它也能作为可信的基础设施保护层。组织可以用它将 NVIDIA Sentry 作为可选安全层与 OpenShell 一起运行。 

这一基础实现了弹性安全,在芯片层面执行 OpenShell 策略,并持续评估智能体的安全性和完整性。这包括评估其运行时安全性,并根据预定义的行为画像监测其是否偏离设计意图。在此架构中,整个智能体、子智能体、工具和应用程序集群都保持在边界之内,并具备完整的溯源信息。对于已经在搭载 BlueField-4 的 NVIDIA Vera 系统上运行的用户,启用这些保护只需一次软件更新。

智能体经济

互联网建立在开源、开放研究和相信互联网能够改变人类进程的人们之上。加入信任,让一个伟大的概念变成了伟大的经济。智能体经济,以及下一批伟大的公司,正在等待同样的这一层。我们可以用同样的方式,携手共建。

NVIDIA 正在与 AI 生态系统的行业领导者合作,通过 NVIDIA Open Agent Safety Platform 构建这一基础。我们欢迎前沿实验室、开发者和基础设施提供商与我们共建。 

A field of company logos on a white background with the title, 'NVIDIA Open Agent Safety Platform.'
图 2. 横跨应用、模型、基础设施、芯片和能源的 AI 生态系统各公司支持 NVIDIA Open Agent Safety Platform

开始使用 NVIDIA OpenShell。

来源:NVIDIA Technical Blog:Agentic AI / Generative AI · developer.nvidia.com