跳到正文
原文
英国 AI Security Institute:Blog(网页)·· 2025-08-07精选AI 评分65

英国 AISI 开源 Inspect Sandboxing Toolkit 用于安全的 AI 智能体评估

The Inspect Sandboxing Toolkit: Scalable and secure AI agent evaluations

AI 导读

英国 AI Security Institute 开源 Inspect Sandboxing Toolkit,一套用于安全运行智能体 AI 评估的沙箱插件。

推荐理由

原文给出三个沙箱插件和三层隔离协议,并说明架构如何分离推理与工具执行,读者可据此选择评估隔离方案。

正文 · AI 翻译

我们如何在不冒现实世界危害风险的情况下测试 AI 系统的危险能力? 

模型能力越强,安全评估就越困难。当一个智能体能够执行任意代码并与关键系统交互以获取敏感信息时,在没有充分防护措施的情况下运行评估可能会使关键系统面临风险。 

沙箱是用于测试和监控 AI 行为的隔离环境。当我们让模型访问工具(例如用于编写代码)时,我们会在沙箱中执行该操作,以限制模型对外部系统和数据的访问。这使我们能够评估其能力,而不会暴露敏感资源。今天,我们发布了我们的工具包,用于安全地运行智能体 AI 评估。 

我们为什么构建 Inspect 沙箱工具包

沙箱是软件开发中的一种常见做法,用于限制潜在不可信进程的资源和影响。在评估 AI 智能体时,对指令进行适当的沙箱隔离至关重要,因为这些指令直接来自被评估的智能体。

运行不可信进程是软件工程中一个成熟的问题——但将沙箱应用于 AI 智能体评估尤其带来了独特的挑战。我们需要评估 AI 智能体与任意系统和服务交互以完成复杂、多步骤任务的能力。但很难提前预测模型在此过程中可能需要访问哪些工具、它会有多熟练,以及它是否会试图追求不对齐的目标。 

虽然已有若干可用于 AI 评估的沙箱,但我们发现现有解决方案存在重要局限。例如,它们可能允许安全执行 Python 代码,但会阻止智能体访问互联网或文件系统。 

由于没有一种解决方案能提供全面智能体评估所需的安全性、可扩展性和灵活性,我们构建了一个能够满足这些需求的方案。

我们的解决方案:Inspect 原生的沙箱插件

Inspect 沙箱工具包是一组构建并开源的插件,用于适配先进 AI 模型的各种智能体评估环境,并附有关于如何选择沙箱的文档。 

我们希望构建一种原生Inspect的机制,这是我们用于能力评估的开源框架,正被 AI 安全与安保社区越来越多地采用。该工具包和文档使团队能够针对每次评估的具体风险状况讨论并实施适当的缓解措施,促进高级责任负责人和技术负责人之间逐案决策。

我们一直在 AISI 内部使用这个沙箱工具包的每一个部分。我们还帮助美国 AI 标准与创新中心(CAISI)、模型评估与威胁研究(METR)和Apollo Research为其自身的智能体评估采用了这些开源沙箱提供方。

Inspect 处理沙箱的一个显著特点是,将模型执行或推理与进行工具调用的环境分离。Inspect 本身位于沙箱之外,并根据被测试模型的请求向其中发送命令,以执行代码或函数。 

这种架构提供了: 

  1. 安全性:命令从沙箱外部发出。沙箱内发生的一切都是被明确允许并由 Inspect 发起的。未来,我们可能面临沙箱内智能体利用注入攻击试图访问 Inspect 的 Python 代码的风险。我们正在积极考虑这一场景及相关缓解措施。
  1. 模块化:隔离的脚手架服务器让你可以轻松替换功能和权限,打造适合你所需评估的环境。
  1. 可扩展性:你的模型能力越强——评估的风险越高——你的沙箱就需要越安全。Inspect-Native 让你可以轻松调整脚手架,以创建具有不同资源约束的环境。

我们的沙箱工具包可应对智能体评估中的多种风险场景。当前主要关注的是智能体意外破坏基础设施。然而,我们越来越多地运行那些刻意测试智能体逃逸沙箱能力的评估——这与我们的网络和自主性风险领域相关。

展望未来,我们还在研究针对可能主动攻击其沙箱的潜在失准模型的防御措施。

‍

工具包

我们的工具包包含三个 Inspect 插件:

  1. Docker Compose:用于管理多容器评估场景的工具,让你可以轻松开始智能体评估。
  1. Kubernetes 插件:允许你模拟更复杂的环境,并根据资源需求自动启动或关闭容器。
  1. Proxmox 插件:为高风险评估提供强大的虚拟机(VM)隔离。

只提供工具而不提供何时使用它们的指导可能毫无帮助,尤其是在智能体评估这样的新兴领域。因此,我们还创建了一份配套的沙箱协议 ,帮助用户了解适合其评估的沙箱级别,并提供如何使用我们的三个工具进行端到端设置的指南。

我们的沙箱协议沿三个不同的维度对隔离进行分类:工具(限制模型对某些工具的访问,和/或执行代码的能力)、主机(防止模型逃逸或破坏主机系统)以及网络(控制模型通过网络与外部系统——包括互联网——的交互)。

我们的愿景

我们的目标是促成一个繁荣的生态系统,实现安全、可扩展且可分析的人工智能评估。

我们的工具包让研究人员能够安全地测试能力极强的智能体,并提供一个可在整个人工智能评估社区中使用的标准化框架。其可扩展的安全措施旨在应对人工智能系统日益强大时出现的新兴威胁。

希望安全地评估你的人工智能智能体?查看我们的完整文档,开始使用 Inspect 的沙箱工具包产品。

来源:英国 AI Security Institute:Blog(网页) · aisi.gov.uk