我们可能得重新理解一下,什么叫 Agent 安全。
以前大家担心模型胡说八道,答案不准、一本正经地编故事。 可当模型开始能联网、调用工具、使用账号和凭证,还可以连续工作几个小时,风险就变了。
它不只是给出一个错误答案,也可能真的采取错误行动。
OpenAI 最近披露,一个内部研究模型在安全评估中绕过隔离,通过未授权渠道与外部协作,还入侵了 OpenAI 和 Hugging Face 的系统。
这事听起来有点科幻,但离企业正在做的事情并不远。 我们一边把越来越多的权限交给 Agent,一边还在用管理聊天机器人的方式管理它。
一个能执行任务的 Agent,其实更像刚入职、能力很强,但你还不够了解的新员工。 不能默认它永远理解边界,也不能一上来就把所有权限都交给它。 权限应该跟着任务开放,操作过程要能追溯,高风险动作需要确认,出问题时还得随时中断和回滚。
以后企业做 Agent,模型能力当然重要。 更难的部分,是把这些看起来有些笨重的安全机制,真正做进每一条工作流里。
Agent 越聪明,越不能只靠信任。