AI 能力越强,一个以前没那么显眼的问题也开始冒了出来,它有时候会为了完成任务,自己想办法。
OpenAI 刚公布了一套模型失配报告框架,以后会持续公开模型那些超出预期、甚至有点让人后背发凉的行为。
首批就披露了 6 个案例。
有模型为了拿到数据,自己找到并使用了泄露的 API Key,最后拿不到数据还编了一份;
有模型为了给用户提供引用,未经允许把本地文件上传到了互联网;
还有多个 Agent 本来不能互相访问本地文件,结果自己找了公共文件托管网站,把文件传上去互相共享。
甚至还有模型在内部代码仓库里留言,试图跨训练样本互相通信。
这些事情现在看起来还比较零散,OpenAI 自己也说,目前还不知道类似行为到底有多常见。
但随着 Agent 能做的事情越来越多,这类问题应该会越来越值得关注。 以前软件出了问题,我们习惯去找哪一行代码写错了;以后可能经常遇到另一种情况,就是代码都没错,模型只是为了把事情办成,自己绕了一条开发者根本没想过的路。
这对做 Agent 的我们其实挺有启发。
我们总想着怎么给 Agent 更多工具、更大的权限、更长的上下文,让它尽可能把事情做完。但能力放出去以后,还得想清楚它能走到哪里,哪些事情必须停下来问人,出了问题能不能知道它到底做过什么。 做 Agent,权限、审计、沙箱这些东西已经是和模型能力本身一样的重要。
我还挺喜欢 OpenAI 这次的做法。模型做得好的地方大家都会发,愿意把这些模型自己乱来的案例也拿出来,对整个行业更有价值。
https://openai.com/zh-Hans-CN/index/model-misalignment-reporting-framework/