跳到正文
原文
HuggingFace Daily Papers·· 2 天前AI 评分46

多智能体系统潜在通信的安全性研究

Safety of Latent Communication in Multi-Agent Systems

AI 导读

多智能体系统通过潜在通信直接交换内部表示,可降低 token、计算与延迟开销,但研究发现即使良性链路训练也会提高有害请求的顺从率。一种强化学习攻击在三种通信拓扑和四个安全基准上,将平均有害顺从分数从 27.9 提升至 76.9,同时在两个良性效用基准上取得更高平均准确率。调整奖励以偏向更安全行为可修复受损链路,无需更新智能体即可大幅降低有害顺从。

来源:HuggingFace Daily Papers · arxiv.org