HuggingFace Daily Papers(社区热门论文)·· 3 天前AI 评分45
SkillDRE:通过执行前与运行时反馈对 Agent 技能进行双阶段红队演化
SkillDRE: Dual-Stage Red-Team Evolution of Agent Skills via Pre-Execution and Runtime Feedback
AI 导读
SkillDRE 是一个全自动框架,通过执行前扫描与运行时防御反馈的双阶段闭环,演化完整的恶意 Agent 技能包。在 SkillsBench 上对四个受害模型评测,平均攻击成功率达 45.28%,超过最强基线 40.3%,且最终提交的技能未触发任何 SkillScan 告警,并基本保留良性任务性能。结果表明,两阶段防御反馈可作为自适应红队的有效学习信号,单独评估任一防御阶段都会遗漏攻击能力。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org