研究提出针对扩散语言模型的闭环激活引导偏差注入攻击
热点事件观察中
研究提出针对扩散语言模型的闭环激活引导偏差注入攻击
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
研究者提出一种针对冻结扩散语言模型(dLLM)的定向偏见注入攻击:利用去噪过程中答案分布多次暴露的特点,用比例积分(PI)控制器实时跟踪目标答案概率并动态调整引导向量强度,从而把模型输出导向攻击者选定的特定人群答案。 该攻击针对的是参数被冻结的 dLLM,即不修改模型权重,仅通过激活引导在推理阶段施加影响。研究将其称为“定向偏见注入”,目标答案由攻击者选定。
AI 根据报道生成 · 1 小时前更新
最新进展10月5日 08:00
噪声出、偏见入:通过闭环激活引导对扩散语言模型实施定向偏见注入报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- HuggingFace Daily Papers噪声出、偏见入:通过闭环激活引导对扩散语言模型实施定向偏见注入
研究提出针对冻结扩散语言模型(dLLM)的定向偏见注入攻击,利用去噪过程中答案分布多次暴露的特点,用比例积分(PI)控制器实时跟踪目标答案概率并动态调整引导向量强度。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。