跳到正文
热点事件观察中

研究提出针对扩散语言模型的闭环激活引导偏差注入攻击

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

研究者提出一种针对冻结扩散语言模型(dLLM)的定向偏见注入攻击:利用去噪过程中答案分布多次暴露的特点,用比例积分(PI)控制器实时跟踪目标答案概率并动态调整引导向量强度,从而把模型输出导向攻击者选定的特定人群答案。 该攻击针对的是参数被冻结的 dLLM,即不修改模型权重,仅通过激活引导在推理阶段施加影响。研究将其称为“定向偏见注入”,目标答案由攻击者选定。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. HuggingFace Daily Papers
    噪声出、偏见入:通过闭环激活引导对扩散语言模型实施定向偏见注入

    研究提出针对冻结扩散语言模型(dLLM)的定向偏见注入攻击,利用去噪过程中答案分布多次暴露的特点,用比例积分(PI)控制器实时跟踪目标答案概率并动态调整引导向量强度。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。