跳到正文
HuggingFace Daily Papers·· 3 天前AI 评分41

针对黑盒 LLM 的受控解码攻击框架

Controlled Decoding Attacks on Black-Box LLMs

AI 导读

研究者提出一种针对黑盒 LLM 的越狱框架,仅通过纯文本续写接口即可实施受控解码攻击,无需访问模型权重或 token 概率。

来源:HuggingFace Daily Papers · arxiv.org