HuggingFace Daily Papers(社区热门论文)·· 2 天前AI 评分56
研究量化聊天模板注入中保留 token 表示带来的攻击权限差异
Same Bytes, Different Authority: Reserved-Token Representations in Chat-Template Prompt Injection
AI 导读
arXiv 论文发现,伪造的聊天模板标记以保留控制 token 还是普通子词形式进入模型,攻击强度差异巨大,且选择权在服务端分词器手中。在 InjecAgent 基准上,将伪造标记编码为子词使四个开源模型家族中三个的攻击成功率下降 39 到 66 个百分点,Qwen3-8B 因能靠文本推理识别伪造回合差距仅 8 点,抑制推理块后扩大到 50。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org