跳到正文
原文
HuggingFace Daily Papers·· 3 天前AI 评分34

自注意力在竞争下的检索容量

Retrieval Capacity of Self-Attention Under Competition

AI 导读

研究通过保留每个注意力头、层和查询中注意力权重最高的 token 并测量 NLL 增幅,估算语言模型维持损失容差所需的"有效注意力集合"大小。基于注意力的选择显著优于随机选择,扩展上下文会增大所需集合大小,而重归一化保留权重可大幅降低该规模。

来源:HuggingFace Daily Papers · arxiv.org