跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 1 天前AI 评分34

大语言模型注意力机制演进综述:机制、权衡与新兴趋势

The Evolution of Attention in Large Language Models: Mechanisms, Trade-offs, and Emerging Trends

AI 导读

一篇综述将 LLM 注意力机制的发展统一为"模型内部上下文记忆"视角,提出涵盖记忆表示、更新、访问、读取与整合的五维分析框架。研究基于 14 个主要模型谱系、59 条发布级记录和 11 个高性能开放权重端点,重建了机制层面的演进与架构采用情况。综述指出,高效序列架构设计正从孤立的 Attention 算子转向上下文记忆的组织、生命周期与选择性使用,并据此提出有状态多维记忆路由假设。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org