正文 · AI 翻译
🚀 我们正式推出 NSA:一种硬件对齐且原生可训练的稀疏注意力机制,可实现超快长上下文训练与推理!
NSA 的核心组件包括: • 动态分层稀疏策略 • 粗粒度模型 token 压缩 • 细粒度模型 token 选择
💡 凭借针对现代硬件优化的设计,NSA 在加速推理的同时降低了预训练成本--且不牺牲性能。它在通用基准测试、长上下文任务和基于指令的推理中均达到或超越全注意力模型的表现。
📖 更多详情,请查阅我们的论文:https://arxiv.org/abs/2502.11089