闪存QLA:基于TileLang构建的高性能线性注意力内核

Qwen · @Alibaba_Qwen · X·2026-04-29 20:15·144天前
AI 导读

FlashQLA是基于TileLang构建的高性能线性注意力内核,专为个人设备上的智能体AI设计。其核心创新包括门控驱动的自动片内计算并行、硬件友好的代数重构以及TileLang融合的Warp专用内核,通过提升流处理器利用率,在前向传播上实现2-3倍加速,反向传播实现2倍加速。该技术在小模型、长上下文工作负载和张量并行设置中效果显著,虽然在大批次处理时内存I/O开销略高,但在边缘设备和长上下文场景中实际性能更优。反向传播通过16级Warp专用流水线在严格片上内存限制下实现了核心级加速。相关资源已开源。

Qwen@Alibaba_Qwen
精选
60AI 编辑部评分,满分 100

闪存QLA:基于TileLang构建的高性能线性注意力内核

2026-04-29 20:15· 144天前
AI 导读

FlashQLA是基于TileLang构建的高性能线性注意力内核,专为个人设备上的智能体AI设计。其核心创新包括门控驱动的自动片内计算并行、硬件友好的代数重构以及TileLang融合的Warp专用内核,通过提升流处理器利用率,在前向传播上实现2-3倍加速,反向传播实现2倍加速。该技术在小模型、长上下文工作负载和张量并行设置中效果显著,虽然在大批次处理时内存I/O开销略高,但在边缘设备和长上下文场景中实际性能更优。反向传播通过16级Warp专用流水线在严格片上内存限制下实现了核心级加速。相关资源已开源。

推荐理由

2 倍加速的背后是 Warp 特化流水线和自动 Copy 策略,像给手机 GPU 开了条专用跑道,做端侧 Agent 的可以直接拉代码试试。

正文 · AI 翻译

🚀 隆重推出 FlashQLA:基于 TileLang 构建的高性能线性注意力核。

⚡ 前向计算加速 2-3 倍。反向传播加速 2 倍。 💻 专为个人设备上的智能体 AI 而构建。

💡关键洞察: 1. 门控驱动的自动卡内 CP。 2. 对硬件友好的代数重表述。 3. TileLang 融合的 warp 专用核。

FlashQLA 通过自动设备内 CP 提升 SM 利用率。其收益在 TP 配置、小模型和长上下文工作负载上尤为显著。

我们没有将整个 GDN 流程融合到一个核中,而是将其拆分为两个针对 CP 和反向传播效率优化的核。在大批量大小下,与完全融合的方法相比,这会带来额外的内存 I/O 开销,但在边缘设备和长上下文工作负载上却能实现更好的实际性能。

反向传播是最难的部分:我们在极其紧张的片上内存限制下构建了一个 16 阶段的 warp 专用流水线,最终实现了 2 倍以上的核级加速。

我们希望这对社区有用!🫶🫶 了解更多: 📖 博客:https://qwen.ai/blog?id=flashqla 💻 代码:https://github.com/QwenLM/FlashQLA