🚀 隆重推出 FlashQLA:基于 TileLang 构建的高性能线性注意力核。
⚡ 前向计算加速 2-3 倍。反向传播加速 2 倍。 💻 专为个人设备上的智能体 AI 而构建。
💡关键洞察: 1. 门控驱动的自动卡内 CP。 2. 对硬件友好的代数重表述。 3. TileLang 融合的 warp 专用核。
FlashQLA 通过自动设备内 CP 提升 SM 利用率。其收益在 TP 配置、小模型和长上下文工作负载上尤为显著。
我们没有将整个 GDN 流程融合到一个核中,而是将其拆分为两个针对 CP 和反向传播效率优化的核。在大批量大小下,与完全融合的方法相比,这会带来额外的内存 I/O 开销,但在边缘设备和长上下文工作负载上却能实现更好的实际性能。
反向传播是最难的部分:我们在极其紧张的片上内存限制下构建了一个 16 阶段的 warp 专用流水线,最终实现了 2 倍以上的核级加速。
我们希望这对社区有用!🫶🫶 了解更多: 📖 博客:https://qwen.ai/blog?id=flashqla 💻 代码:https://github.com/QwenLM/FlashQLA