首字延迟降低 3.6 倍,腾讯混元提出 Stem 稀疏注意力算法,长文推理加速新 SOTA
中文摘要
腾讯混元Stem稀疏注意力算法,用25%算力逼近稠密精度,将128K上下文首字延迟降3.7倍,加速长文推理。
English Summary
Tencent Hunyuan's Stem sparse attention achieves near-dense accuracy using 25% compute. It cuts 128K context first-token latency by 3.7x, accelerating long text inference.
原文节选
📌 一句话摘要 腾讯混元提出 Stem 稀疏注意力算法,通过 Token 位置衰减和输出感知度量两大创新,在仅用 25% 算力下逼近稠密注意力精度,配合 HPC 算子实现 128K 上下文首字延迟降低 3.7 倍,被 ICML 2026 收录。 📝 详细摘要 本文详细介绍了腾讯混元团队提出的 Stem 稀疏注意力算法及其配套的 HPC 算子优化方案。文章首先指出长文本推理中预填充阶段的性能瓶颈源于 Transforme...