返回首页
RadarAI··论文与技术

吴恩达新作:87%推理 token 用不着,丢掉反而快 3 倍

中文摘要

吴恩达开源Prefix Sliding,利用前缀与滑动窗口丢弃冗余token,无需训练即可提速3倍并支持长程RL训练。

English Summary

Andrew Ng's Prefix Sliding discards redundant tokens via prefix and sliding windows, speeding up inference 3x without training and enabling ultra-long RL training.

原文节选

📌 一句话摘要 吴恩达开源 Prefix Sliding,证明大模型推理中大部分中间 token 几乎不 contributing 注意力,保留前缀 + 滑动窗口即可在无需训练的情况下提速 3 倍,并为超长 RL 训练提供可行路径。 📝 详细摘要 本文介绍 Andrew Ng 等人开源的研究工作 Prefix Sliding,旨在解决长程推理中 full attention 成本随序列线性增长的问题。核心洞察来自对注意...