让 KV Cache「按头分家」:小红书 RedKnot 如何重做长文本推理新引擎
中文摘要
小红书RedKnot长文本推理引擎,通过优化KV Cache、FFN和存储,大幅提升速度和并发。
English Summary
Xiaohongshu's RedKnot long-text inference engine boosts speed and concurrency by optimizing KV Cache, FFN, and storage.
原文节选
📌 一句话摘要 本文介绍小红书提出的 RedKnot 长文本推理引擎,通过按注意力头拆分 KV Cache、稀疏 FFN 和段页存储三个正交机制,实现 1.6-3.54 倍 TTFT 加速和 4.7-7.8 倍并发提升,同时保持甚至超越稠密模型精度。 📝 详细摘要 文章系统阐述了当前长文本推理中 KV Cache 带来的显存与延迟瓶颈,指出现有方案在「按 token 恢复、稠密存储、算力假设」三个粒度上与真实负载的按头...