高并发下大模型降智力?范式团队刚刚修复了 vLLM 一个隐藏极深的“吞 Token”大坑
中文摘要
范式团队修复了vLLM在流水线并行下误算Token的Bug,解决了高并发时内存整理导致模型准确率下降4.5%的问题。
English Summary
Paradigm team fixed a vLLM bug in pipeline parallelism where memory condensation miscalculated tokens, causing a 4.5% accuracy drop under high concurrency.
原文节选
📌 一句话摘要 范式团队发现并修复了 vLLM 推理框架在流水线并行模式下因内存整理机制算错 Token 数量导致高并发下模型准确率下降 4.5% 的隐藏 Bug。 📝 详细摘要 本文报道了范式团队在 vLLM 推理框架中发现并修复的一个严重 Bug。该 Bug 隐藏在 vLLM 的内存整理机制(condense)中,仅在流水线并行(PP)模式下触发。当高并发请求触发 condense 操作时,非末尾 GPU 会错误地...