返回首页
RadarAI··论文与技术

高并发下大模型降智力?范式团队刚刚修复了 vLLM 一个隐藏极深的“吞 Token”大坑

中文摘要

范式团队修复了vLLM在流水线并行下误算Token的Bug,解决了高并发时内存整理导致模型准确率下降4.5%的问题。

English Summary

Paradigm team fixed a vLLM bug in pipeline parallelism where memory condensation miscalculated tokens, causing a 4.5% accuracy drop under high concurrency.

原文节选

📌 一句话摘要 范式团队发现并修复了 vLLM 推理框架在流水线并行模式下因内存整理机制算错 Token 数量导致高并发下模型准确率下降 4.5% 的隐藏 Bug。 📝 详细摘要 本文报道了范式团队在 vLLM 推理框架中发现并修复的一个严重 Bug。该 Bug 隐藏在 vLLM 的内存整理机制(condense)中,仅在流水线并行(PP)模式下触发。当高并发请求触发 condense 操作时,非末尾 GPU 会错误地...