The Model Was Fast. The System Was Waiting.
中文摘要
记录 Qwen3 本地运行时的性能工程实践,涵盖 token 优化、Flash Attention 及并发处理等技术细节。
English Summary
A performance-engineering diary on optimizing the local Qwen3 runtime, covering token savings, Flash Attention, and concurrency.
原文节选
A performance-engineering diary from a local Qwen3 runtime: token savings, semantic regressions, Flash Attention, serialized concurrency… Continue reading on Medium »