返回首页
AI on Medium··行业媒体

The Model Was Fast. The System Was Waiting.

中文摘要

记录 Qwen3 本地运行时的性能工程实践,涵盖 token 优化、Flash Attention 及并发处理等技术细节。

English Summary

A performance-engineering diary on optimizing the local Qwen3 runtime, covering token savings, Flash Attention, and concurrency.

原文节选

A performance-engineering diary from a local Qwen3 runtime: token savings, semantic regressions, Flash Attention, serialized concurrency… Continue reading on Medium »