Back to Home
AI on Medium··Industry Media

The Model Was Fast. The System Was Waiting.

中文摘要

记录 Qwen3 本地运行时的性能工程实践,涵盖 token 优化、Flash Attention 及并发处理等技术细节。

English Summary

A performance-engineering diary on optimizing the local Qwen3 runtime, covering token savings, Flash Attention, and concurrency.

Original Excerpt

A performance-engineering diary from a local Qwen3 runtime: token savings, semantic regressions, Flash Attention, serialized concurrency… Continue reading on Medium »