The Newer Model Runs at Half the Tokens Per Second
中文摘要
新模型速度减半,每秒仅能处理12.97个token。
English Summary
Newer 27B model is slower, generating only 12.97 tokens per second.
原文节选
Two 27B models, same Mac Studio, same prompt. The older one generates at 28.67 tokens per second. The newer one manages 12.97. Continue reading on Medium »