返回首页
AI on Medium··行业媒体

The Newer Model Runs at Half the Tokens Per Second

中文摘要

新模型速度减半,每秒仅能处理12.97个token。

English Summary

Newer 27B model is slower, generating only 12.97 tokens per second.

原文节选

Two 27B models, same Mac Studio, same prompt. The older one generates at 28.67 tokens per second. The newer one manages 12.97. Continue reading on Medium »