“接力跑”盘活全国算力,PD 分离终于破局:延迟砍半、成本直降近 40%!
中文摘要
无问芯穹提出PDD架构,通过三级分离降低跨集群延迟,实现首Token延迟减半、成本降低37.5%,大幅提升算力性价比。
English Summary
Infinigence AI's PDD architecture masks cross-cluster latency via three-level separation, cutting first-token latency by 51.5% and costs by 37.5% to boost efficiency.
Original Excerpt
📌 一句话摘要 无问芯穹提出 PDD 架构,通过三级分离和 Token 传输重算机制,将跨集群 KV Cache 传输延迟掩盖,实现首 Token 延迟降低 51.5%、单 Token 成本降 37.5%,并提升性价比 37.5%。 📝 详细摘要 文章详细介绍了无问芯穹在 2026 WAIC 大会上首次公开的跨集群异构推理架构 PDD(Prefill‑RelayDecode‑MainDecode)。文章先从三个关键洞察...