何恺明首个语言模型:105M 参数,不走 GPT 自回归老路
中文摘要
何恺明团队推出ELF连续扩散语言模型,通过连续embedding空间去噪,仅以105M参数在生成质量上超越主流离散扩散模型。
English Summary
He Kaiming's team introduced ELF, a continuous diffusion language model with 105M parameters that outperforms discrete diffusion models in generation quality.
Original Excerpt
📌 一句话摘要 何恺明团队提出 ELF 连续扩散语言模型,通过在连续 embedding 空间完成全部去噪过程、仅在最后一步离散化,以 105M 参数和 45B 训练 token 在生成质量上超越主流离散扩散模型。 📝 详细摘要 本文报道了何恺明团队在语言模型领域的最新研究成果——ELF(Embedded Language Flows)。与当前主流的自回归语言模型不同,ELF 采用连续扩散语言模型路线,核心创新在于将整...