ICML 2026 | 从专才到通才,OmniShow 极简干预统一多模态视频生成
中文摘要
ICML 2026接收的OmniShow通过极简干预将专才转为通才,在12.3B参数规模下实现了高效、统一的多模态视频生成。
English Summary
OmniShow, accepted at ICML 2026, achieves unified multimodal video generation via minimal intervention and a "specialist to generalist" design with only 12.3B parameters.
原文节选
📌 一句话摘要 文章详细解读 ICML 2026 接收的 OmniShow 工作,说明其通过极简干预和从专才到通才的设计哲学,在仅 12.3B 参数、音频模块增幅约 2.5% 的情况下实现多模态视频生成的统一与协同。 📝 详细摘要 文章首先指出业界在多模态视频生成中常采用'缺什么补什么'的做法,导致模块堆砌且稀释基础模型的生成先验。OmniShow 则采取相反路径:深度理解 DiT 基础模型的原生输入结构与学习动态,以...