返回首页
RadarAI··论文与技术

ICML 2026 | 从专才到通才,OmniShow 极简干预统一多模态视频生成

中文摘要

ICML 2026接收的OmniShow通过极简干预将专才转为通才,在12.3B参数规模下实现了高效、统一的多模态视频生成。

English Summary

OmniShow, accepted at ICML 2026, achieves unified multimodal video generation via minimal intervention and a "specialist to generalist" design with only 12.3B parameters.

原文节选

📌 一句话摘要 文章详细解读 ICML 2026 接收的 OmniShow 工作,说明其通过极简干预和从专才到通才的设计哲学,在仅 12.3B 参数、音频模块增幅约 2.5% 的情况下实现多模态视频生成的统一与协同。 📝 详细摘要 文章首先指出业界在多模态视频生成中常采用'缺什么补什么'的做法,导致模块堆砌且稀释基础模型的生成先验。OmniShow 则采取相反路径:深度理解 DiT 基础模型的原生输入结构与学习动态,以...