字节开源统一框架 Bernini:给 DiT 配个“大模型军师”,AI 视频编辑先理解再动手
中文摘要
字节跳动开源 Bernini 框架,通过“多模态大模型规划+DiT 渲染”两阶段架构,实现先理解语义、再进行视频编辑的可控生成。
English Summary
ByteDance open-sourced Bernini, a framework using MLLM planning and DiT rendering to achieve controllable video editing by prioritizing semantic understanding before generation.
Original Excerpt
📌 一句话摘要 字节商业化技术团队开源 Bernini 框架,采用「多模态大模型规划 + DiT 渲染」的两阶段架构,实现先理解语义再生成视频的可控编辑与参考生成。 📝 详细摘要 本文报道字节商业化技术团队开源的视频生成与编辑统一框架 Bernini。该框架的核心创新在于将任务拆分为两步:首先由 MLLM-based planner 理解文本指令、源视频与参考素材,在 ViT embedding 空间中预测目标语义表示...