Back to Home
RadarAI··Papers & Tech

视频 DiT 直接「长」出 4D 世界!浙大仅用 1K 条数据打通统一接口

中文摘要

浙大提出 Latent-to-4D 方法,将视频 DiT latent 直接转化为可交互 4D 世界,仅需 1K 条数据即可兼容多种模型,避免 RGB 解码损失。

English Summary

ZJU's Latent-to-4D converts video DiT latents directly into interactive 4D worlds using only 1K samples, bypassing RGB decoding to reduce information loss.

Original Excerpt

📌 一句话摘要 浙大研究提出 Latent-to-4D 方法,绕过 RGB 解码直接将视频 DiT 的最终去噪 latent 转化为可交互的 4D 动态世界,仅需 1K 条训练数据即可兼容多个视频生成模型。 📝 详细摘要 本文报道浙江大学 ReLER 与 CCAI 团队发表的 Beyond Pixels 研究。传统视频到 4D 重建采用「先解码 RGB 再重建」的两阶段路线,存在信息损失与误差传播问题。研究提出 Lat...