返回首页
MarkTechPost··论文与技术

MiniMax Releases MiniMax H3: An Omni-Modal Video Model That Generates 15-Second 2K Clips With Native Stereo Audio

中文摘要

MiniMax发布全能视频模型H3,能从文本、图像、音视频统一语境生成4-15秒的2K视频,并提供原生立体声。

English Summary

MiniMax H3 is a new omni-modal AI model generating 4-15 second 2K videos with native stereo sound. It processes text, images, video, and audio inputs for unified creation.

原文节选

MiniMax releases MiniMax H3, a general-purpose multimodal generation model. MiniMax H3 is not a text-to-video model with add-ons. MiniMax describes it as a general-purpose multimodal generation model that reads text, images, video, and audio as one unified context and returns video with native stereo sound. The mains specs include: 2K output, 4–15 seconds, integer durations […] The post MiniMax Releases MiniMax H3: An Omni-Modal Video Model That Generates 15-Second 2K Clips With Native Stereo Audio appeared first on MarkTechPost.