Back to Home
美团技术团队··Domestic Sources

突破零样本 TTS 音色克隆上限:LongCat-AudioDiT 的声音克隆艺术

中文摘要

美团LongCat-AudioDiT实现波形潜空间音色克隆

English Summary

Meituan's LongCat team released LongCat-AudioDiT, a diffusion-based TTS model performing zero-shot voice cloning directly in waveform latent space, bypassing Mel-spectrograms to eliminate cascading errors.

Original Excerpt

能不能让 AI 直接学会声音本身的规律,跳过中间环节?为破解这一技术瓶颈,美团 LongCat 团队正式发布 LongCat-AudioDiT。在该模型中,彻底抛弃梅尔谱等中间表示,直接在波形潜空间进行基于扩散模型的文本转语音(Text-to-Speech, TTS),从根源阻断数据转换的级联误差。