返回首页
RadarAI··论文与技术

TLiveOmni 1.0: 直播视频多模态理解大模型

中文摘要

阿里发布TLiveOmni 1.0电商直播全模态大模型,支持音视频图文统一理解,在语音识别与商品定位任务中表现达到行业领先水平。

English Summary

Alibaba released TLiveOmni 1.0, a multimodal model for e-commerce live streaming that achieves SOTA performance in audio, video, image, and text integration and product localization.

原文节选

📌 一句话摘要 TLiveOmni 1.0 是阿里巴巴大淘宝技术团队推出的面向电商直播场景的全模态大模型,原生支持图像、文本、视频、音频四模态统一输入,在语音识别、商品定位等任务上达到 SOTA 水平。 📝 详细摘要 本文详细介绍了由阿里巴巴大淘宝技术团队研发的 TLiveOmni 1.0 全模态大模型。该模型以 Qwen3-VL-Instruct 为基座,通过添加音频编码器并采用「模态对齐→能力强化→全任务微调」三阶...