返回首页
RadarAI··论文与技术

AI 会笑吗?BIGAI & 上交大团队:多模态大模型是否真的能 get 到视频笑点|ACL 2026

中文摘要

上海交大、武大与BIGAI构建v-HUB基准,评测多模态模型对无对白视频幽默的理解,发现其过度依赖文本描述,与人类存在显著差距。

English Summary

BIGAI and university teams created the v-HUB benchmark, revealing that multimodal LLMs rely on text rather than audio-visual signals to understand humor in non-verbal videos.

原文节选

📌 一句话摘要 上海交大、武大和 BIGAI 团队构建 v-HUB 基准,系统评测多模态大模型对无对白视频幽默的理解能力,发现模型依赖文字描述而非原始视听信号,在主动发现笑点上与人类存在显著差距。 📝 详细摘要 本文介绍了上海交通大学、武汉大学和北京通用人工智能研究院联合发表于 ACL 2026 的研究成果。团队构建了名为 v-HUB 的评测基准,包含 1218 条无对白短视频(含卓别林默片和现代用户生成内容),覆盖纯...