对比与生成:抖音 SOTA 多模态表征模型 DME
中文摘要
字节跳动抖音搜索发布SOTA多模态表征模型DME,两阶段训练引入隐式推理,提升搜索性能。
English Summary
ByteDance's Douyin Search releases SOTA multimodal model DME, using two-stage training for implicit reasoning and improved search.
原文节选
📌 一句话摘要 字节跳动抖音搜索团队发布多模态表征模型 DME,通过两阶段训练(大规模对比学习+语义充分性学习)引入隐式推理与交叉条件重建机制,在 MMEB-v2 基准上 2B/9B 双量级夺得 SOTA,且仅增加亚毫秒级延迟,已在抖音线上验证 LT 收益 0.1%。 📝 详细摘要 本文详细介绍了抖音多模态表征模型 DME(Douyin Multimodal Embedding)的技术细节与实验结果。针对 AI 搜索与...