返回首页
RadarAI··论文与技术

LongCat 开源 VitaBench 2.0:长期动态智能体基准新标杆

中文摘要

美团开源VitaBench 2.0,系首个评估大模型长期互动中个性化与主动性的基准,揭示了AI在主动沟通与情商方面的不足。

English Summary

LongCat released VitaBench 2.0, the first benchmark for long-term dynamic agents, assessing personalization and proactivity while highlighting AI’s deficiencies in proactive communication and emotional intelligence.

原文节选

📌 一句话摘要 本文介绍美团开源的 VitaBench 2.0,首个评估大语言模型在长期动态用户互动中个性化与主动性能力的智能体基准,并揭示时间遗忘、高智商不等于高情商、AI 缺乏主动沟通等核心洞察。 📝 详细摘要 文章详细介绍了美团 Longcat 团队开源的 VitaBench 2.0 基准,这是首个面向长期动态用户建模的智能体评测基准。基准包含 56 名基于真实统计构建的虚拟用户、819 个复杂任务、超 2000...