腾讯一周连发两篇 Agent 评测,Workbuddy 底牌公开了!
中文摘要
腾讯开源 WorkBuddy Bench 和 E-Bench 评测基准,指出当前 Agent 模型缺乏全能冠军,可靠性是核心瓶颈。
English Summary
Tencent open-sourced WorkBuddy Bench and E-Bench, revealing that no "all-around champion" Agent exists yet and reliability is the main bottleneck.
Original Excerpt
📌 一句话摘要 腾讯连续开源 WorkBuddy Bench 和 E-Bench 两套 Agent 评测基准,覆盖编码、前端、办公、安全及真实产品场景,揭示当前模型尚无全能冠军且可靠性是主要瓶颈。 📝 详细摘要 文章详细介绍了腾讯在七月连续发布的两篇 Agent 评测论文:WorkBuddy Bench 由编码助手团队与安全实验室联合完成,包含写代码、前端、办公文件处理和安全审计四条赛道,共 260 道开源题目,采用从...