PawBench:给通用智能体一把可度量的尺
中文摘要
通义实验室发布 PawBench 评测基准,将底座模型与运行框架纳入统一体系。量化 Harness 对智能体表现影响,并给出设计原则。
English Summary
Tongyi Lab launched PawBench, an evaluation benchmark integrating base models and Harness frameworks. It quantifies Harness's impact on agent performance and provides design principles.
Original Excerpt
📌 一句话摘要 通义实验室发布 PawBench 评测基准,将底座模型与运行框架(Harness)纳入同一评测体系,通过 9×3×150 交叉矩阵量化 Harness 对智能体最终表现的决定性影响,并给出四条 Harness 设计原则。 📝 详细摘要 本文介绍通义实验室推出的全新评测基准 PawBench v1.0。不同于传统仅评测模型能力的榜单,PawBench 将底座模型与运行框架(Harness)作为联合评测对象...