斯坦福研究质疑 AI 基准测试是否真的测到了它宣称的能力
中文摘要
斯坦福研究发现,许多AI基准测试未能准确测量其宣称的能力,且不同基准之间常存在矛盾。
English Summary
Stanford research reveals that many AI benchmarks fail to measure their claimed abilities and often contradict each other.
原文节选
斯坦福 Koyejo 与 Sang Truong 团队将在 10 月旧金山 COLM 上发表两项研究,用测量科学与心理测量学方法检验 56 个广泛使用的 AI 基准,发现基准并不总是测到其宣称的能力,宣称测同一属性的基准之间也常互相矛盾。