模型好不好用,谁说了算?从榜单崇拜到自建评测
中文摘要
文章指出大模型评测榜单有局限,难保业务适用性。建议企业自建测试集规避模型针对指标优化,确保评测实效。
English Summary
Public AI model leaderboards are limited and don't ensure business suitability. The article proposes building custom test sets to avoid models optimizing for metrics, ensuring effective evaluation.
Original Excerpt
📌 一句话摘要 本文剖析了大模型评测榜单的局限性,指出公开榜单只能提供行业坐标而无法保证业务场景的适用性,并提出了自建测试集以规避古德哈特定律的务实方案。 📝 详细摘要 文章回顾了从固定考卷(如 MMLU、HLE)到真人盲测(Chatbot Arena)、再到真实任务(SWE-bench)和 Agent 全链路评测(BrowseComp)的演进过程,指出所有公开评测最终都会因模型针对指标优化而失效(古德哈特定律)。作者...