当 Agent 真正走进复杂数据分析场景:DataClawBench 用 492 个真实任务,给前沿模型做了一次过程级体检
中文摘要
中文:DataClawBench通过492个真实金融任务,评估大模型数据分析过程能力。
English Summary
English: DataClawBench evaluates LLMs' data analysis process with 492 real financial tasks.
Original Excerpt
📌 一句话摘要 DataClawBench 是一个基于 492 个真实金融智库任务的数据分析评测基准,通过保留未清洗数据和隐藏数据源先验,对前沿大模型进行过程级评估,揭示了它们在真实探索式分析场景中的能力边界与失败模式。 📝 详细摘要 本文由中山大学陈川课题组联合南方周末科创力研究中心发布,介绍了 DataClawBench 评测基准。该基准的核心创新在于保留了真实数据分析中的「探索负担」——数据未经预清洗、数据源和 ...