Back to Home
RadarAI··Papers & Tech

EMNLP 2026 高分论文 MathDebugger:当合成数据涌入训练集,如何为数学题做体检?

中文摘要

北大提出 MathDebugger 基准,通过细粒度标注评估合成数学数据,揭示大模型解题与验题的能力差异。

English Summary

PKU's MathDebugger benchmark evaluates synthetic math data through fine-grained labeling, revealing gaps between LLMs' problem-solving and verification abilities.

Original Excerpt

📌 一句话摘要 北京大学 DCAI 团队提出 MathDebugger,一个面向合成数学数据的质检基准,通过七类细粒度错误标注和四维度评测协议,揭示大模型「会做题」和「会验题」之间的能力差距,并证明错误类型监督能稳定提升纠错准确率。 📝 详细摘要 随着合成数据大量涌入训练集,数学题目中混入条件缺失、逻辑矛盾等隐性错误的风险日益突出。北京大学 DCAI 团队提出 MathDebugger 基准,覆盖 4,000 道题目与...