ACL 2026 腾讯混元&UNSW:LLM 奖励建模的损失函数设计新范式
中文摘要
腾讯混元与UNSW提出E-GRM框架,通过混合损失函数优化分数校准与对比排序,提升奖励建模精度。
English Summary
Tencent Hunyuan and UNSW proposed E-GRM, a framework using mixed losses to optimize score calibration and contrastive ranking for better reward modeling.
原文节选
📌 一句话摘要 腾讯混元与 UNSW 团队提出 E-GRM 框架,通过 Huber 损失与铰链损失的混合设计,实现奖励模型在「分数校准」与「对比排序」上的协同优化,显著提升 LLM 奖励建模的精度与鲁棒性。 📝 详细摘要 本文详细解析 E-GRM(Efficient Generative Reward Modeling)框架中混合损失函数的设计原理与实验效果。针对传统单一损失(如 MSE 或对比损失)无法兼顾「绝对分数...