返回首页
RadarAI··论文与技术

ACL 2026 腾讯混元&UNSW:LLM 奖励建模的损失函数设计新范式

中文摘要

腾讯混元与UNSW提出E-GRM框架,通过混合损失函数优化分数校准与对比排序,提升奖励建模精度。

English Summary

Tencent Hunyuan and UNSW proposed E-GRM, a framework using mixed losses to optimize score calibration and contrastive ranking for better reward modeling.

原文节选

📌 一句话摘要 腾讯混元与 UNSW 团队提出 E-GRM 框架,通过 Huber 损失与铰链损失的混合设计,实现奖励模型在「分数校准」与「对比排序」上的协同优化,显著提升 LLM 奖励建模的精度与鲁棒性。 📝 详细摘要 本文详细解析 E-GRM(Efficient Generative Reward Modeling)框架中混合损失函数的设计原理与实验效果。针对传统单一损失(如 MSE 或对比损失)无法兼顾「绝对分数...