返回首页
RadarAI··论文与技术

SFT 别急着接 RL!你的多模态大模型可能一直在“带伤训练”

中文摘要

研究发现SFT引发的分布偏移会降低多模态模型RL性能,建议在SFT与RL间增加分布对齐阶段。

English Summary

PRISM research shows SFT-induced distribution shifts degrade multimodal RL, suggesting an alignment stage is needed between SFT and RL.

原文节选

📌 一句话摘要 最新研究 PRISM 发现,多模态大模型在 SFT 后直接进行 RL 训练,SFT 引入的分布偏移会导致模型性能下降,RL 阶段实际上是在「还债」而非「提升」,需要在两者之间增加一个分布对齐阶段。 📝 详细摘要 来自港科大(广州)、南洋理工、清华等机构的研究团队提出了 PRISM 方法,挑战了多模态大模型后训练中「先 SFT 再 RL」的传统范式。研究发现,SFT 会引入感知漂移和推理漂移两类分布偏差,...