多教师 OPD 收敛速度不一致?小红书 AllSpark 提出 D³-MOPD
中文摘要
小红书 AllSpark 提出 D³-MOPD,通过 reverse-KL 信号动态调整数据配比,弥合 97% 的师生差距并实现 3 倍收敛提速。
English Summary
Xiaohongshu AllSpark's D³-MOPD uses reverse-KL signals to dynamically adjust data ratios, bridging 97% of the teacher-student gap and tripling convergence speed.
原文节选
📌 一句话摘要 小红书 AllSpark 团队提出 D³-MOPD,利用训练中已有的 reverse-KL 信号实时评估各领域学习进度并动态调整数据配比,将师生差距弥合 97%(Vanilla MOPD 仅 63%),收敛提速 3 倍。 📝 详细摘要 本文介绍了小红书 AllSpark 团队提出的 D³-MOPD 方法,用于解决大模型合版训练中多教师在线蒸馏(MOPD)固定数据配比导致算力浪费的问题。文章首先通过实验指...