Back to Home
RadarAI··Papers & Tech

InternLM 推出 ResOPD:稀疏在线策略蒸馏的尾部残差化方法

中文摘要

上海人工智能实验室推出ResOPD,通过稀疏在线策略蒸馏优化大模型训练,在保持高效的同时精确估计全词表梯度。

English Summary

InternLM introduced ResOPD, a sparse online policy distillation method that efficiently estimates full-vocabulary reverse-KL gradients, enhancing model training performance while maintaining low computational overhead.

Original Excerpt

上海人工智能实验室 InternLM 项目发布 ResOPD,一种仅用教师模型 Top-k 概率和学生采样 token 概率即可估计全词表 reverse-KL 梯度的稀疏在线策略蒸馏方法,教师传输量和前向次数与稀疏 OPD 持平。