Back to Home
RadarAI··Papers & Tech

Baseten Base Labs 实验研究蒸馏何时有助于强化学习

中文摘要

Baseten Base Labs 研究蒸馏在强化学习中的作用,对比 Qwen3 不同规模模型在直接 GRPO 与 SFT 后再 RL 两种路径下的推理表现。

English Summary

Baseten Base Labs studied whether distillation helps RL, comparing direct GRPO versus SFT then RL across Qwen3 models and 16 reasoning tasks.

Original Excerpt

Baseten Base Labs 发布研究,用 Qwen3 的 0.6B、1.7B、4B、8B 模型比较 GRPO 直接训练与先用 gpt-5.6-sol 教师解法做 SFT 再 RL,覆盖十六个推理任务。