返回首页
Hugging Face Blog··论文与技术

Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps

中文摘要

通过仅100步GRPO微调350M模型,显著提升了其生成结构化输出的能力。

English Summary

Fine-tuning a 350M model with only 100 GRPO steps significantly improves its structured output capabilities.