Hugging Face Blog·· 27 天前精选AI 评分65
100步GRPO微调让350M模型结构化输出得分提升7个百分点
Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps
AI 导读
Liquid AI 发布教程,展示用 TRL 对 LFM2.5-350M 做约 500 样本、100 步 GRPO 微调,IFStruct 整体得分从 22.6% 升至 29.7%,JSON 通过率提升约 14 个百分点。
推荐理由
用500条样本跑100步GRPO,把350M模型IFStruct得分从22.6%提到29.7%,可复现的端侧调优路径。
来源:Hugging Face Blog · huggingface.co