TRL+GRPO微调LFM2.5提升结构化输出
本文介绍使用TRL库中的GRPO算法对LFM2.5-350M模型进行低成本微调,以优化其结构化输出能力。在IFStruct基准测试中,得分从22.6%提升至29.7%,验证了小模型通过特定任务微调可接近大模型水平。
共 1 篇相关文章
本文介绍使用TRL库中的GRPO算法对LFM2.5-350M模型进行低成本微调,以优化其结构化输出能力。在IFStruct基准测试中,得分从22.6%提升至29.7%,验证了小模型通过特定任务微调可接近大模型水平。