🐯 Liger GRPO 助力 TRL,实现强化学习微调新突破!
强化学习微调大语言模型(LLM)通常资源消耗巨大,尤其是经典的 PPO 方法。现在,Liger 与 TRL 携手推出 Group Relative Policy Optimization (GRPO) 优化方案,通过“分块计算损失”技术,峰值显存最高减少 40%,且无精度损失⚡。
✨ 亮点速览:
利用 Liger Chunked Loss 技术分批处理 logits,大幅降低内存压力
支持 FSDP 和 PEFT(如 LoRA、QLoRA),让多 GPU 训练更高效,训练批次大小提升约 1.5~1.8 倍
可无缝结合 TRL 集成的 vLLM 服务,显著加快采样与训练速度
GRPO 依赖可验证奖励函数,无需训练额外奖励模型,适合数学推理、编程等领域
📈 实验数据显示,Liger GRPO 在 gsm8k 任务上的内存利用和训练性能都有显著提升,训练效果与标准实现持平。
🤗 欢迎加入我们的中文社区:Chinese LLMs on Hugging Face,一起探索高效强化学习微调之道!
#强化学习##大语言模型##Hugging Face#
发布于 美国
