AI++
Hugging Face·训练微调·Python17k

TRL

HF 官方强化学习微调库,SFT/DPO/PPO/GRPO 全覆盖

对齐研究论文的首选实现,GRPO 训练推理模型的标准工具

RLHFDPOTrainingApache-2.0