Hugging Face·训练微调·Python17kTRLHF 官方强化学习微调库,SFT/DPO/PPO/GRPO 全覆盖对齐研究论文的首选实现,GRPO 训练推理模型的标准工具RLHFDPOTrainingApache-2.0 打开仓库 返回列表