论文·12 天前·约 1 分钟读完·arxiv.orgGCPO约束参数更新方向稳定大模型强化学习后训练上交与上海AI实验室提出,保护预训练关键子空间,数学任务准确率最高提升27.69%A原文来源arxiv.orghttps://arxiv.org/abs/2608.11674 打开原文