论文·2026-07-20·约 1 分钟读完·arxiv.orgGFlowRL稳定扩展大模型分布匹配RL微软研究院提出的强化学习方法,删除归一化网络稳定扩展至235B模型A原文来源arxiv.orghttps://arxiv.org/abs/2607.13394 打开原文