论文·2026-07-27·约 1 分钟读完·arxiv.orgOpenForge RL 打通推理框架与环境的端到端训练哥伦比亚大学与微软研究院研发的强化学习框架,可直接利用Claude Code等推理框架的真实运行数据训练智能体,缩小训练与部署环境差异A原文来源arxiv.orghttps://arxiv.org/abs/2607.21557 打开原文