方法·2026-07-15·约 1 分钟读完·arxiv.orgARMOR 数学推理优化ARMOR 在在线采样中加入参考策略产生的正确锚点答案,并通过混合优化建立随参考概率动态变化的信任区域,在数学推理任务上显著提升了模型性能。A原文来源arxiv.orghttps://arxiv.org/abs/2607.10481 打开原文