论文·24 天前·约 1 分钟读完·arxiv.orgMMPO联合优化多阶失败概率提升大模型数学推理均衡性上海交大研发,同时优化大模型推理的均值与高阶失败率,兼顾难题表现A原文来源arxiv.orghttps://arxiv.org/abs/2608.02149 打开原文