论文·2026-07-28·约 1 分钟读完·arxiv.orgLeAct从专家动作反推推理链提升泛化能力普林斯顿提出,用专家动作作为监督源训练推理模型A原文来源arxiv.orghttps://arxiv.org/abs/2607.21856 打开原文