论文·2026-07-24·约 1 分钟读完·arxiv.org多参与者连续时间强化学习框架 统一策略兼容性复旦数学学院提出,为多智能体博弈提供策略兼容性判定与近似均衡构造方法,拓展连续时间RL理论A原文来源arxiv.orghttps://arxiv.org/abs/2607.19928 打开原文