AI++
方法约 1 分钟读完arxiv.org

ARMOR 数学推理优化

ARMOR 在在线采样中加入参考策略产生的正确锚点答案,并通过混合优化建立随参考概率动态变化的信任区域,在数学推理任务上显著提升了模型性能。

A
打开原文