论文·2026-07-28·约 1 分钟读完·arxiv.orgQLPO四象限重采样缩短推理链维持准确率北大与清华联合开发,重塑训练样本分布压缩推理长度A原文来源arxiv.orghttps://arxiv.org/abs/2607.21793 打开原文