方法·2026-07-15·约 1 分钟读完·arxiv.orgAD-OPSD 自蒸馏优化AD-OPSD 通过熵梯度屏蔽和双视角目标分布,在高风险词元上动态调整教师模型与冻结基础模型的权重,在数学推理基准上相比标准自蒸馏最多带来 4.1 个百分点的准确率提升。A原文来源arxiv.orghttps://arxiv.org/abs/2607.10805 打开原文