基准·19 天前·约 1 分钟读完·arxiv.orgSkillTV-Bench 以执行轨迹评估 Agent 判断器上交大与上海 AI 实验室构建,要求判断器检查 Agent 执行证据而非仅看最终答案,提升长链任务验证准确性A原文来源arxiv.orghttps://arxiv.org/abs/2608.05573 打开原文