发生了什么:腾讯混元团队联合清华 AIR、东南大学计算机学院发布智能体评测基准 E-Bench(论文 arXiv:2607.23722)。它以王者荣耀、QQ 音乐、腾讯会议三个产品为原型构建全合成虚拟环境,共 323 个「改状态」任务,覆盖 41 张数据库表、逾 7.6 万条数据行与 60 万个数据单元;评分采用确定性数据库状态 diff,只有最终状态与标准 diff 精确匹配才算通过,不给部分分(平均每任务涉及 24.9 处行级改动)。11 个前沿模型每任务独立跑 3 次的结果:平均 Avg@3 仅 54.56%,能力较强模型 73.79%;
三次全对的 Pass³ 最强也只有 58.82%,开放代码执行后最好的 Pass³ 仍低于 70%。为什么重要:基准用「信息鸿沟 + 工具鸿沟」逼模型自己去环境里搜集隐藏状态,测出最常见的失败模式是「信息还不全就动手」——说明多步工具调用远未被解决,可靠性而非单次成功率才是产品化瓶颈。以上数字均为该论文自报口径。
