论文·2026-07-17·约 1 分钟读完·arxiv.orgAVSCap 全模态视频描述模型南京大学与快手提出 AVSCap,通过音画事件绑定推动全模态视频描述逼近商业模型,音画协同召回率达 57.70。A原文来源arxiv.orghttps://arxiv.org/abs/2607.12820 打开原文