论文·2026-07-23·约 1 分钟读完·arxiv.org斯坦福与马里兰大学提出Masked Visual Actions该方法用像素级运动轨迹统一机器人正向与逆向世界建模,仅用15小时数据微调即可适配多种机器人形态。A原文来源arxiv.orghttps://arxiv.org/abs/2607.19343 打开原文