北大卢宗青团队打造具身智能模型 50万小时人类视频训练机器人大脑
['具身智能领域正从软硬一体向专注模型侧分化,智在无界选择不做机器人本体,聚焦跨本体通用具身基础模型研发。', '该团队以50万小时人类视频为核心数据,推出Being-H、Being-M两条模型线,将触觉模态融入预训练,解决具身模型交互核心瓶颈。', '行业对非本体型具身模型公司的认可度已显著提升,通用具身模型落地仍需场景适配与技术迭代。']

具身智能创业公司智在无界(BeingBeyond)创始人、北京大学计算机学院长聘副教授卢宗青,近期在专访中披露了团队研发通用具身基础模型的核心路径。不同于行业多数选择软硬一体的路线,该公司坚持“只做模型、不做机器人本体”,希望打造可适配不同形态机器人的通用“大脑”。
卢宗青的具身智能研究始于数字世界通用Agent探索,2023年尝试让多模态大模型在《荒野大镖客2》中完成任务时,发现模型对视觉与空间的理解存在本质瓶颈——现有模型交互能力不足,核心是缺乏对物理世界的深度认知。基于此,他转向具身基础模型研发,认为具身智能的核心是打造跨本体、跨场景迁移的通用模型,而非绑定特定机器人本体。
智在无界目前聚焦两条模型线:Being-H系列针对手部与末端操作,Being-M系列覆盖人形机器人全身移动操作。近期发布的Being-H0.8模型,将预训练所用人类视频规模从20万小时扩展至50万小时,首次在预训练阶段融入人手与物体的接触信息,通过标注接触位置、临近度等触觉相关特征,解决纯视觉方案在临界接触判断、遮挡场景抓取中的缺陷。

为支撑50万小时数据的处理,智在无界搭建了完整的数据管线,涵盖数据筛选、标注、对齐、传输等环节,同时构建了模型训练、设备侧部署的基础设施。团队表示,数据规模与质量需协同推进,50万小时数据均为蕴含人手动作与交互的有效数据,且覆盖多场景、多任务,避免单一任务数据的局限性。
技术路线上,智在无界的模型从预训练阶段就融入动作预测,区别于英伟达FLARE等隐式模型,其核心是通过动作与后果的联合学习,让模型掌握物理世界的因果关系而非相关性。Being-H0.8的触觉模态补充,将通过金字塔式触觉编码器实现统一表征,适配不同原理的触觉传感器,减少信号冲突。
商业化层面,Being-H系列因聚焦灵巧操作,离商业化更近,目前已与跨国企业开展工业场景操作类任务的概念验证,未来将通过模型授权给本体公司的方式落地。团队认为,具身智能商业化不一定局限于替代人力,也可拓展至机器人表演等新场景。
卢宗青透露,Being-H0.8已健全数据、训练、部署等全链路环节,下一代模型将进入全新训练范式阶段,长期目标是打造端到端的通用具身模型,让机器人像语言模型一样完成多场景任务。
来源
- 信号源:甲子光年
- 原文:独家专访北大卢宗青:如何用50万小时人类视频,训练机器人“大脑”|甲子光年
