科技·商业·财经

具身智能泛化难题待解,京东以真实场景数据搭建机器人“成长阶梯”

   时间:2026-08-21 22:21 作者:杨凌霄

在具身智能技术快速发展的浪潮中,机器人正逐步尝试融入人类生活的各个场景。从家庭中的家政服务到物流仓库的分拣工作,再到便利店的理货任务,机器人的应用前景被广泛看好。然而,要让机器人真正适应这些复杂多变的环境,并非易事。

以一家24小时营业的便利店为例,机器人在整理货架和补货时,需要应对各种突发情况:顾客可能突然拿走商品,商品可能被随意放置,有人经过遮挡视线,店内光线也会随时间变化。这些对于人类来说轻而易举的小插曲,对机器人而言却是全新的挑战,需要它们重新判断并作出反应。具身智能企业普遍面临的问题是,如何让机器人在真实且不断变化的物理世界中学会观察和行动。

在2026世界机器人大会上,宇树科技创始人王兴兴指出,当前具身智能发展的最大瓶颈在于泛化能力不足。他认为,当通用机器人在陌生环境中能够完成约80%的任务时,产业将迎来爆发点。与此同时,京东在大会上展示了其具身智能数据生态业务的最新进展,包括一系列数据采集终端和模型开发平台,强调其依托超级供应链在多个实体产业中的丰富场景,为提升具身模型的泛化能力提供了天然的训练场。

机器人学习的难点在于,它们需要掌握的是实际操作中的细节,如拿杯子的力度、铺被子的平整度等。这些能力难以直接从互联网数据中获取,更多依赖于人的身体经验和真实操作过程。然而,全球高质量真实物理交互数据总量有限,远不能满足训练通用具身智能模型的需求。为此,行业主要采用真机遥操作和仿真训练等方式积累数据,但这些方法各有局限。

这种数据采集方式简单直接:让人戴上摄像头,记录自己完成任务时的环境、身体移动和手部操作。与仅记录机器人动作的数据相比,这类数据能保留更多人的操作过程,帮助模型理解人在真实环境中如何与物体、空间和其他人互动。今年以来,这一方向正从研究走向产业实践。

英伟达具身智能团队负责人Jim Fan介绍了EgoScale项目,该项目利用约2万小时真实场景下的人类第一视角视频进行预训练,再用少量高精度模拟数据和真实训练数据进行动作微调,使机器人能够完成卡片分类、液体转移等灵巧操作任务。京东也在进行类似尝试,计划发动大量内部员工和外部行业人员参与数据采集,两年内积累1000万小时人类真实场景视频数据。

然而,数据采集并非易事。实际操作中,画面丢失、操作重复、动线不合理等问题都可能导致视频失去训练价值。数据采集完成后,还需经过质检、清洗和标注。为提高采集效率并让数据记录更完整,京东从采集终端入手进行改进。

京东云JoyEgoCam二代数据采集终端扩大了记录范围,增加了手部、手臂和腿部动作捕捉能力,并扩大了视野范围。同时,采集信息从视觉延伸到更多感知维度,支持环境音采集、语音控制等。设备使用方式也得到改进,支持众包采集模式,让数据生产从专业团队扩展到更多普通参与者。

采集终端变得更丰富后,数据还需被“翻译”成机器人能理解的信号。京东为此加入自动化标注和人机对齐算法,把过去偏重局部手部动作的对齐范围扩展到更完整的全身动作。同时,JoyAI-Sim将人类数据、仿真数据和真机数据连接起来,用于数据生成和模型评测,提高了评测效率。

京东用自己的模型验证了真实场景数据的价值。基于自采数据训练的JoyAI-RA 0.5具身操作基础模型,在真机具身Benchmark中表现出色,尤其在未见泛化场景下达到较高成功率。京东还尝试将这种能力提供给其他具身智能企业,帮助它们提升模型性能并缩短研发周期。

随着具身智能技术的不断发展,机器人需要面对的场景将越来越多,数据需求也将从一次性项目采购变为长期持续的基础需求。行业需要的不仅是更聪明的机器人,还需要一套能够持续将真实世界转化为机器学习资源的数据基础设施。京东正在尝试成为这套基础设施的提供者,通过整合真实场景数据、数据处理与训练工具、云端算力和具身模型能力,帮助企业更高效地完成模型训练、评测和迭代。

 
 
更多>同类内容
全站最新
热门内容