在2026世界人工智能大会京东展区,一场别开生面的演示吸引了众多参观者的目光:一位参观者站在货架前,戴上特制的头戴设备,随手拿起一瓶饮料,仔细查看标签后,又将其准确放回原位。与此同时,几米外的大屏幕上,这一系列日常动作被转化为精确的数据:视线停留的位置、手部移动的轨迹、商品的准确位置、抓取的力度以及任务完成的信号。这些数据经过处理和分析后,一台机器人随即伸出机械臂,开始模仿并学习这一动作。
随着大会的深入,展馆内的机器人成为了绝对的焦点。它们不仅能够流畅地跳舞、递水、下棋,更在聚光灯下展示了一系列复杂的任务执行能力。然而,在赞叹之余,一个更为深刻的问题浮现出来:当这些机器人走出展台,面对不同的货架、商品,甚至是光线的变化,它们是否还能保持同样的高效和准确?这背后,考验的不仅仅是机器人的硬件性能,更是人工智能技术从理论到实践的跨越。
人工智能要真正融入物理世界,不仅需要“看懂”周围的环境,理解人类的意图,还要将判断转化为实际行动。这一过程,离不开持续产生的真实数据、能够承载复杂模型的智能终端,以及支撑长期运行的强大计算基础设施。京东在此次大会上,集中展示了其JoyAI模型矩阵、具身智能数据全链路基础设施、JoyInside智能终端以及京东云AI基础设施,试图解答一个更为系统性的问题:如何将数据、模型、终端与真实场景紧密连接,让人工智能在现实中不断学习、持续进化。
以整理货架这一看似简单的任务为例,对机器人而言却是一项巨大的挑战。它需要首先识别商品与货架的空间关系,准确理解“将饮料放回原位”的指令;在操作过程中,还需持续观察环境变化,判断最佳的抓取时机和方向,并根据实际情况调整动作。为了应对这些挑战,京东在展区展示了多款JoyAI模型,包括提升图像和空间理解能力的JoyAI-Image和JoyAI-Image-Edit,能够持续观察视频画面并做出判断的JoyAI-VL-Interaction,强化低延迟、可打断连续语音交互的JoyAI-Talker,以及将视觉观察和语言指令转化为机器人可执行动作的JoyAI-RA。
这些模型共同构成了人工智能进入物理世界的完整能力链:从看见空间、理解变化,到与人交流,最终完成行动。然而,单项能力的提升只是第一步,更重要的是如何让这些模型围绕一项现实任务连续、高效地运转起来。
为了实现这一目标,京东选择了从人类第一视角数据切入。在展区现场,参观者可以戴上自研的采集终端JoyEgoCam,像平常一样整理商品、叠衣服或完成清洁任务。设备会记录下第一视角的双目视频和运动信息,进而提取出动作轨迹、空间结构和任务语义。基于这种方式,京东开源了EgoLive数据集,该数据集包含了2000小时的高保真双目视频和65866个任务片段,覆盖了346项真实任务。这些数据为机器人的学习提供了丰富的素材。
然而,视频数据并不会自动转化为机器人的能力。数据上传后,还需要经过清洗、对齐、标注和结构化处理,再通过仿真平台补充现实中难以采集的场景,最终才能进入模型训练和真机评测阶段。从人类完成一次操作到机器人学会完成任务,一条围绕现实经验的数据链正在逐步形成。
除了数据采集和处理,京东还展示了人工智能进入现实世界的另一种形态——在“AI Home”展区,没有一台机器人能够包办所有事情。相反,台灯、床垫、电视、玩具和机器狗等设备保留了各自的硬件能力,而JoyInside则负责帮助这些设备听懂语言、理解需求并调用功能。例如,当用户说“今天有点累”时,床垫会根据睡眠需求调整支撑力度,灯光和其他设备也会相应响应。这种模式下,人工智能不再仅仅附着在单个产品上提供问答功能,而是开始尝试协调多个终端共同完成任务。
据介绍,目前JoyInside已经与近200个家电家居、机器人和AI玩具品牌展开了合作,预计今年将接入超过1000万台智能硬件。京东云则为模型训练、推理部署、版本更新和设备运行提供了强大的支撑。然而,接入数量并不等同于物理世界的智能闭环。不同设备之间的协同、交互反馈在获得授权和保护隐私前提下的模型优化等问题,仍需要长期的探索和努力。
京东在物理AI领域的探索,有着不同于单纯技术企业的独特起点。每天,大量商品在仓库、配送站、门店和家庭之间流动,人员、设备和业务系统持续参与其中。这些零售、物流、工业、健康和生活服务等业务为人工智能提供了大量真实、连续且能够检验结果的任务。这也是京东提出建设“全球最大物理世界运营中心”的现实基础:让真实场景产生数据,用数据训练模型,再让模型通过机器人和智能设备回到现实中接受检验。










