科技·商业·财经

京东段楠论AI新趋势:从数字迈向物理世界,数据模型硬件协同共进

   时间:2026-07-21 16:32 作者:唐云泽

在2026世界人工智能大会期间,WAIC京东论坛以“AI进入物理世界:模型、数据、终端与场景”为主题展开深度探讨。与会专家指出,人工智能正从数字世界向物理世界加速渗透,这一转型不仅涉及技术层面的突破,更需重新定义模型发展路径。京东集团副总裁段楠在演讲中强调,传统互联网数据难以支撑AI与物理环境的深度交互,构建能够感知、决策并行动的物理智能系统已成为行业核心命题。

物理AI的发展面临多重挑战。段楠提出,相较于数字AI,物理AI需突破四大关键维度:首先是物理数据的规模化采集,模型需从真实世界中学习三维结构、物理属性等复杂规律;其次是持续学习机制,通过与环境的动态交互实现模型进化;第三是基础模型的突破,要求具备空间建模、硬件操作及跨场景泛化能力;最后是硬件协同规模化,覆盖数据采集、模型训练到终端部署的全链条。他特别指出,Scaling Law在物理世界需扩展为数据、模型、算力与硬件的四维协同框架。

京东探索研究院将技术演进划分为三个阶段:数字智能阶段聚焦语言、代码及多模态模型开发,实现数字内容生成与任务自主完成;附身智能阶段通过可穿戴设备、智能座舱等终端构建人机自然交互系统;物理智能阶段则将模型部署至机器人等硬件,赋予其环境感知与自主行动能力。目前研究院已形成覆盖图像、视频、语音及具身智能的模型矩阵,各模型通过能力互补构建完整技术生态。

在具体技术突破方面,京东今年4月开源的JoyAI-Image-Edit模型通过“生成辅助理解”范式,在图像空间编辑任务中达到行业领先水平。6月推出的JoyAI-Echo长视频生成模型支持分钟级音视频联合生成,其多模态记忆与对话交互能力为视频世界模型奠定基础。同期开源的JoyAI-VL-Interaction实时视频交互模型,可基于环境变化自主决策响应时机,推动多模态模型向持续感知进化。论坛首次披露的JoyAI-Video-Edit实时编辑模型,具备30FPS以上的流式视频处理能力,为具身智能数据合成提供关键技术支撑。

语音交互领域,JoyAI-Talker模型采用原生预训练架构,实现语音理解、推理与生成的低延迟一体化,其情绪、语速等表达特征的精细控制能力,为智能设备赋予更自然的人机交互体验。段楠透露,高共情语音交互将成为研究院重点迭代方向,相关技术将深度融入附身智能与具身智能场景。

数据建设方面,京东4月开源的EgoLive具身数据集覆盖仓储、家庭等300余种操作任务,已收到全球数百家机构的数据申请。基于此推出的JoyAI-RA操作模型,验证了数据规模与模型能力的正相关关系。同步开发的JoyAI-Sim仿真架构,通过人类操作数据与机器人数据的双向转换,有效缓解了真实数据采集难题。研究院正在搭建的产业级评测平台,计划通过零售、物流等真实场景形成“数据-模型-仿真-任务”闭环,预计下半年正式发布。

据透露,京东探索研究院将在下半年持续推进技术落地:数据建设领域将公布阶段性成果,物理基础模型预计9-10月发布新版本,同时加速建设覆盖千行百业的评测体系。这些举措旨在推动开源社区与京东内部业务的技术跃迁,为AI从数字世界向物理世界迁移提供可复制的实践路径。

 
 
更多>同类内容
全站最新
热门内容