科技·商业·财经

乐享科技街头直播破局:具身智能告别“演示内卷”,开启真实验证新纪元

   时间:2026-09-17 23:13 作者:唐云泽

在具身智能行业,过去两年“内卷”之风盛行,不过卷的方向却有些偏离正轨。行业内企业比拼的并非机器人在现实场景中的实际能力,而是谁的演示视频更具观赏性。演示视频愈发精致,音乐激昂、剪辑流畅,机器人展示着叠衣服、冲咖啡、翻跟头等完美动作。甚至衍生出一条隐形产业链,有专门的演示场地、灯光、道具,还有专业团队反复拍摄只为挑选出最佳片段。大众看到的只是那一次成功,而前面无数次失败都被剪辑软件无情舍弃。

9月16日,乐享科技以一种大胆的方式打破了这一行业“潜规则”。其搭载以太大模型的机器人在上海街头真实户外环境中,进行了近1小时的全程直播,完成了从点单、烧烤到上菜的全流程。直播中,机器人并非一帆风顺,端盘子时差点脱手,但镜头全程记录,没有回避这些“不完美”,恰恰是这些细节让承诺更具可信度。

这场直播的设计堪称“反Demo”典范。传统Demo会选择理想环境,而它选择完全开放的街头;Demo会剪掉所有失误,它却全程直播开放;Demo里观众只能旁观,它允许现场3桌、6名顾客随时打断、更改需求、挪动东西;Demo每个环节都有预案,它甚至在原定顾客临时缺席时,从围观人群中随机拉人补位。可以说,行业里做Demo时极力避免的情况,这场直播都主动纳入其中,仿佛是在给机器人“设置障碍”。

演示视频成为行业惯例有其现实原因。具身智能技术验证成本高昂,真实环境变量繁多,任何公司都难以确保直播不出现意外。而融资、传播、招人等需求,又促使企业需要“确定性”的展示素材,于是行业形成了一种心照不宣的默契:用最佳镜头呈现,对成功率避而不谈。然而,这种默契的代价是整个行业的信誉逐渐被透支,真正具备真实验证能力的公司反而难以脱颖而出。

乐享科技的这场直播,以高风险换回了高信誉。直播过程中,弹幕中不乏质疑声,如“是不是演的?”“镜头外肯定有工程师遥控”。对此,乐享科技创始人郭人杰带着镜头对整个场地进行了巡视。四周是完全开放的街头,无任何围挡,场地背后唯一能藏人的小房间空空如也,没有遥操人员、备用设备,彻底排除了作弊可能。

这场看似“冒险”的直播,结果却令人惊艳。出现了多个让弹幕刷屏的精彩瞬间:机器人点单时被要求“拿瓶水”,送完水后继续完成点单;烧烤机器人面对陌生调料瓶,经过几次尝试摸索出合适的抓法;烤串和上菜由两台不同机器人完成,分工交接自主进行,无一步提前设定。尤为值得一提的是,送水后,无人吩咐的情况下,机器人主动为顾客送上纸巾。这一动作不在任何服务流程中,意味着模型并非简单执行指令,而是真正理解了“人在吃烧烤”的场景,并推导出未被说出口的需求,体现了从“听懂指令”到“预判需求”的跨越,这是工具与智能的本质区别。

直播收尾时还有个意外花絮。主持人宣布结束,郭人杰说话时,技术人员临时起意让机器人向镜头和观众挥手,镜头捕捉到这一瞬间。由于完全不在流程中,这个挥手显得格外真实可信,没有人为编写“结束时要挥手”的程序,而是机器人理解了“结束”情境,以人类方式作别。

这些瞬间之所以珍贵,是因为无法被“设计”出来。剪辑可以制造完美动作,但无法制造“被打断后仍记得任务”以及“无人吩咐却主动服务”的场景,这需要模型真正理解任务和场景,而非简单回放动作。

直播结束后,从业者圈子里展开了一场有趣讨论:若把自己的模型置于同样赛制下,能坚持多久?十分钟、半小时,还是根本不敢开机?这一问题的出现,改变了行业的对话方式。以往大家交流的是参数、数据量、Demo效果,如今恐怕要先问一句“你敢不敢直播”。

支撑这场直播的以太大模型,是跨本体通用具身大模型,采用以神经元分配为核心的能量驱动架构,与行业主流的VLA路线不同,强调感知、记忆、推理、运动控制的连续闭环。其训练仅使用200小时人类视频数据、零真机数据,模型4B大小。在他人还在比拼真机数据和参数规模时,乐享科技选择了不同的赛道。

这场直播不仅在技术路线上引人关注,更为行业立下新规矩:具身智能大模型的强弱,有了公开可验的衡量方式,即到真实世界、无人接管、连续作业、对抗干扰的环境中接受挑战。

可以预见,会有更多公司面临“直播验真”的选择。跟进,就要接受不可控因素;不跟进,则要回答“为何不敢”。而乐享科技作为首个“出题人”,在行业中占据了先机。这场直播颠覆的不仅是某项性能指标,更是整个具身大模型的性能标准,衡量的尺度从“演示中的几十秒”变为“真实世界的一小时”,从“做到过一次”变为“扛住所有意外并完成任务”。标准一旦改变,行业将难以回到从前。

 
 
更多>同类内容
全站最新
热门内容