如果给过去两年的具身智能行业找一个关键词,"内卷"大概得票最高。只不过,卷的方向有点奇怪:大家卷的不是机器人在真实世界里能干什么,而是谁的演示视频更好看。
视频越来越精致,音乐越来越燃,剪辑越来越流畅。机器人在镜头前叠衣服、冲咖啡、翻跟头,每一帧都完美得无可挑剔。行业内甚至衍生出一条隐形供应链:专门的演示场地、专门的灯光、专门挑选的道具,以及专门负责"拍一百遍挑一遍"的团队。大众看到的是第一百次成功,前面九十九次失败,都躺在剪辑软件的回收站里。
9月16日,乐享科技用一种近乎"自曝"的方式,戳破了这层窗户纸。
01、一场全程只玩真实的直播
搭载乐享科技以太大模型的机器人在上海街头的真实户外环境里,连续直播近1小时,完成从点单、烧烤到上菜的完整流程。这中间,机器人也有卡bug的时候,端盘子走着走着,盘子差点没脱手,但直播全程跟踪,镜头没回避。恰恰是这些没被剪掉的“不完美”,把承诺给坐实了。

这场直播的所有设计都在"反Demo":Demo挑最理想的环境,它选了完全开放的街头;Demo剪掉所有失误,它全程直播开放直播;Demo里观众只能看,它允许现场3桌、6名顾客随时打断、改需求、挪东西;Demo的每个环节都有预案,它甚至在原定顾客临时缺席后,从围观人群里随机拉了一位补位。
换句话说,行业里做Demo时避之不及的一切,这场直播全都主动加了进来。别人给机器人铺路,它给机器人挖坑。
02、为什么大家都默认了"演示视频"这套玩法
演示视频成为行业惯例,有其客观原因:具身智能的技术验证成本极高,真实环境变量太多,任何一家公司都无法保证直播不翻车。而融资、传播、招人,都需要"确定性"的素材。于是行业里形成了一种心照不宣的默契:用最好的镜头说话,至于成功率,不必细问。
默契的代价是整个行业的信誉被透支。当每一支视频都被默认"剪过",真正有能力做真实验证的公司,反而很难被区分出来。
乐享这场直播的价值,正在于它用最高的风险,换回了最硬的信誉。
直播时,弹幕里也有不少质疑:"是不是演的?""镜头外面肯定有工程师在遥控"。对这些弹幕最好的回应,是乐享科技创始人郭人杰带着镜头,把整个场地走了个遍:四周是完全开放的街头,没有任何围挡;全场唯一能藏人的地方,是场地背后的一个小房间。镜头跟进去,小房间里空空如也。没有遥操人员,没有备用设备,没有任何藏人的可能,这段"全场巡游"让最后一丝作弊空间被当面排除。
03、结果反而更惊艳
反常的赛制,没有等来翻车,等来的是几个让弹幕刷屏的瞬间:机器人点单点到一半被要求"拿瓶水",送完水接着把单点完;烧烤机器人对着陌生的调料瓶试了几次,自己摸索出了合适的抓法;烤串的和上菜的是两台不同的机器人,分工交接全程自主完成,没有一步提前写死。
最容易被忽略、却可能最贵的一个瞬间,发生在送水之后:没有任何人开口吩咐,机器人想到顾客吃烧烤会需要纸巾,主动把纸巾送了过去。
这个动作不在任何服务流程里。它意味着模型做的不是"指令—执行"的机械映射,而是真正理解了"人在吃烧烤"这个场景,并从场景中推导出一个没有被说出口的需求。从"听懂指令"到"预判需求",中间隔着的就是工具与智能的分界线。工具等命令,智能想在前头。
直播收尾时还有一个花絮:主持人cue到结束,机器人朝着镜头和现场观众挥了挥手。因为是快结束了,郭人杰在说话,技术人员临时起意cue了一下机器人,镜头这才甩过去。正因为完全不在流程里,这个挥手反而可信。没有人给它写过"结束时要挥手"的程序,而是它理解了"结束"这个情境,并用一种属于人类的方式作了别。
这些瞬间之所以值钱,是因为它们没法被"设计"出来。剪辑可以制造完美的动作,但制造不出"被打断后还记得自己在干嘛",更制造不出"没人吩咐却递上纸巾"——那需要模型真正理解任务、理解场景,而不只是回放动作。
04、"敢不敢直播"会成为新的行业暗语
直播结束后,一个有趣的讨论在从业者圈子里蔓延:如果把自己的模型放到同样的赛制下,能撑多久?十分钟?半小时?还是根本不敢开机?
这个问题没有标准答案,但它的存在本身就改变了行业的对话方式。以前大家见面聊参数、聊数据量、聊Demo效果;以后恐怕要先聊一句——你敢不敢直播?
支撑这场直播的以太大模型,按乐享介绍,它是跨本体通用具身大模型,采用以神经元分配为核心的能量驱动架构,与行业主流的VLA路线不同,强调感知、记忆、推理、运动控制的连续闭环;训练仅使用200小时人类视频数据、零真机数据,模型4B大小。在别人还在比谁的真机数据多、参数规模大的时候,它换了一条赛道。
而比技术路线更值得讨论的,是它给行业立下的新规矩:具身智能大模型的强弱,从此有了一个公开可验的衡量方式。模型到底强不强,去真实世界、无人接管、连续作业、对抗干扰的环境里去挑战下。
可以预见,接下来会有更多公司被迫跟进这种"直播验真"的玩法。跟,就要接受同样的不可控;不跟,就要回答"为什么不敢"。而第一个把考场摆出来的人,自然成了出题人。
Demo内卷的时代,也许不会立刻结束。但看过这场直播的观众和投资人,再回头看那些精修的演示视频时,心里都会多一个问题:敢不敢直播?
作为长期观察这个行业的媒体,我们把话说得更明白一点:乐享科技这场直播颠覆的,不是某一项性能指标,而是具身大模型的整个性能标准——衡量的尺度从"演示里的几十秒"变成了"真实世界里的一小时",从"做到过一次"变成了"扛住所有意外、还把事情做完"。标准一旦被改写,行业就回不去了。
对乐享科技自身而言,这场直播更像一次时代坐标的落位:从此以后,提到具身智能大模型,行业想到的第一个参照物,就是那家装进机器人里、在街头烤了一个小时串的模型。可以说,由乐享科技引领的具身大模型新时代,规则已经写好。接下来,是追赶者的时间。


