![]()
“机器人的“裸考”时代来了?
具身智能行业正在经历一种“虚假繁荣”。几乎每周都有新Demo,机器人叠衣服、倒咖啡、分拣零件……镜头切换之间配上音乐,足够让外界产生一种错觉。
通用机器人似乎已经近在眼前。
但事实是,行业正在被高光片段喂饱,却在真实世界的证据上挨饿。
Demo是结果,行业缺的是“过程”。当计划失效、环境突变、有人故意捣乱,机器人究竟是靠自主智能扛过去,还是靠剪辑把失败藏起来?
这个问题并非杞人忧天。2026年6月,Google DeepMind在欧洲选中的机器人合作伙伴Qualia发布了一段人形机器人洗碗的视频,动作之流畅令人惊叹。然而创始人Fabian Kerj最终承认,视频中的人形机器人“不是真的机器人”,公司“构建的是训练基础设施,不是硬件”。同年7月,马斯克在特斯拉二季度财报电话会上直言,网络上流传的各类机器人精彩演示“大多依靠提前编写动作程序或是后台人工远程操控”。
当一段Demo可以靠反复调试、脚本预设甚至后期剪辑来“打磨”,它传递的信息量正在急剧衰减。
在这个背景下,乐享科技做的事情显得有些“不合时宜”。他们于近日将最新发布的以太大模型放进了一场户外直播中,没有剪辑,没有遥控,没有预设脚本,甚至允许现场观众随时打断、改需求、挪东西。
![]()
01.
从Demo到直播,从选择性展示到全暴露验证
对于行业来说,一个漂亮的Demo远远不够。
如前所述,Demo天然存在信息缺口。它展示的是最终完成任务的结果,观众看不见失败、看不见卡壳、看不见那几十次没录进视频里的尝试。更关键的是,Demo 往往是实验室在最优条件、最优一次下的切片。
环境可控、光照稳定、干扰缺席、可以重来。
因此,乐享科技选择对这个“缺口”发起正面冲锋,将以太大模型放进了长时户外公开直播。
9月16日傍晚,两台搭载以太大模型的机器人互相配合,完成了一场完整的户外烧烤任务。
从现场来看,机器人在没有人工遥控的情况下,自主完成了从点单、任务规划、烧烤到上菜的完整流程,其中还会受到来自客人的干扰,如临时改变需求、打乱物品位置等等。
尽管中途有失误,但这正是直播挑战的价值所在。镜头没有剪辑,也没有重来的机会,每一次机械臂的抖动、每一秒的决策延迟,都赤裸裸地暴露在公众视野中。
这种“全暴露”并非自曝其短,乐享科技想要展示的也绝非是“100%完美完成任务”这类确定性结果。相比实验室里选最优一次展示的惯例,把一个会犯错的模型实时暴露给所有人,本身就是对“自主进化、持续学习、自主判断”这些技术主张最硬核的公开验真。
![]()
具体而言,这场烧烤局要验证的是五件事。
第一,长时序任务。从接收订单、理解需求,到准备、执行、完成交付,机器人需要持续维持任务状态数分钟乃至更久。
第二,真实环境变化。户外意味着光照、风、地面、围观人群的走动全部不可控;物品位置、人的需求随时可能改变。机器人必须在原计划失效之后重新处理问题。
第三,失败恢复。抓错、烤糊、被撞、被调换物品——做错了、被干扰了之后,能不能意识到问题并继续任务,而不是原地报错退出。对机器人而言,“意识到自己错了”比“做对”更接近智能的分界线。
第四,自主决策。现场没有人通过遥操作接管。所有决策由以太大模型自主完成,这也许是第一次在直播中大规模观察到机器人在开放环境中的决策密度与决策质量。
第五,持续学习与进化。以太大模型最终想验证的不只是一次任务完成率,而是机器人能否在不断与真实世界交互的过程中,持续获得新的经验与能力。
值得注意的是,行业并非没有类似的长时直播尝试。此前,Figure公司的F.03机器人曾连续工作超过100小时分拣包裹,智元精灵G2也在真实产线完成过6天64小时全透明直播作业,成功率高达99.99%。但这些验证的共同特征在于:任务高度结构化,环境高度受控。
乐享此次挑战,正是从“结构化环境中的稳定执行”跨越到“非结构化环境中的自主决策”的一次勇敢尝试。
那么,在直播镜头前支撑两台机器人自主应对干扰的,究竟是一套怎样的技术系统?
02.
回先看Demo:那些“自己想办法”的瞬间,比任务完成本身更有价值
回答这个问题,需要回溯到直播之前的那个引爆行业关注的Demo。
具身智能的叙事大多建立在Demo之上。但Demo与Demo之间亦有差别。
乐享科技此前发布的10分钟一镜到底Demo,在具身智能圈流传,提供了几个极具说服力的智能切片。
在首发Demo中,两台不同品牌,硬件结构、自由度、传感系统完全不同的机器人,在同一个真实的居家环境里协同收拾房间。它们只接收一个高层指令,在无遥操、无剪辑、无该场景大规模预训练的条件下,自主完成整套任务,成为圈内热议的对象。
有三组瞬间值得反复看。
首先,机器人学会了主动改造环境主动寻找使用工具。遇到高处物品拿不到的情况时,它不会停下报错,而是会转身在房间里自主搜寻工具,搬来物件垫脚,再够取目标完成任务。
其次,机器人学会了自主判断问题。擦玻璃时,如果内侧反复擦拭都无法清理干净,它会推断污渍可能在玻璃外侧,主动将手伸到窗外继续清洁。
最后,机器人学会了协同补位。当一台机器人碰到自身能力无法解决的问题时,另一台机器人能察觉情况并主动介入。
而实现这一切,只需要给机器人下达一个总体目标,两台机器人就可以自主分工,推进任务。
这些瞬间指向的是同一个核心问题。当原来的计划失效时,机器人能不能自己发现问题、重新判断、调整策略,然后继续把事做完。
这恰恰是当前主流技术路线的一个结构性盲区。
VLA(视觉-语言-动作)模型走的是“感知-动作”直接映射的路,优势在于语义理解和实时响应,但它跳过物理环境建模,面对训练数据未覆盖的新场景,泛化能力会显著退化。WAM(世界动作模型)试图通过“先预测世界状态再反推动作”来弥补物理认知的缺失,但语义理解偏弱,推理算力开销大。
两条路线各有千秋,但在“计划失效时的自主恢复”这个维度上,它们都还不够。
以太大模型选择了一条不同的路。它把任务完成度、物理约束、记忆和动作可行性整合进一个统一的能量系统,让机器人不是“匹配过去见过的模式”,而是“寻找当前最合适的行动方向”。同时引入了Self Model——世界模型理解外部环境,自我模型理解自身。
正是这个自我认知层,让同一套智能系统换到两个完全不同的身体上时,仍然能清晰判断自己的能力边界。
![]()
支撑这一切的是一组在行业内极具挑衅意味的数据。约 200 小时人类视频、0 小时真机训练数据、4B模型大小。在行业普遍以“万小时真机数据”作为准入门槛的语境下,这个数字本身就是一种技术主张的宣言。
乐享押注的,是一条不完全依赖海量真机数据和参数堆叠的Physical AI 路径。作为中国具身智能阵营中不可或缺的一员,乐享科技在模型架构、演化机制与现实部署层面,已经形成技术闭环,而以太大模型正是这闭环从理念走向公开验证与工程落地的核心载体。
03.
以太大模型的路线:做脑-脊髓贯通的Physical AI
理解以太大模型的关键,在于它如何组织智能。
以太大模型构建了一套完整贯通的仿生神经通路:一端抵达高层情景记忆与意图认知,对应人类大脑;另一端直达力-位控制、本能反射,对应人类脊髓。上层认知、中间感知记忆、底层运动控制不再是割裂独立模块,信息流双向贯通,形成闭环链路。
整套架构对标人脑关键功能单元进行了系统性的功能映射。
![]()
- 前额叶皮层:作为思考中枢,负责解析意图、长时序规划、情景记忆调取与目标推演,同时承担元认知能力,即评估自己“知道什么、不知道什么”,识别任务风险,不盲目输出无法落地的方案;
- 角回与内嗅皮层:承载流式长时记忆与情景记忆,把每一次真实交互沉淀为可调取、可更新的经验;
- 顶上小叶和上丘:构成主动感知中枢,区别于“给什么图像就处理什么”的被动拍照式感知,机器人会自主转动视角、调整观测姿态,主动去补齐信息盲区;
- 运动皮层与小脑:负责运动规划与动态调节,小脑单元持续接收传感器反馈,实时补偿物理世界的扰动;
- 脊髓层:最靠近本体的本能反射层,原生处理力控、位置闭环、摔倒防护、触碰避让等行为,遇到突发碰撞不需要高层认知慢慢推理,直接快速响应。
这套架构的关键词是“贯通”。从高层意图思考,到记忆调取、环境感知,再到运动规划,最后到躯体本能反射,整套通路端到端流转。思考的结果直接流向躯体控制,躯体传感器的反馈又回传给上层认知,实现思考与行动双向互通。
在这个闭环之上,五大能力深度耦合。
主动感知,让机器人面对遮挡和局部视角不全时,主动寻找关键线索。多模态理解,让机器人统一处理视觉、深度、力觉、听觉等现实物理世界的多源信号,理解物体尺寸、材质、空间位置和约束关系。流式记忆,让机器人在环境中的每一段交互、看到的画面、完成的任务、人类的指令,都作为情景记忆持续沉淀。运动动力学,让模型理解重力、惯性、接触力、摩擦等物理约束,在抓取、搬运、操作物体时输出符合物理规律的动作。自我迭代,则让机器人基于现实交互反馈完成闭环进化,在真实环境交互过程中持续优化。
依托这套脑-脊髓贯通的仿生架构,Aether试图赋予机器人接近人类水准的物理直觉与元认知能力,成为一个能理解物理世界、能记住过往、能评估自身、能持续修正的心智系统。
![]()
更重要的是,Aether并不是绑定在特定硬件上的“专用算法”,而是一套跨本体的机器人智能基础模型。同一套智能能力可以进入不同机器人身体,不同本体之间能够基于同一个智能系统继续工作甚至自主协作。
从消费级机器人产品矩阵,到全栈技术自研体系,再到开源生态和跨本体通用大模型,乐享正在构建一个从“大脑”到“身体”再到“生态”的完整具身智能版图。
这个版图的战略逻辑很清晰:硬件决定机器人能进入哪些场景,但决定机器人能不能在场景中真正自主干活的,是大脑。
Aether要做的,就是那个让不同硬件都能“长脑子”的底层智能基座。
04.
结语与未来
具身智能行业正在经历一个微妙的转折。
IDC在2026世界机器人大会的洞察中明确指出,机器人产业竞争的分水岭正在从技术Demo能力转向稳定交付能力。2026年上半年中国人形机器人出货量超过4万台,已经超过去年全球出货量的两倍。
硬件不再是瓶颈,真正的考验在于,机器人能不能在真实环境里持续、稳定、自主地干活。
在这个转折点上,乐享科技选择公开直播验证,本质上是在回答一个没有被认真对待的问题:衡量具身智能的标准,是不是应该从“它能做什么”转向“它在做不了的时候怎么办”?
Demo展示的是能力的上限,直播暴露的是能力的下限。而上限可以靠调试和剪辑来美化,下限才是一个模型真实水平的诚实反映。
从首发Demo到户外长时直播,是同一个技术逻辑的两次验证:先证明机器人能够自主解决问题,再把这种能力放进一个真正不可完全预设的世界里。前者展示的是可能,后者检验的是稳定。
这场直播最终的成绩单如何,需要交给行业、交给大众来评判。但有一点已经可以确定。
在一个Demo泛滥、信任成本越来越高的行业里,愿意把模型直接放进公开的、不可剪辑的、有人持续干扰的环境里,本身就是一种值得被看到的姿态。
因为真正的自主智能,不是在最好的条件下做对一件事,而是在最不确定的条件下,依然能决定下一步该往哪里走。
