具身智能为什么需要一个真正的大脑?

Geng2026-09-142628具身智能




 

“从世界模型到真实世界行动,具身智能正在跨过下一道门槛。

进入2026年,具身智能行业最显著的变化,是行业讨论重心的位移,从“身体”转向“大脑”。

资本的流向是最明显不过的信号,相关数据统计显示,今年上半年,国内具身智能赛道融资中,超过一半流向了以“大脑”为主的公司。资本不再单纯为“人形”外观买单,而是聚焦于智能体在复杂场景下的实际履约能力与成本效益比。

与此同时,从权威学术机构到头部厂商的技术路线图,行业里那些最具野心的判断,也几乎同时指向了具身大脑。

这引出一个更本质的问题:机器人为什么需要一个“大脑”?

如果只是执行预设指令,传统的自动化设备已经足够。但如果要让机器人真正进入药房、商超、酒店、家庭这些充满不确定性的真实场景,它需要的就不只是“手”和“脚”,而是一个能够理解环境、推演后果、自主决策的认知系统。

灼识咨询近日发布的《具身智能大脑行业白皮书》,正是试图系统回答这一命题。



 

白皮书指出,具身大脑作为具身智能的重要组成部分,负责上层大模型认知决策——多模态环境理解与任务推理,形成自主决策能力,基于任务目标生成动作规划与执行策略,并支持跨场景泛化和持续学习。

换句话说,具身大脑要解决的,是让机器人从“指令执行”走向“自主决策”。

当然,要真正理解具身大脑为什么在今天被推到台前,还需要回到技术演进的脉络中去。

01.

从VLA到WAM,机器人开始学会“行动之前先想一步”

过去一段时间,VLA几乎成为具身智能大模型最主流的技术叙事之一。

它将视觉、语言与动作统一建模,让机器人从识别物体并执行单点动作,进化到理解自然语言任务并结合视觉环境生成动作序列。

Figure的Helix、Google的RT系列,都选择了这条路径。事实也证明这条路能够走通。经过充分训练后,机器人已经能够抓取、整理、折叠、搬运,甚至完成由几个动作组成的任务。

Figure在2026年初发布的Helix 02,已经能通过单一神经系统完成洗碗机全流程装卸。

但VLA有其边界。其能力更多建立在当前观测到的环境状态与已有动作先验之上。模型学会了从指令和图像直接映射到动作,其建模重点在于“当前该做什么”,而对动作执行后物理世界将如何变化,缺乏显式的预测与推演。在需要连续接触、精细力控、动态应对的复杂任务中,这种反应式的映射方式容易暴露出局限。

于是,世界模型开始进入具身智能讨论的圆桌之上。

世界模型的核心价值在于赋予系统对物理世界的内部推演能力——在行动前模拟后果,从而预判不同动作带来的变化,其更强调对环境、空间关系、物体状态以及动作结果的推演。

这实际上是一种智能范式的升级。举个简单的例子,人在拿起一个鸡蛋之前,并不会真的把所有可能的动作逐一执行一遍;大脑会根据经验、视觉、触觉和环境信息,提前判断力度、方向、物体状态以及可能发生的结果。

当然,世界模型也有自己的天花板。因为“能够预测世界”与“能够在世界中可靠行动”,依然是两回事。



 

进一步演进后,行业开始关注世界动作模型(WAM),这也是白皮书真正着墨之处。

WAM试图将“未来状态预测”和“动作生成”放进同一个闭环,通过预测未来环境状态并生成对应动作序列,实现环境理解、状态预测与动作决策的一体化建模。

VLA、世界模型与WAM三者之间的关系,更像是一层一层叠加的能力维度:VLA让机器人学会“动手”,世界模型让机器人学会“预判”,而WAM让机器人第一次在“动手之前,先在脑子里过一遍后果”。大脑的技术路线由此得到自然生长。

随着WAM被推到台前,具身智能下一阶段最关键的竞争点也呼之欲出:不是单一模型的强弱,而是能否形成从感知到理解、从预测到行动、再从行动结果反哺模型的完整闭环。

从看见到理解,从理解到预测,再从预测走向行动,最终通过行动结果重新反哺模型。机器人智能真正的闭环,正在从“感知—动作”逐渐走向“感知—理解—预测—行动—反馈”。

而这,也正是今天行业持续讨论具身大脑的根本原因。

02.

数据的争夺,从"越多越好"到"越真实越值钱"

除模型架构外,数据同样是具身智能行业讨论中的常客。前者决定具身大脑的上限,而后者则决定具身大脑能否真正抵达这个上限。

灼识咨询在《具身智能大脑行业白皮书》中给出了一个清晰判断。具身大脑训练数据正从互联网通用数据向多源真实世界数据体系演进。这一判断背后,是行业正在经历的一场数据认知切换。

随着模型能力向复杂真实场景推进,单纯追求数据规模已经不足以解释模型能力提升,数据的真实性、物理交互信息和场景多样性开始成为新的竞争维度。以互联网视频数据为例,即便其规模显著、获取成本低,但因缺乏物理世界的深度信息与因果律,在训练时往往捉襟见肘。

竞争焦点已从单纯的数据吞吐量,转向了数据的“物理真实性”与“交互密度”。因此,具身智能的数据竞争,本质上也是物理世界数据的竞争。

白皮书指出,训练数据分为互联网图文视频数据、仿真数据、机器人真机数据以及真实场景无本体数据等路径。其中,真机数据以及无本体数据能够提供真实的物理交互信息。

但问题在于,真机数据虽然宝贵,但成本也很高,难以规模化。



 

行业也曾陷入过一个尴尬的数据悖论:要训练通用模型,需要大规模真机数据;要获得大规模真机数据,需要大量真机部署;要部署大量真机,又需要可靠的模型。这个恶性循环让许多团队在数据采集阶段就耗尽了资源和耐心。

因此,无本体数据、跨本体学习以及真实世界数据闭环,开始成为行业关注的另一条路线。

具体而言,通过不必附着于具体机器人形态的采集数据进行预训练,让模型先理解物理世界的运行规律,再迁移到具体本体和任务上。

数据的真正价值,在于它是否足够真实、足够多样、足够接近物理世界的本质规律。

当机器人从一套动作数据中理解的是“人在面对这样的环境、这样的物体和这样的任务时通常会如何行动”,模型才有可能真正形成跨设备、跨任务迁移的能力。

03.

穹彻智能的探索:一个观察WAM路线的切面

正是在具身大脑的范式演进中,穹彻智能成为《具身智能大脑行业白皮书》重点讨论的案例之一。



 

穹彻智能成立于2023年,定位为具身智能大脑、数据基础设施以及真实场景机器人解决方案方向的全栈物理AI平台。

从行业角度看,穹彻智能的价值在于它所选择的路线,恰好对应了当前具身智能产业的一大关键问题——如何让模型真正进入物理世界。

在技术层面,穹彻智能坚持通用具身智能大模型自研路线,已发布核心产品“穹彻具身大脑”(Noematrix Brain),为机器人提供从指令理解、任务规划到环境感知、执行反馈的完整决策闭环能力。其核心产品Noe-0采用World Action Model架构,输入为连续历史画面与机器人状态,同步预测未来画面以及机器人动作,以此学习真实世界物体、动作与状态变化,并转化为机器人可执行动作。



 

穹彻智能在力觉感知与力控闭环上的积累,则构成了其技术路线的另一块基石。灼识咨询在白皮书中指出,具身大脑的能力演进必然经历从“简单低频即时接触”(如基础抓放)向“复杂高频连续接触”(如擦拭、整理、精细装配)的跨越。而支撑这一跨越的物理底层,正是力觉感知与力控闭环。只有当力成为核心的交互与决策变量,机器人才能真正从“看得见”,走向物理世界里确定性的“摸得准、拿得稳”。而穹彻智能作为WAM架构的代表,首次深度融合视觉与力反馈,实现了感知与执行协同。

在数据层面,穹彻智能探索通过无本体数据来降低模型训练对大规模真机遥操作数据的依赖。穹彻智能的Noe-0在训练全链路中便采用了无本体采集数据,依托2026年在全国47个城市进行的十万小时级家庭场景数据完成预训练,正式验证了无本体采集技术路线的可行性。



 

为了支撑这一数据策略,穹彻智能打造了高效、自然、设计优化的数据采集设备RoboPocket,可将采集设备做到可大规模分发的形态。在2026年世界人工智能大会上,穹彻智能以“World Action Model with 0 Teleop Data”为主题展示了这一技术路线。而在随后的世界机器人大会上,Noe-0驱动的真实机器人完成了礼品装盒任务,完整展示了从视觉感知、任务理解到动作执行的技术闭环。



 

需要指出的是,具身智能今天最大的误区之一,是把Demo当成能力,把“做成一次”当成“已经具备”。

实际上,机器人真正进入商业场景以后,面对的是连续任务、异常情况、人员干扰和大量Corner Case。这也是为什么白皮书特别强调,具身大脑的商业化不能被理解为把一个实验室Demo搬到一个固定场景,而需要在真实环境中形成可泛化、可迭代、可迁移的操作能力。

而穹彻智能彻凭借具身大脑技术优势,已在药房等场景实现规模化应用验证,在商业化成熟度方面具备与头部整机厂商相当的领先优势。



 

灼识咨询白皮书显示,穹彻智能是全球第一家实现真实商业闭环的无人具身药房方案商。其以药房履约为核心商业切入口,已实现批量化场景落地,并完成从识别、抓取、分拣到任务执行的闭环验证;未来将基于具身大脑能力迁移至便利店、商超、酒店及家庭服务等更多场景。

04.

结语与未来

接下来几年,具身智能行业很可能会逐渐出现一个新的评价体系,而最中心的一点是具身大脑的迁移能力。

白皮书已经把这条演进路径描绘得相当清楚:具身大脑的商业化并不会一步跨到完全开放的家庭环境,而更可能从抓取、放置、分拣等即时接触任务起步,再向酒店服务、物流、养老等复杂服务运营场景拓展,最终走向家庭服务、个人护理以及更开放的人机协作环境。

换句话说,机器人产业真正需要的是一个能够持续把任务经验抽象出来,并将能力迁移到下一种任务、下一台机器、下一个场景的大脑。

这也是为什么世界模型、WAM、无本体数据等等会在今天同时被推到台前。

真正的“大脑”从来不是某一种模型的胜利,而是模型、数据、控制与场景的系统化协同。