![]()
“让机器人开始有类人的大脑。
机器人进入陌生房间后,真正困难的不是第一次看到目标,而是目标从视野消失之后。传统机器人擅长回答“我现在看到了什么”,却很难回答“刚才那盆植物在哪里”“旁边有什么”“上次失败后下次该怎么走”。
这些问题指向同一个能力:机器人能否像人脑一样在脑中形成关于世界的认知模型,并随行动不断更新。
9月14日,全球首个类脑具身专题论坛——“类脑智能·认知启新”论坛上,汇聚了上海、北京、深圳等具身智能产业高地、及中国脑计划“南脑”、“北脑”的顶级专家,联动头部大厂与顶尖初创企业,贯通类脑具身算法、芯片、应用生态的全产业链,获得数十家顶尖资本关注,政产学研资全面协同。会上同步发布了首代类脑认知世界模型 Cog-WM 1.0 及全球首份《类脑认知世界模型技术白皮书》,为上海打造全球类脑智能创新策源地、抢占未来产业制高点提供关键支撑。
![]()
机器人大讲堂注意到,该认知世界模型Cog-WM1.0来自具脑磐石,此次发布也同时披露了 Cog-WM 1.0 在导航(Nav)任务和操作(Manip)任务上的验证结果。
Cog-WM Nav 1.0 在导航中验证“主动探索+时空记忆+隐空间预测”,Cog-WM Manip 1.0(论文代号 PAVE)则将多层级预测与价值引导经验学习迁移到操作任务,在 LIBERO、LIBERO-Plus、RoboTwin 2.0 Hard 三个基准上均优于基于海量数据预训练的复现 SOTA 方法 π0.5,其中 LIBERO 提升 1.3 个百分点、LIBERO-Plus 基本持平、RoboTwin 2.0 Hard 提升 6.0 个百分点。
![]()
如果只看结果,这又是一组机器人Benchmark。但如果把导航和操作放在一起看,真正值得讨论的就不是“又多了一个世界模型”,而是一个更底层的问题:具身智能的下一轮竞争,会不会从“谁拥有更多数据”,逐渐转向“谁拥有更好的内部世界表征”?
Cog-WM给出的答案,是把预测从像素空间搬到一个由认知地图组织起来的全局时空记忆空间,再让记忆、预测、行动互相驱动。这可能是类脑具身真正值得关注的地方。如果两者最终能够在统一的机制下闭合起来,那么类脑路线讨论的就不再只是导航效率,而可能触及具身智能更底层的新路线。
01.
VLN/VLA很热,但天花板已经出现?
当前主流叙事围绕两条路线,分别是以LLM为骨干的端到端VLN,以及VLA。
它们架构简单、扩展性好,能借助Transformer和大规模数据快速迭代。过去两年,行业形成了一种默认逻辑:数据足够多、参数足够大、算力足够强,泛化能力就会自然涌现。
但问题恰恰出在这里。导航场景中,第一代 SLAM 路线先建图、再定位、再规划,环境变了就要重来;第二代学习型导航走端到端策略,看见什么做什么,对已探索区域的持久空间记忆支持有限,换一个房间往往要重新适应。
具脑磐石创始人兼 CEO 朱森华博士把今天具身智能的难题总结为“四堵墙”:数据荒、泛化弱、增量难、功耗墙。他认为,这不是工程上再优化两年就能跨过去的问题,而是范式层面的结构性瓶颈。规模扩展推高的是成本曲线,而不是能力上限。
![]()
他把AI与类脑智能突破概括为两条路径,一条是scale路线,靠数据、算力、参数逼近大语言模型能力上限,VLA基本属于这条路径;另一条是借鉴训练架构、模型结构、功能与神经机制,试图突破算法能力上限。如果VLA今天是50分,scale路线是在把它拉到大语言模型的基础上限,而类脑路线想做到100分、110分。
类脑的逻辑不是替代数据驱动,更像是为具身智能补上时空记忆与预测这一课。人脑用约25瓦功耗,在陌生环境里靠很少经验就能行动、记住、举一反三。更少数据、更低功耗、更高泛化、持续学习,这四件事人脑同时做到了。
02.
Cog-WM 的三大核心机制是什么?
具脑磐石技术合伙人 Leon 介绍,Cog-WM 1.0 将认知地图机制工程化为“感知编码与目标调控 + 时空记忆内容与结构分离 + 隐空间多层级预测”的具身导航与操作统一架构;其中Cog-WM Manip 1.0(论文代号 PAVE)把“多层级隐空间预测 + 价值引导经验学习”进一步迁移到操作任务。
![]()
机制一,感知编码与目标调控(前额叶PFC)。认知地图不是地图可视化,而是内部结构化世界表征,包含位置、物体、事件、关系、状态转移。传统方案依赖预置 3D 地图或栅格地图,Cog-WM 在探索过程中在线构建时空记忆;面对连续输入的高维感知信息,系统依据当前任务目标自上而下调节感知编码,优先表征与当前行为相关的空间线索、物体信息与环境变化。
机制二,时空记忆内容与结构分离(海马—内嗅 HPC-EC)。全局时空记忆参考系通过节点保存“物体—位置—上下文”,边保存可通行/邻接关系。稀疏拓扑图 + 三维体系记忆协同,建立了全局时空记忆坐标系。看见的东西会存进 Graph-Voxel 记忆结构,但不是什么都记,只有“和预期不一样”的观测才触发写入,这就是惊异驱动更新。
机器人先无意中看到一盆植物,后来指令它“找到之前看到过的那盆植物”,它从记忆里检索位置、规划路径;问它“植物旁边有什么”,它能回答“一个黑色垃圾桶”。差别不是都能到终点,而是导航系统有没有记忆、预测和主动选择。
机制三,隐空间多层级预测(海马—前额叶协同 HPC-PFC)。它基于 JEPA 隐空间训练范式,对候选动作做“想象式”预测,预测未来全局时空记忆隐空间表征。规划模型结合目标语义相似度、路径代价选导航子目标。记忆更新遵循主动推理自由能原则,用惊异/预测误差决定何时写回。最核心的变化,是预测坐标系从“预测下一帧像素”迁移到“预测未来结构化潜在状态”。认知地图不是解释性装饰,而是成为整体的计算骨架。
机制三进一步在操作侧的延伸,是价值引导的经验学习,这是 Cog-WM Manip 1.0 特有的机制。它在多个时间跨度上同时预测未来隐空间表征,对应海马与前额叶的协同,这是长程探索与长程操作能力的关键。它把经验分成正、负、中性条件来训练策略,对应前额叶—基底神经节的奖励学习机制。失败轨迹也蕴含“后果知识”,不是只模仿成功。
据现场技术报告,在LIBERO-Plus 上的消融显示:无未来预测配置为 80.0%,加入单尺度预测后提升至 81.6%,加入多层级预测后达到 82.0%,再加入价值引导机制后达到 84.6%——完整配置比无预测配置提升 4.6 个百分点、相对提升约 5.8%。
这三大核心机制,加上操作侧特有的价值引导经验学习,共同说明Cog-WM 不是简单替代 VLN/VLA,是在长程记忆、开放探索、低数据场景和高泛化操作上形成差异化。与 BSC-Nav 相比,Cog-WM Nav 1.0 加入“动作条件未来隐空间预测 + 一致性校验”,能减少视觉相似但空间不合理的误判。
也正因如此,类脑路线有望成为具身智能的新一极。
03.
Cog-WM形成全新系统闭环
Cog-WM的闭环包括高层规划、时空记忆、Cog-WM Backbone和Action Expert共同组成。在这个闭环下,机器人进入房间,先环视获得当前位置视觉特征,再从Landmark Memory和Graph-Voxel Memory检索目标。有目标直接导航;无目标则由Cog-WM预测不同探索位置的信息收益,移动后根据预测误差决定哪些内容写入时空记忆。如果新位置没有有效信息,就继续调整探索策略;如果出现此前没有记录的空间关系,记忆就被更新。整个过程不是一次决策,而是一轮轮搜索、验证和修正。
例如在沙发遮挡场景里,BSC-Nav 容易在局部区域反复寻找,因为当前视觉线索不断把策略拉回相似位置。Cog-WM Nav 1.0 则会因为已有预测无法解释当前状态,主动寻找新的语义区域。
据现场演示,机器人更早进入目标所在区域并完成发现。这个案例的价值不在于快了几秒,而在于当目标暂时不可见时,机器人仍能利用已有空间认知决定下一步去哪里。行动开始服务于认知,移动的目的不只是接近目标,也是主动获取能改变判断的信息。
操作流程在此基础上训练出了 Cog-WM Manip 1.0,通过在隐空间做多时域预测,结合价值评估,把正、负、中性经验都纳入策略训练。不是只模仿成功轨迹,而是从失败轨迹中提取“后果知识”。这让系统更像认知系统,而非静态地图系统,也不是纯端到端反应式策略。
据现场技术报告,Cog-WM Nav 1.0 整体模型参数约 1B,训练数据来自 HM3D 仿真环境,约 1.2 万条、共计 15.4 小时,约为主流视觉语言导航(VLN)路线常用数据规模的十分之一量级。
在 HM3D-ObjectNav 相同 50% 评测子集、同一评测协议下,同批评测 episode 复现 Nature Communications 2026 的 SOTA 认知地图导航方法 BSC-Nav:成功率(SR)从 78.50% 提升至 86.89%,提升 8.39 个百分点(相对 +10.69%);路径效率(SPL)从 47.70% 提升至 48.35%,提升 0.65 个百分点(相对 +1.36%)。
这里有一个值得产业界注意的结构,那就是真实机器人落地中,导航失败代价高于路径略长,因此SR>SPL的提升结构反而更贴近产业落地逻辑。SR提升显著,说明目标定位与任务完成更稳定;SPL提升温和,说明优势首先在“更容易找到目标”,而非所有路径都最短。这是一套“可靠性优先”的导航系统。
真机验证方面,据现场演示,具脑磐石将 Cog-WM模型部署在Astribot S1轮式双臂人形机器人,展示了无预建图完成导航到植物旁边、判断植物旁边有什么、找回早期看过的植物,验证了在线认知地图构建、时空记忆检索、空间目标问答等核心能力。
操作方面,Cog-WM Manip 1.0(整体参数约 1.3B)在 LIBERO、LIBERO-Plus、RoboTwin 2.0 Hard 三个操作基准上,均优于基于海量数据预训练的复现 SOTA 方法 π0.5:LIBERO 从 96.9% 提升至 98.2%,提升 1.3 个百分点;LIBERO-Plus 从 84.5% 到 84.6%,基本持平;RoboTwin 2.0 Hard(20 个任务)从 37.2% 提升至 43.2%,提升 6.0 个百分点、相对提升 16.2%。
难度最高、随机化最强的 RoboTwin 子集增益最大,说明类脑机制的优势在开放扰动环境下更为明显。这证明类脑机制和模型架构已经实现从移动延伸到操作。
![]()
导航验证的是认知世界模型最完整的最小闭环,操作验证的是同一套机制能否迁移到另一个任务域。如果只有导航,类脑路线可能只是一个垂直方案;有了操作,它才开始具备“具身智能新一极”的底座意义。
04.
类脑技术如何落地?
从Cog-WM Manip 1.0的表现来看,具脑磐石首代类脑认知世界模型 Cog-WM 1.0 的典型优势其实恰恰在于四个方面:低数据、高泛化、终身学习、低功耗。而这也带来更强的商业落地价值。
低数据压缩训练成本和交付周期。若能用更少数据达到同等效果,进入新场景的成本和周期有望显著下降。高泛化压缩部署成本,免建图、跨场景、开箱即用,换场地不用重来。终身学习改变产品价值曲线,让机器人交付后持续增值,但朱森华博士也坦言,增量学习今天仍然非常困难,是长期攻关方向。
低功耗更是下一步重点,Leon在演讲中明确表示,将借鉴分层编码和惊异驱动自适应计算,降低推理成本,进而降低终端BOM成本。
商业策略上,具脑磐石把验证成熟的能力逐步转化为客户可感知的产品与解决方案,技术成熟一部分就变现一部分,即“沿途下蛋”,并通过真实场景反馈持续推动模型研发。商业测,公司将向客户提供 MaaS 服务、联合芯片伙伴做算推一体模组产品、以及面向终端客户场景的整机解决方案或者RaaS服务。
长期来看,具身智能只是类脑具身的一条应用赛道,同一体系未来还可向泛端侧 AI、智能家居、康养体系提供支持。后续,具脑磐石计划把导航与操作机制融合训练,支持长程移动操作,并在更高数据效率下探索更大模型参数,未来还将借鉴主动探索与奖励发现机制,让机器人在动态环境中持续成长。据悉,具脑磐石还将于9月17—19日参加华为全联接大会(HC大会)。
05.
结语:具身智能需要“新的一极”
当机器人不再“读死地图”,而是像人一样“长记性”,具身智能才真正开始。当同一套类脑机制从导航走向操作,从主动探索走向价值引导的经验学习,类脑路线就不再只是具身导航的“第二极”,而是具身智能的“新一极”。
这一极的核心,是在共识终局下选择了一条少有人走的路。投资人的共识不在技术路线本身,而在产业终局:能否用更低成本、更少能耗,让机器人在开放物理世界里真正规模可用。
主流路线也在补记忆,典型做法是外挂式,如长上下文、检索增强,在统计学习骨架上打补丁。类脑的做法是内生式的,记忆、预测、行动在同一个闭环里互相驱动。短期看两条路都能提升表现,差别在长期:补丁只会越打越多,但闭环会自己长。
随着具身智能走向产业水深处,竞争最终不是流派之争,而是“谁能先把机制变成可验证的系统”。Cog-WM 1.0 给出了一个新的答案。接下来需要观察的是统一模型何时打通,长程闭环何时跑通,低功耗何时可测量,全身协同何时从移动和单手操作延伸出去。这些答案,将决定“新一极”能否真正跑出来。
