“10分钟理清真实客厅乱局,贝塔无限的WAM很能干。
今天的具身智能,单点操作能力越来越惊艳,连续任务执行却频频翻车。会抓、会放、会拧,不代表能独立完成一件完整的事。
放眼全球具身智能赛道,绝大部分令人惊艳的demo,本质上都是固定台面操作或单一任务移动操作。
美国具身智能明星公司Generalist AI于2026年4月发布的GEN-1模型,将折叠纸箱、包装手机、维修扫地机器人等精细操作任务的成功率从64%提升至99%,完成箱体组装仅需12.1秒。但翻开其演示视频,任务几乎全部在固定台面上完成。Gen-1可以在一小时内学会新任务、重复1800次保持99%成功率,但它的世界,始终没有离开那张桌子。
另一家明星公司Dyna Robotics于2026年8月发布的DYNA-2,以超过100万小时人类第一人称视频预训练,将客户现场零样本通过率从46%提升至87%。但展示的核心任务仍是“拧开瓶盖”“转动钥匙”这类桌面级单一操作。虽然DYNA-2被定位为“世界-动作模型(WAM)”,但其demo所呈现的任务尺度,仍停留在单点动作层面。
换句话说,无论是走VLA路线还是世界模型路线的行业头部玩家,现阶段展现的“操作智能”,大多停留在“动作智能”层面,离完整的“任务智能”还有巨大的鸿沟。
而真正决定消费级机器人能否走进家庭的,是另一个维度的能力,即在开放、动态、持续变化的环境中,自主完成长程、多目标的移动操作任务。
这也是贝塔无限选择的技术锚点,旨在让业界看到“非标长程操作任务”的具象化演示。
这家2026年3月才正式运营的公司,敢于直面消费级具身智能领域难题,并在短短几个月内连续完成数亿元融资,究竟凭什么?答案就藏在其最新发布的世界动作模型BetaWAM0.1真机操作demo中。
在这个demo中,贝塔无限要展示的是一个统一模型如何全自主完成长程复杂的移动+操作任务,从搜索、抓取到归位,从遮挡推理到失败恢复,全程无需人工干预。
而贯穿这一切的底层逻辑,是贝塔无限从一开始就锚定的核心定位:以人为中心,打造业界最懂人的具身智能大脑和产品。而这条路的起点,是把“记忆”和“对空间和物理理解能力”从伪命题变成真能力,并让它在操作中真正生效。
01.
长程操作首秀,一个demo全自主搞定
BetaWAM 0.1的demo场景设定在一个动态居家环境中,机器人需要连续完成多个目标的搜索、抓取与归位,期间面临人为遮挡、物体被临时移走、新物品突然加入等即时干扰。
行业内现有的演示,要么是固定台操作,要么任务过于标准化,要么只覆盖短短几十秒的单一动作。而BetaWAM 0.1运行的是“移动+操作”的长程闭环,任务全程没有人工干预,机器人需要在不同位置完成多次抓取与归置,全程保持同一套模型自主决策,应对随时出现的意外。
这种“跨空间连续操作”的能力,恰恰是当前VLA和世界模型路线最薄弱的环节,也是贝塔无限试图定义的“任务智能”。VLA擅长桌面操作但缺乏空间连续性,世界模型擅长预测但难以实时响应物理干扰。BetaWAM 0.1要做的是把两者“缝起来”,让机器人在移动中保持操作精度,在操作中保持空间意识。
Demo的第一个突破,是抓取的泛化能力。
在demo中,机器人面对形态各异的家庭物品,能够基于记忆中对物体材质、重心和表面特性的判断,实时调整抓取策略。例如,面对不规则玩具,系统能快速找到稳定的夹持点;面对柔性绘本,系统调用记忆中的接触力细节,轻夹不卷;面对光滑垃圾,系统增大接触面积,确保稳定。
这种泛化性,本质上是状态管理在控制层的一次胜利,它让每一次抓取都是“有根据”的。
![]()
第二个突破,是空间理解与短期记忆的结合。
demo中有一个令人印象深刻的场景,最能体现“任务智能”的瞬间。任务执行过程中,工作人员临时用一本书遮住了地上的乐高块。从当前视觉画面上,机器人看不到乐高。对一般模型而言,目标从视野中消失,意味着任务中断。但BetaWAM 0.1的行为截然不同,没有愣住,也没有绕过这个目标。它根据记忆中乐高块被遮挡前的位置,结合书本出现后的状态变化,推演出乐高就在书本下方,然后自主伸出手臂,先移开书本,再捡起乐高块,完成收纳。
这是模型在物理空间中建立起了“物体可以被遮挡、但并未消失”的推理能力,并且能够基于记忆与当前观察的对比,做出“推演—验证—行动”的决策链。这种能力,正是长期记忆与空间关系推理融合的典型体现。
第三个突破,是对环境变化的快速适应。
任务执行过程中,工作人员会故意制造干扰,比如把某个物品从原位移走,或者突然在机器人面前放入一本新书、一团垃圾。BetaWAM 0.1没有被这些意外打乱节奏,它会在线调整,重新扫描区域,更新任务状态,甚至主动移动到底盘或机械臂更适合的位置,重新规划抓取顺序。
这种适应能力,在固定台操作中并不罕见——因为干扰范围有限,重新感知即可。但在移动操作中,干扰可能发生在任何位置、任何时刻,系统必须在"正在移动"的状态下完成重新规划。BetaWAM 0.1展现出的,正是这种"移动中应变"的能力。
![]()
第四个突破,是失败恢复能力。
demo中有一个细节,有一个乐高块在抓取过程中掉落,滚到一边。BetaWAM 0.1没有中止任务,也没有从头再来,而是感知到“这个目标尚未完成”,随即调整自己的位置和机械臂方向,重新拾取掉落物,并继续执行主任务。这种“自主纠错”的鲁棒性,源于系统对任务状态的持续维护,是在真实物理世界中稳定服务的关键。
第五个突破,是双手协作能力。
家庭任务中大量操作需要双手协同。demo中,机器人展示的左右手协作尤为关键,比如一只手打开抽屉,另一只手同时伸入取出物品;或是一只手固定容器,另一只手将散落物件逐一归位。
这种双机械臂协同的难点,在于双手之间“任务状态”的实时同步。BetaWAM0.1的共享记忆平面让左右手共享同一份“当前状态”——左手知道右手已经打开了哪个抽屉、放到什么位置、容器是否已满。正是这份共享的“判断”,让双手不会互相干扰,动作序列严丝合缝,仿佛一个完整的“身体”在工作,而非两个独立机械臂的简单叠加。
![]()
整场demo看下来,一个最直接的感受是,机器人不是在演示一组动作,而是在完成一件事。它知道哪些物品已经收好、哪些还没处理、收纳筐在哪里、下一步该往哪走。这份“任务级”的连贯性,才是BetaWAM 0.1最核心的突破,也是“任务智能”区别于“动作智能”的分水岭。
02.
“记忆—动作—验证”的闭环
看到这里,你可能已经意识到,demo中那些“不像机器人”的表现,背后是一套完全不同的系统设计。
当前行业的主流路线本质上都在解决“单点任务的最优执行”,VLA模型回答“当前画面下该怎么动”,世界模型回答“下一步世界会变成什么样”,但两者都缺少一个关键环节:任务状态在空间移动中如何持续维护?
BetaWAM0.1的领先之处,在于一个根本性的观念转变,它为具身记忆加上了“判断和理解”,且是一份由连续观察、动作和反馈形成的、可被新证据推翻的、关于世界的动态判断。
这一本质刻意分开了两样东西:历史证据和当前状态。历史证据确实发生过,例如某一刻的图像、一条抓取指令、一次传感器读数、一句用户反馈,这些证据必须可追溯,不能被后续推理悄悄改写。当前状态则是系统的判断,比如“杯子大概率进了左侧柜子,但柜门挡着,还得确认”,状态允许被推断,也必须随新证据更新。
分开之后,环境的上下文就从一条流水账变成了一个环:证据支撑状态,状态约束行动,行动带来新观察,新观察再回头验证或修正状态。
![]()
那么这份判断如何形成?又如何为操作服务?记忆按三个维度进行组织。
载体维度上,token记忆承载可读、可追溯的状态与任务记录;latent记忆不转成文字,直接以向量形式保留视觉、空间、接触与力的细节;参数化记忆把反复验证过的稳定经验沉淀进策略或模型。
功能层维度上,实时记忆维持动作连续性;实体记忆追踪对象和位置;情景记忆串联事件和证据链;经验与技能记忆提炼可跨任务复用的方法。四者是流动的:实时观察更新实体状态,一串状态变化构成情景,多个情景沉淀为经验。
回路维度上,在线回路低延迟读写、更新、验证,负责“这一次做对”;离线巩固回路做重放、聚合、抽象和归因,负责“下一次做得更好”。
更重要的是,这套记忆架构不是孤立运转的,它与VLA(视觉-语言-动作模型)和World Model(世界模型)深度耦合。VLA不再只看当前几帧画面,而是接入短时动作状态和长期物理经验,减少“目标被挡就抓空”和“同一个物体反复试错”。世界模型利用记忆中的完整状态和历史预测误差,预判动作后果,再由验证器判断“抽屉到底关好没有”。
![]()
正是这种“记忆—动作—验证”的闭环,支撑了demo中长程任务的不间断执行。
而这恰恰也是“以人为中心”的技术表达。因为真正懂人的机器人,不是被动执行命令,而是能像人一样对世界保持警觉,知道什么时候该确认、什么时候该问、什么时候该调整。
记忆,让机器人具备了对人负责任的能力,也让机器人的每一次操作都有了“上下文”。
03.
贝塔无限从“动作智能”到“任务智能”的升维之路
贝塔无限的BetaWAM路线是对消费级具身智能本质的深刻理解。实验室demo只需要在受控环境下成功一次,家庭服务则需要在开放环境下连续成功一千次。两者之间的差距,不是算力,不是灵巧手自由度,而是对世界状态的持续追踪、对任务进度的可靠维护、对异常情况的优雅恢复。
一言以蔽之,是从“动作智能”到“任务智能”的升维。
在贝塔无限的设计哲学里,“懂人”的技术表达贯穿记忆架构每个维度的设计原则。机器人记住的不仅是物理世界的状态,更是与它共同生活的那个人的一切。当机器人带着这些“记忆”去完成每一次抓取、每一次协作、每一次升降,它就不再是执行指令的工具,而是一个真正“以人为中心”的智能体。
而这次,贝塔无限用真实场景下的工程机实操演示证明:他们不仅具备记忆这一推动操作升维的核心引擎,又掌握了支撑长程复杂操作与强泛化的真实能力抓手,这正是贝塔无限通往“最懂人的具身智能”的核心密码。
据悉,贝塔无限目前正全力研发首款本体产品,将搭载其自研的技术架构,先锋体验版计划年内亮相。
04.
结语
BetaWAM 0.1的真机操作demo,是架构从理论走向实用化的关键一步。它宣告具身智能的竞争,正从比拼单点操作的“动作智能”,转向比拼连续执行的“任务智能”。
就在即将举行的2026世界机器人大会(WRC 2026)上,贝塔无限联合创始人兼CTO陶帅将在AI大模型赋能机器人与具身智能产业新范式交流活动中登台,发表题为《以人为中心:面向人机共融场景的具身技术新范式》的演讲。
这场演讲,可以看作是对这个demo背后技术理念的一次系统性阐述。当行业仍在追逐单点操作的极限时,贝塔无限已经把叙事拉回到了“人”的维度。
当机器人拥有出色的空间和物理理解能力,同时有记忆属性,当它能记住物体的位置、能推演遮挡背后的存在、能在失败中自主恢复,它才真正具备了在家庭中长时服务的能力。贝塔无限在这条路上扎下的“以人为中心”的根,正生长出一种不疾不徐、但步步逼近终局的独特底气。
