2026年8月12日,一场没有剧本、全程公开的物流分拣直播,在具身智能圈投下了一颗重磅炸弹。
自变量机器人挑战全球机器人物流分拣最快直播,开启了连续一小时的公开实测。最终数据定格在1816件/小时。这一数字,比美国头部具身智能企业Figure AI此前创下的1248件/小时行业标杆,提升了45%左右。
更值得关注的是,自变量使用的硬件仅为两条机械臂+夹爪,相较美国Figure AI的“人形机器人+五指灵巧手”方案,成本大幅下降约70%。不仅如此,它处理的是物流产线上的真实包裹,复杂随机性远超Figure AI的标准化包裹,并且实现了超过98%的分拣准确率。
![]()
抛开直播本身的直观冲击力,更值得关注的,是这次反超背后的技术路线差异。当海外头部企业纷纷押注“人形本体+五指灵巧手”的硬件堆叠路线时,自变量仅凭双机械臂加标准夹爪的朴素硬件配置,就实现了效率与工况难度的双重超越。
![]()
01.
一场“非对称反超”
在讨论效率之前,我们必须先厘清一个关键前提:不同工况下的分拣效率,不具备直接可比性。
把时间拉回几个月前。2026年5月,Figure AI在圣何塞总部开启了一场持续数百小时的物流分拣直播,最终Figure 03人形机器人在200小时连续作业中累计处理包裹249558件,平均效率1248件/小时。这场直播在全球范围内引发轰动,被视为人形机器人进入工业场景的里程碑事件。
此后Figure AI又进行了10小时人机对战,人类实习生以12924件对12732件的微弱优势险胜,单件耗时仅相差0.04秒,进一步印证了人形机器人分拣效率已逼近人类极限的判断。
但一个经常被忽略的细节是:Figure AI的测试场景中,包裹以规格标准化的快递包裹为主,规整度相对较高。这就好比在标准跑道上测百米成绩,成绩固然优秀,但与真实赛场的复杂环境仍有差距。
而自变量这次直播实测,选择了完全还原真实仓储的杂乱工况。
根据直播公开信息,此次测试的包裹类型极为庞杂:既有常规的电商纸盒、快递软袋,也包括圆柱形快件、泡沫封装生鲜件等非常规异形件。所有包裹的大小、重量、形状规格均无统一标准,摆放姿态完全随机,模拟人工上料的真实状态。
![]()
这种工况差异,对智能系统提出了本质不同的要求。标准化包裹场景下,系统只需要掌握有限的抓取策略;而全随机异形包裹场景,则要求模型具备真正的物理理解能力和动态决策能力。
面对不同属性的包裹,自变量的WALL-B模型展现出了基于物理认知的差异化作业策略:
搬运策略分层:轻质包裹直接夹爪夹取搬运,最大化吞吐效率;较大较重的箱体则采用双臂搬运、侧面推移方式,避免强行抓取造成包裹损耗。
面单整理自适应:小件轻件利用惯性快速翻转;重件采用渐进式分步翻转;衣物类软质包裹则先通过拨、摊动作整平,再校准面单朝向。
![]()
全程无人工干预兜底、无故障停机,连续吞吐表现稳定。这种基于物理规律认知的动态决策能力,是预编程专用分拣设备与简单视觉方案无法实现的,也是通用具身智能大模型的核心价值所在。
更难的工况,更高的效率,这才是自变量这次实测真正的含金量所在。
02.
硬件堆叠,还是模型优先?
效率数字的背后,是两条截然不同的技术路线的对撞。
海外头部企业普遍选择的路径,可以概括为硬件优先路线。以人形本体为基础,搭配高自由度五指灵巧手,通过堆叠硬件自由度来拉升能力上限。这种路线的底层逻辑是,用硬件复杂度补足模型能力边界,当模型不够“聪明”时,就让手更灵活、身体更像人。
Figure 03就是这一路线的典型代表。全身人形结构,搭载五指灵巧手,手掌内置摄像头与触觉传感器,单台硬件成本极高。这种方案的优势是形态上与人兼容,理论上可以无缝进入人类工作空间;但劣势也同样明显,结构复杂、故障率高、运维成本昂贵、部署周期长。
而自变量选择的,则是一条“模型优先、硬件务实”的自主路线。
在自变量的技术哲学里,硬件应该服务于场景,而非为了人形这个形态符号付出不必要的成本。既然物流分拣的核心需求是高效、稳定、低成本地处理包裹,那么最合理的硬件构型就应该是双臂机械臂加标准夹爪。
![]()
这种路线差异,带来了三个维度的全面重构:
1.部署成本的数量级差异
去除人形冗余结构、采用工业通用标准夹爪,使得自变量方案的整体部署成本较海外同级别方案显著下降。成本下降的本质,是无需为“人形形态”“五指灵巧手”等与分拣场景无关的硬件能力付费。
据团队测算,在当前同等分拣产能下,双臂夹爪方案的整体部署硬件成本(含本体、夹爪、工控及基础适配)仅为Figure AI人形机器人方案的30%。若将后期运维、备件更换及产线改造费用一并计入,全周期成本优势更为显著。
2.运维效率的本质区别
标准夹爪结构简单、零部件少,连续作业故障率远低于高自由度五指灵巧手。仓储场景的核心诉求是7×24小时连续运转,任何停机都意味着产能损失。
五指灵巧手虽然灵活性更高,但精密关节的校准、维护、更换都需要专业技术人员和较长的停机时间。而标准夹爪几乎是工业界最成熟的部件之一,备件充足、更换便捷、维护成本极低。对于追求稼动率的仓储场景而言,这种可靠性差异直接决定了方案的商业可行性。
3.落地周期的差异
双臂机械臂构型可直接嵌入现有仓储分拣工位,无需大规模改造产线与人行作业空间。而人形机器人方案则需要适配人形作业空间,对产线改造提出了很高要求。
这意味着自变量方案可以快速复制到多类仓储场景,大幅提升产业落地效率。在当前物流企业普遍追求快速验证、快速落地的背景下,这种工程化优势尤为关键。
当模型对物理世界的理解与控制能力足够强时,行业不再需要通过堆叠昂贵的精密硬件来拓展能力边界。这是自变量这次直播传递出的最重要信号。
03.
WALL-B:“世界统一模型”架构的底层革命
那自变量凭什么用“低配”硬件打赢了“高配”对手?答案不在硬件,而在模型的“脑子”里。
2026年4月,自变量发布了全球首个基于“世界统一模型(WUM)”架构的具身智能大模型WALL-B。这一架构的关键突破在于:它将视觉、语言、动作、物理预测等所有能力,放在同一个网络中从零开始联合训练、融为一体,消除模块间的边界和数据搬运损耗。
![]()
在WALL-B之前,VLA模型是当前具身智能行业主流技术框架,其核心思路是将视觉、语言、动作三个模块拼接在一起:视觉模块负责感知,语言模块负责理解指令,动作模块负责输出控制信号。Google的RT-2、Physical Intelligence的π*等代表性模型,都属于这一技术路线。
但VLA架构有一个天生的缺陷:模块拼接必然带来信息损耗与延迟。视觉特征提取后传递给语言模块,语言模块决策后再传递给动作模块,每一次跨模块的数据搬运都会丢失信息、增加延迟,效率和准确性自然打折扣。
更本质的问题是,拼接式架构无法真正理解物理规律。
它可以模仿见过的动作轨迹,但很难对未见过的场景做出符合物理常识的推理。这也是为什么很多VLA模型在演示场景表现惊艳,一到真实复杂环境就频频翻车的原因。
而WALL-B的WUM架构,将视觉、语言、动作、物理预测等所有能力,放在同一个网络中从零开始联合训练、融为一体,基于这一架构,WALL-B实现了三项核心技术特征:
![]()
第一,更强大的空间推理能力。因为感知和决策在同一个网络中完成,空间几何信息不会在模块传递中丢失,模型对物体位姿、空间关系的理解更加精准。
第二,真正的物理规律理解能力。WALL-B能够理解物理世界的力学规律、材料属性、运动惯性,并能预测环境与事件的演化。这就是为什么它能针对不同包裹自动选择不同的抓取和翻转策略。
第三,记忆与自我进化能力。模型能在与环境的互动中积累经验、自我优化。这意味着部署得越久、数据越多,模型的表现就会越好,形成正向循环。
还有一个值得关注的地方是,今年5月自变量开源了Wall-OSS-0.5模型,在全球范围内首次实现了无需针对下游任务进行后训练,预训练后的模型直接部署到机器人上即可完成多种操作任务,部分零样本泛化表现接近常规微调后的水平。这从侧面印证了WUM架构在泛化能力上的优势。
从拼接式VLA到原生统一的WUM,具身智能大模型正在经历一次底层架构的范式转移。而自变量,恰好站在了这次转移的最前沿。
04.
同一套模型,从客厅到仓库
看到这里,一个自然的疑问是:自变量是不是专门为物流分拣定制了一套模型?
作为机器人大讲堂长期关注的具身企业,熟悉这家公司的读者知道,答案恰恰相反。它是国内最早采用完全端到端路径实现通用具身智能大模型的公司之一,并且在全球范围内率先实现了家用具身机器人的规模化落地。
今年上半年,自变量联合58到家在深圳率先推出机器人上门家政服务,机器人跟随专业保洁员入户,协同完成清洁、收纳等精细化任务。目前,这项服务已从深圳拓展至北京。7月,自变量又与深圳社会福利服务指导中心合作,将人形机器人投入老人颐养院,承担日常巡查、物品递送、语音陪伴等照护工作。本次物流分拣的能力突破,并非针对物流场景定制开发的专项技术,而是同一套模型能力从家庭场景向工业场景的自然延伸。
![]()
这才是“通用具身智能”这六个字的真正含义。
过去,工业机器人领域的通行做法是“一场景一模型”,分拣机器人专门训分拣的模型,码垛机器人专门训码垛的模型。每种新场景都要从零开始采集数据、训练模型,边际成本很高,落地周期很长。这本质上还是专用自动化的思路,不是通用智能的思路。
而通用具身智能的核心价值在于,当模型具备了对物理世界的通用理解能力,场景拓展便不再是从零到一的重复研发,而是底层能力的自然外溢。
家庭场景与工业分拣,看似差异极大,一个环境杂乱、任务多样、容错率相对较高;一个流程规范、目标单一、对效率和稳定性要求苛刻。但在物理世界的底层规律层面,二者是相通的,都需要识别物体、理解空间、规划动作、控制力度、预测结果。
WALL-B模型在家庭场景中习得的物理认知能力,平移到工业场景后,只需要少量场景化数据的适配,就能释放出强大的作业能力。这种跨场景泛化能力,带来的是边际成本的急剧下降和拓展速度的提升。
这意味着一旦通用具身智能大模型成熟,它可以快速渗透到千行百业,今天做物流分拣,明天可以做3C装配,不需要每次都重新造轮子,只需要在统一底座上做轻量化适配。这才是具身智能产业真正的想象空间所在。
05.
结语
回看这场反超,它真正回答了一个问题:具身智能产业化的最优路径是什么?
在工业落地这条最核心的价值赛道上,中国企业已经用事实给出了一种答案:不盲目追随海外技术路线,而是以更务实的工程思路、更底层的模型能力,在更随机、更复杂的真实工况中,实现效率与成本的双重领先。
自变量这次在物流分拣直播上达成的1816件/小时,也绝不止于一个效率数字。它意味着当物理AI的飞轮开始转动,谁能率先跑通真机数据—模型迭代—场景落地的正反馈循环,谁就能赢得下一阶段的主动权。
中国具身智能产业,正在用这场“夹爪对灵巧手”的反超,向世界宣告:真正的技术领先,在于对物理世界更深刻的理解,以及对产业价值更务实的尊重。
