蚂蚁灵波首席科学家沈宇军:我们正从零训练机器人的"眼睛",数字世界的模型在现实世界行不通

hjm2026-07-231791人形机器人

当中国机器人产业还在争论人形还是轮式、双臂还是单臂时,蚂蚁集团旗下具身智能子公司蚂蚁灵波做了一个大胆的决定:彻底放弃所有现成的数字世界预训练模型,从零开始,从传感器层面构建机器人的原生视觉基础模型。

 

这是一场豪赌。

 

 

▍为什么现成的模型行不通?

 

蚂蚁灵波首席科学家沈宇军的论点直击核心。通过互联网训练的视觉模型追求的是图像质量、纹理、场景识别——"照片里有一只猫"——但机器人需要的不是"知道这是杯子",而是"知道以什么角度、用多大力去抓这个杯子才能不滑落"

 

"你能看到它,但你摸不到它。"沈宇军用一句话概括了这种差距。更关键的是:数字世界的模型可以双向处理视频(看完整段再判断),但现实中的机器人只能单向感知,必须实时反应,不能从未来预知过去。

 

这促使他做出了一个极端的技术决定:"根据物理世界的需求重做一切。"不是微调,不是适应——而是从零开始训练视觉编码器、视频生成模型,以及最终控制机器人运动的世界动作模型。

 

▍九个月的关键迭代:从1.02.0

 

20261月,蚂蚁灵波开源了第一代基础模型,当时仍采用相对保守的策略——以DINOv2等数字世界模型为视觉骨干并微调。但随着实际部署压力增加,局限逐渐暴露。

 

第二代模型来了个大转向:预训练数据从约2万小时跃升至6万小时(增长约4倍);支持的机器人配置从9种扩展到20多种,新增头部、腰部、底座和灵巧手自由度;后训练所需数据从每任务约100个样本降至约20个,效率提升显著。

 

三大技术支柱构成2.0底座:MoE专家混合架构——从零训练,仅稳定过程就耗时两个月;因果单向注意力机制——纯单向设计,团队曾尝试双向转单向,发现知识大量丢失,被迫重来,再耗费三到四个月;语义和动作对齐的视觉压缩——让编码器原生感知与动作相关的特征。

 

"GPT-1时刻尚未到来,瓶颈在数据"

 

蚂蚁灵波已积累6万小时真实机器运行数据,但"与互联网规模的数据相比,仍差两个数量级"。真正的起点是数百万小时的具身原生预训练数据。

 

好消息是,采集成本正在快速下降——"至少降了三倍"。但沈宇军强调模拟数据在训练中的局限性:模拟数据分布过于均匀,而物理引擎模拟柔性物体(如纸张折叠)仍有明显缺陷。蚂蚁灵波的做法是:训练用真实数据,模拟数据仅用于评估。

 

在沈宇军看来,中国在数据规模上"必将超越美国"——逻辑很简单:中国硬件供应链更完善,量产机器人本体更多,意味着更多实际应用场景和更丰富的数据来源。

 

▍三年创业最重要的一课:敢赌

 

这是沈宇军的首次创业。他花了相当长时间适应新的思维方式——博。"没有人知道哪条路一定能成功。如果成功一目了然,大公司就永远会赢。当道路未知时,犹豫不决只会一无所获。"

 

蚂蚁灵波押下的三大赌注:不照搬数字世界模型,而是从传感器层面重建空间智能;不造硬件外壳,而是专注打造通用大脑;坚持从连续视频而非静态图像中学习。

 

他理想中的机器人是"J型人格"——务实。工作第一,情感价值第二。"情感价值应该由人类提供"——这句话透着一位工程师对产品本质的理解。当原生方案成功,它将彻底改写产业对数字世界预训练模型的依赖逻辑——从零开始的眼睛,或许才是最适应物理世界的眼睛。