这届WAIC,机器人的“记忆短板”,被一家国产大模型独角兽打破了

2026-07-212652机器人技术及应用

在今年世界人工智能大会(WAIC)的机器人展区,如果稍加留意,会发现一个微妙的共性:越来越多的 VLA模型,都在尝试让机器人完成更长的任务链条。

然而,在很多情况下,一旦任务步骤超过五六步,机器人的表现便会出现断崖式下滑。

例如,假设让机器人完成“点击图片中第二个按钮5次”的任务,如果它搭载的VLA模型没有任何前序视觉记忆,不知道什么时候按了5次,就会出现“按1次就停止”或“一直按不停”的情况。

这背后,是一个长期被行业低估的症结:VLA模型在“下文记忆”与“实时推理成本”之间存在着根本矛盾。正是这个矛盾,让长程任务成了一道难以翻越的高墙。

但就在今天,这道墙被正面突破了。

WAIC 期间,面壁智能发布并开源了首个具身智能系列成果——MiniCPM-Robot,其中包含通用VLA 模型 MiniCPM-RobotManip和跟踪导航模型 MiniCPM-RobotTrack。这个参数量仅有 1.3B 的模型,不仅稳定完成了做三明治等长程任务,更在专门考验上下文记忆能力的 RMBench 榜单上,对 Qwen-VLA、π0.5 等知名模型实现了断层式领先。



 

MiniCPM-Robot 的发布,也意味着面壁智能正在将自己积累的多模态技术,从数字世界有力地延伸向物理世界。



 

01.

VLA模型为什么记不住?

要理解 MiniCPM-Robot 系列模型的价值,首先要看清当前具身智能的一个结构性短板。

目前大多数 VLA 模型的工作模式,本质上是一种「反应式」智能——它们基于机器人当前看到的画面和任务描述,直接输出下一步动作。至于刚才做了什么、周围环境发生了哪些变化、任务已经推进到哪一步,这些历史信息并不参与决策。换句话说,机器人每一次推理都是一次“重新开始”。

为什么不加入历史观测?答案很简单:计算量太大。

在机器人应用场景中,VLA模型一般会以大约一秒几次的速度进行推理。每次推理时,机器人通常会接收到数张图片和一段文本输入,最后输出一个可执行的动作。如果每次推理都要把过去几秒、十几秒的视觉信息全部带上,Token数量会爆炸式增长,推理速度急剧下降。最后的结果就是机器人会变得卡顿、迟缓和笨拙。

这个问题的本质,是大多数研究团队无法针对VLA做高效的视觉Token压缩,使其用更少的Token去完成流式实时推理。这就形成了一个两难:要么保留记忆但牺牲速度,要么保住速度但放弃记忆。绝大多数团队选择了后者。

而面壁智能要做的,就是要突破这个行业局限。

02.

视觉Token极致压缩:让记忆不增加成本

先来说说这次发布的通用VLA 模型MiniCPM-RobotManip。

它的技术底座,是面壁智能今年5月发布的MiniCPM-V 4.6多模态大模型。这个仅1.3B参数的“小钢炮”,在端侧多模态领域拥有广泛影响力,开源仅两个月下载量就突破200万。

MiniCPM-V 4.6采用面壁智能与清华大学联合研发的LLaVA-UHD v4技术,通过创新的“ViT内部视觉Token早压缩”,在保证性能的前提下,将图像编码计算量锐减50%。模型首创了4倍/16倍混合Token压缩模式,开发者可以在高精度文档解析场景选择4倍压缩,在实时交互场景切换到16倍压缩。

这项技术的优势被完整继承到了MiniCPM-RobotManip中。

效果是什么?VLA模型在处理流式视频输入时,图片推理所需的Token数量被大幅压低,推理速度显著加快。更重要的是,MiniCPM-RobotManip在保留上下文记忆时的计算量,与不保留记忆时几乎一样低。这意味着记忆不再昂贵,实时性不再需要以牺牲记忆为代价。



 

从用户体验的角度来看,这直接转化为机器人操作的连贯性。推理速度快,意味着从「看到画面」到「输出动作」的间隔足够短,机器人完成做三明治这样的长程任务时,动作衔接自然流畅,不会出现那种机械式思考停顿,这其实都是背后 Token 压缩技术对每一帧画面的精打细算。

在专门考验机器人模型上下文能力的RMBench(Robot Memory Benchmark)榜单上,MiniCPM-RobotManip达到了53.5分,而主流的π0.5只有10分,接近随机的水平。在传统榜单上,MiniCPM-RobotManip的性能同样稳居第一梯队,与Qwen-VLA、π0.5等模型性能相近。



 

从“0分”到“53分”,差距不是渐进式的优化,而是从无到有的质变。

03.

端到端纯本地跟随:MiniCPM-RobotTrack重新定义部署边界

MiniCPM-Robot 系列的另一成员——MiniCPM-RobotTrack,则是一个专为跟踪导航设计的端到端视觉指令跟随模型。

它以 MiniCPM4-0.5B 为基础模型,仅用 0.9B 参数规模,就在单目标跟踪、动态多目标跟踪和模糊目标跟踪三项任务上取得了开源方案最优结果,追踪率分别达到 89.8、73.4 和 80.4。相比开源方案 OpenTrackVLA,三项指标分别提升 7.0、14.6 和 6.5 个百分点。



 

更值得关注的是,MiniCPM-RobotTrack 是业内首个提供真实本地纯无网部署的 tracking 模型,原生适配宇树 Go2 Edu,开箱即用。在电梯、停车场等弱网或无网环境下,机器狗依然能仅凭本地摄像头和端侧算力,完成对指定目标的持续跟踪。

MiniCPM-RobotTrack 的另一项突破在于高质量数据驱动的自进化数据管线。团队首次提出了面向具身追踪的 DAgger 策略,让模型先在通用场景广泛学习,再在仿真和真实环境中持续交互,主动暴露复杂场景中的能力短板,并通过专家策略补充高质量训练样本。在模型与环境的闭环迭代中,长尾场景不断强化,模型在动态环境中的泛化能力持续提升。

部署层面,团队对宇树 Go2 的完整运行链路进行了系统级优化,在机器狗原生本地算力上稳定达到 5+ FPS,端到端响应时延约 180 毫秒。开源方案覆盖从环境安装、模型加载到一键启动的完整流程,用户最快可在数分钟内让一台刚开箱的 Go2 Edu 获得纯视觉、纯本地的自然语言指令跟踪能力。



 

从展厅导览到园区巡检,从楼宇陪护到灾害救援中的目标搜寻,MiniCPM-RobotTrack 让具身智能摆脱了对云端算力和稳定网络的依赖,向着真正独立运行的可靠智能终端迈出了关键一步。

04.

从多模态到物理世界,面壁智能的AGI拼图

面壁智能为何布局具身智能?答案指向一个更大的命题:AGI。

目前大模型公司都在追求语言层面的通用智能,但物理层面的通用智能才刚刚开始。只有语言层面与物理层面的通用智能同时实现,才能实现终极目标——通用人工智能(AGI)。面壁智能是一家以AGI为终局目标的大模型公司,具身智能是其AGI技术战略的关键组成部分。

在这个方向上,面壁智能有两个独特的先发优势。

第一是多模态技术的深厚积累。面壁智能不仅局限于语言模型,在多模态模型上也同样出色——MiniCPM-V/O系列已迭代两年半,开源总下载量突破2500万,在海内外技术社区拥有广泛影响力。对于机器人来说,智能不仅需要语言输入,还需要视觉与更多模态的输入。面壁的多模态技术积累为MiniCPM-Robot提供了处理真实世界流式多模态信息流的能力,这也是面壁可以快速切入机器人智能领域的核心原因。



 

第二是端侧AI的隐私安全基因。尽管VLA模型目前主要是纯云端调用API,但从长期来看,机器人最终要进入人类社会,在家庭、办公、工厂等隐私场景中与人朝夕相处。VLA模型最终必须跑在终端上,才能保护人类的数据主权与隐私安全。面壁智能在端侧模型上积累的隐私保护技术——数据本地存储不外传、不依赖网络传输——为具身智能的最终落地铺平了道路。

从端侧AI到具身智能,面壁的战略版图日渐清晰。端侧AI已在汽车、手机、PC等多领域落地——MiniCPM系列模型先后搭载于长安马自达EZ-60、吉利银河M9等量产车型,合作方覆盖吉利、长安、大众、广汽、长城、极氪等头部车企。具身智能,是端侧智能在物理世界的自然延伸。

05.

产业落地进行时

除了模型本身的发布,面壁智能还展示了一套完整的产业落地组合拳。

联合乐聚机器人,面壁发布了展厅导览Agent和园区巡检Agent解决方案。展厅导览Agent结合了面壁端侧多模态大模型和乐聚的夸父机器人本体,可在纯无网环境下纯端侧运行导览系统,支持基于本地知识库的离线讲解和自由问答。园区巡检Agent能高效识别车辆违停、路面异常、公共设施异常等情况,确保敏感画面就地分析、数据主权归客户。



 

联合吉利汽车,面壁在具身领域展开了从模型到应用的深度合作。在模型层,双方共同训练和发布了VLA模型,从多模态理解大模型出发,保持通用多模理解能力的同时融入真实世界交互能力。在应用层,基于RoboHarness框架,双方快速实现了机器人在生产仓储场景的落地应用。

RoboHarness是面壁智能基于4月发布的EmbodiedClaw框架开发的具身智能体框架,可以轻松集成上层规划VLM模型,将VLA模型、导航系统等作为物理世界工具模块调用,并为具身智能体提供长程任务的上下文和记忆管理。它还内置了可治理的数据闭环设计,让机器人在真实场景执行任务的同时,也成为数据飞轮的一部分,持续进化。

06.

结语:

面壁智能始终以AGI为终局目标,具身智能是这个战略中不可或缺的一环。

当前大模型公司所追求的通用智能,主要集中在语言层面。但真正的AGI需要语言智能与物理智能同时实现。一个只会对话、不会在物理世界行动和理解的AI,永远只能停留在屏幕里。

MiniCPM-Robot 系列模型的发布,标志着面壁在语言层面的通用智能之外,正式向物理层面的通用智能迈出了关键一步。MiniCPM-RobotManip[陈2.1]以1.3B的高效参数、在传统VLA基准上比肩头部模型的性能、在上下文记忆维度领先身位的能力,以及务实的安全基因和产业路径,为中国具身智能领域提供了新的想象空间。

具身智能的竞争才刚刚开始。从补上“记忆短板”出发,面壁智能正在向物理世界的AGI持续靠近。

GitHub 链接:

https://github.com/OpenBMB/MiniCPM-Robot

Hugging Face 链接:

https://huggingface.co/openbmb/MiniCPM-RobotManip

https://huggingface.co/openbmb/MiniCPM-RobotTrack

目前,面壁智能具身智能团队正热招 VLA、世界模型、硬件相关研究及工程岗位。

链接:

https://modelbest.jobs.feishu.cn/referral/position/share/?token=MjsxNzg0MTk2Mzc0NzM0Ozc1MTcxMDQyMDA4NzkzNzQzMzk7NzY2MzA1OTI3MDI5NjI3NTIzNjsxLzE