一个人,同时操控三台完全不同的机器人,让它们协作搬运一块白板穿过门框——一台负责推,一台负责拉,第三台负责"看路"提供视野辅助。
这是慕尼黑工业大学团队近日发表在国际顶级期刊Science Robotics上的真实演示。
![]()
他们提出了一种基于异中心(allocentric)视角的多机器人遥操作范式,让操作者不再"钻进"机器人的身体里,而是像操纵提线木偶一样,从上帝视角俯瞰全局、同时控制多台机器人。
实验结果十分亮眼:在可并行化的运动任务中,这种新范式比传统第一人称操控快了84%;在态势感知任务中快了50%。更关键的是,当允许操作者在两种模式间自由切换时,系统可用性得分达到了最高。
![]()
01.
换个视角:从"灵魂附体"到"木偶师"
传统的机器人遥操作,本质上是一种自中心(egocentric)控制——操作者通过VR头盔"看到"机器人眼中的世界,用自己的手臂动作驱动机器人的手臂,仿佛灵魂附体到了机器人身上。这种方式对精细操作很友好,但有一个致命缺陷:当你需要同时控制多个机器人时,只能在不同机器人之间反复切换视角,每次切换都要在脑中重新建立空间关系,认知负荷极大。
认知科学的研究早已表明,人脑处理空间信息有两种模式。一种是自中心的,比如"书在我前面";另一种是异中心(环境中心)的,比如"书在台灯和笔记本之间"。后者与海马体和内侧颞叶密切相关,具有类似地图的结构,不依赖于观察者自身的位置和朝向。研究还发现,当心理场景越复杂,大脑越倾向于切换到异中心表征,而那些能灵活组合两种表征的人在导航任务中表现最好。
这篇论文的核心思路就是:既然大脑本身就具备从"上帝视角"理解空间的能力,为什么不把这种认知能力直接搬到机器人遥操作中?
具体来说,他们将所有机器人的感知数据(RGBD深度相机获得的点云)融合到一个统一的虚拟重建场景中。操作者戴着VR头盔,可以在这个虚拟场景中自由移动视角,俯瞰全局,然后用手去"抓住"机器人的虚拟模型来控制它们——就像木偶师操纵提线木偶一样。一只手控制一台机器人,两只手就能同时控制两台,甚至可以用一只手同时操控多个末端执行器。
与传统的无人机集群式俯瞰监控不同的是,这套系统不仅仅是"看",而是支持对高自由度机器人(如44自由度的人形机器人REEM-C、22自由度的PR2、17自由度的TOMM)进行精细的直接操控。操作者可以自由调整自己的观察角度和缩放比例,在全局策略和局部操作之间无缝过渡。
![]()
02.
实验数据:快了84%,而且操作者更喜欢
为了验证这一范式的有效性,研究团队设计了一套系统的用户研究。
仿真研究招募了15名参与者,进行了三组实验。第一组是运动任务:参与者需要引导两台模拟机器人各通过三个检查点。结果显示,使用异中心模式,中位完成速度为每分钟2.7个检查点,而自中心模式仅为1.5个,提速84%(P < 0.001)。背后的原因很直接——异中心模式下,参与者有48%的时间在同时控制两台机器人,而自中心模式下只能交替操作,机器人利用率仅为42%。
第二组是态势感知任务:两台机器人分别面对一面墙,墙上按钮随机亮起需要即时按压。异中心模式下每分钟正确按压3.7个按钮,自中心模式为2.5个,提速50%(P ≤ 0.001)。
但异中心模式并非万能。第三组姿态匹配实验中,参与者在没有视觉反馈的情况下控制机器人末端执行器去匹配目标姿态。结果自中心模式的中位位置误差为11厘米,而异中心模式为24厘米——自中心模式精度高出53%。这说明第一人称视角确实能让操作者更好地"体化"机器人,建立更精确的运动学内部模型。
![]()
主观问卷数据同样有意思。使用异中心模式时,参与者报告了显著更好的态势感知("我对整体情况有良好的把握"中位回答为"同意" vs 自中心的"中立")和更高的系统可用性(SUS评分73 vs 58)。但自中心模式的化身感(embodiment score)显著更高(8.3 vs 2.4分),参与者更觉得机器人是"自己身体的一部分"而非工具。值得注意的是,两种模式下操作者的主观能动感(sense of agency)没有显著差异,说明即使从外部视角控制,操作者依然觉得"是我在操控"。
最核心的发现来自真实机器人研究(n=6)。在一个模拟餐厅场景中,参与者操控PR2和REEM-C完成清理桌面、取送订单等复杂任务。当允许自由切换模式时,参与者在运动阶段78%的时间选择了异中心模式,而在操作阶段95%的时间选择了自中心模式(P = 0.031)。这种任务依赖的模式切换行为,直接验证了两种范式的互补性。混合模式的SUS评分达到了78分(82百分位),高于任何单一模式。
![]()
03.
木偶师范式打开了什么新可能
除了速度和效率的提升,异中心遥操作还开辟了一个全新的动作空间——那些本质上需要多机器人同时协调才能完成的任务。
研究团队用专家操作者演示了四个协作场景:两台机器人协同搬运白板通过门框;两台机器人合力搬运大桌子转弯;三台机器人配合将超大包裹搬上货架,最后一步操作者甚至用一只手同时控制了三台机器人的六个末端执行器推动包裹就位;三台机器人在工业场景中同时操作四个阀门,其中两个需要同步转动。这些任务用传统的逐台切换方式根本无法完成,因为它们要求多个动作在时间上严格同步。
![]()
在技术实现上,整套系统基于ROS2和Unity3D构建。每台机器人提供RGBD视频流(640×480@30fps),通过GPU加速转换为点云并融合到统一虚拟场景中。操作者通过HTC Vive Pro Eye头盔和Valve Index手柄进行交互。整体控制采用基于二次规划(QP)的全身运动控制策略,并集成了电子皮肤传感器提供的力反馈和接近感知来实现主动柔顺控制和碰撞避免。每台机器人约占用40Mbit/s带宽,在千兆以太网和Wi-Fi 5网络下即可稳定运行。
当然,这套系统也有局限。点云重建的视觉保真度不如直接的RGB相机流,这可能是真实机器人实验中自中心模式可用性评分反超的原因之一。此外,多相机的计算和通信开销在更大规模部署时仍是挑战,系统对延迟的鲁棒性也需要进一步研究。
但论文的结论非常明确:异中心遥操作不是要取代自中心模式,而是为其提供互补。就像人脑会根据任务复杂度动态切换空间认知策略一样,最优的遥操作系统应当允许操作者在两种模式间无缝切换——需要精细操作时"钻进"机器人,需要全局协调时"飞出来"俯瞰。
一个操作者,多台机器人,一根无形的"提线"连接两个世界。这或许就是未来人类与机器人协作的样子。
论文链接:
https://www.science.org/doi/10.1126/scirobotics.adz7130
