人形机器人的眼睛一直没学会“看”?

Dabaoo2026-09-171364人形机器人



 

“机器人“眼睛转动”本身,也可以成为感知信息的一部分。

今天的人形机器人,要想看见世界,早就不只是装两颗摄像头这么简单。

Figure 03专门重做了视觉系统,相机帧率达到上一代2倍、延迟降至1/4;今年发布的Helix 02,又进一步把头部相机、手掌相机、触觉和本体感知接进统一的视觉运动网络。

传感器越来越多,视觉系统也越做越复杂。但当机器人头部的两只“眼睛”真的可以转动、追踪,甚至共同盯住一个目标时,一个长期存在的问题也出现了——眼睛转动时产生的几何信息,能不能也参与机器人对三维世界的判断?

在最新的一期的机器人顶刊《Science Robotics》上,加拿大约克大学团队发表研究《Convergent binocular stereo: Depth perception for humanoid robot vision》,提出会聚双目立体视觉(Convergent Binocular Stereo,CBS)算法。



 

它走的不是继续堆数据和模型的路线。研究人员让两只可以独立转动的“眼睛”共同盯住一个目标,再把相机朝向、注视点,以及左右图像中的水平和垂直视差一起用于深度计算。

眼睛怎么动,也开始成为视觉信息。更值得注意的是,在重复图案这类双目视觉容易出现匹配歧义的场景中,这套方法甚至明显超过了论文测试的一批深度学习立体视觉方法。

01.

眼睛已经会转,计算为什么没跟上?

机器人用两只摄像头看世界,核心任务之一,是从左右图像的差异里恢复场景的深度和三维空间关系。在这点上,目前人形机器人在工程上的常见做法,是把两台摄像头固定平行放置?

原因很简单:好算。

当左右相机保持平行,同一个物体在两幅图像里的位置差主要发生在水平方向。算法沿着同一水平线找到对应点,再利用“水平视差”计算距离。搜索范围小,几何关系也稳定。因此,大量传统算法,包括后来不少深度学习立体视觉方法,都沿用了这套平行双目配置。

但问题在于,人的双眼从来不是固定朝前的。

当你盯住眼前一根手指,两只眼球会同时向内转,两条视线交汇在同一个位置;手指逐渐移远,双眼又会慢慢向外打开。这个动作叫会聚(vergence)。

一些类人机器人头部早已能完成扫视、会聚和追踪,但这些动作更多停留在“眼睛朝哪里看”。真正计算深度时,系统往往仍回到固定平行双目,或者使用额外的立体相机、LiDAR。

于是出现了一个很具体的错位——眼睛已经会转了,深度计算却没有真正用上这些运动。

原因也不难理解。一旦两台相机向内旋转,原本简单的几何关系就被打乱了。同一个点在左右图像中不仅会左右错开,还可能上下错开,算法需要同时计算水平视差和垂直视差。

但多出来的这些信息并不只是计算负担。论文指出,垂直双目视差本身也包含三维空间信息,与表面的深度、大小、曲率、倾斜等几何属性有关。结合相机朝向,这些信息还可以进一步用于表面倾斜和物体姿态等估计。

也就是说,过去为了让双目视觉更容易计算,人们把相机固定了下来;而一旦允许“眼睛”真正转起来,问题虽然更复杂,也多了一组新的空间线索。

CBS想做的,就是把这组线索真正接进深度计算。

02.

先盯住一个点,再把“眼睛怎么转”算进去

CBS的第一步,是让两只“眼睛”真正看向同一个地方。

当两台摄像头同时向内旋转、共同注视空间中的一个目标时,两条光轴会在一个位置交汇,这就是注视点。在理想情况下,这个点会落在左右图像的中心附近,水平和垂直视差都接近于0。

这相当于先给算法钉下一个几何锚点。

有了这个锚点,机器人知道的不再只有“两张图像哪里不一样”,还包括两台相机分别转了多少、朝向哪里,以及它们正在共同注视什么位置。“眼睛怎么转”,由此真正进入了深度计算。



 

会聚立体构型和几何形状图

接下来,CBS再根据会聚状态下的相机几何关系,从粗到细寻找左右图像中的对应点,同时计算水平和垂直视差,最终恢复场景的深度信息。

论文具体使用了SIFT特征、极线约束和Gabor滤波等方法。这里最重要在于,整个计算多了一层过去平行双目很少利用的信息:相机自身的朝向和会聚关系。



 

CBS 立体匹配算法

为了验证这套方法,研究团队搭建了一套两只摄像头都可以独立水平、垂直转动的双目系统,并建立了CBS-BM数据集。

数据集一共包含49个真实场景。每个场景除了平行双目图像,还采集了5至12对不同注视点下的会聚图像;其中既有普通场景,也专门加入了重复图案、光滑无特征平面和高度自遮挡物体等容易让立体匹配出错的情况。

而真正让会聚双目的优势显现出来的,正是其中最容易“看花”的一类——重复图案



 

CBS-BM 数据集

03.

深度学习容易“认错”的地方,它反而更稳

论文拿CBS与SGBM、ELAS等传统方法,以及IGEV++、MoCha、RAFT-Stereo、CRE-Stereo等8种深度学习方法进行了比较。

在普通场景、远距离场景,以及一些要求误差非常小的指标上,部分平行双目和深度学习方法表现更好。但综合49个场景来看,CBS取得了最低的平均深度误差和平均水平视差误差,整体已经能和当前较强的平行双目方法竞争。



 

真正把差距拉开的,是前面提到的重复图案。

比如一排几乎一模一样的物体,或者连续重复的格纹。两只摄像头虽然从不同角度拍到了同一个场景,但画面里长得太像的地方太多,算法很容易对错号,把这只眼睛看到的一个物体,错配成另一只眼睛画面里的另一个相似物体。

一旦对应关系错了,后面的视差和深度也会跟着算错。

CBS在这里多了一层信息。除了比较两幅画面,它还知道两只相机此刻分别朝向哪里、共同注视在哪里。图像本身分不清的时候,这组会聚几何就能继续帮助算法缩小匹配范围。

论文的重复图案实验中,多种平行方法出现了明显的视差误配,而CBS能够利用相机方向和注视点约束得到更接近真实值的结果。

数据上的差距也很直接。在重复图案子集中,CBS的平均深度误差比次优方法低约0.8米,平均水平视差误差低约100像素。考虑到这些测试场景本身最长不超过3米,这个差距已经相当明显。

全图范围下,CBS只有6.08%的像素深度误差超过0.40米,次优平行方法这一比例达到39.33%。

这说明,当图像里的纹理和特征已经不足以给出明确答案时,机器人自身的运动,还可以提供额外的物理线索。



 

 

此外,CBS还有一个特别的优势。它不需要针对某个特定数据集训练。论文指出,数据驱动立体视觉方法的表现会受到训练集覆盖范围影响,而会聚产生的相机几何,则来自机器人此刻真实发生的运动。

换句话说,“眼睛怎么转”,不再只是一个机械动作,它开始真正参与机器人对空间的判断。

04.

未来与结语

CBS证明了“眼睛怎么转”可以进入视觉计算,但要真正跑在人形机器人上,它还有几道现实门槛。

最直接的一个槛就是速度。目前CBS在AMD Ryzen 7 7700X处理器上完成一次计算约需69秒,显然还达不到机器人实时感知的要求。与此同时与此同时,这套方法对电机精度和相机标定也很敏感,因为相机究竟转了多少、朝向哪里,本身就是深度计算的一部分。论文因此把算法优化、更高精度电机和在线标定列为后续方向。

远距离目标同样是一个短板。目标越远,两只“眼睛”的会聚角越小,对电机细微转动的精度要求越高。论文提出,未来可以结合置信度估计、单目深度线索等方式,提高远距离情况下的可靠性。

而再往前一步,CBS其实还没有解决一个更接近人眼的问题:下一眼应该看哪里?人的视觉并不是机械地盯住一个点,而是会根据任务不断改变注视位置。论文也把注视策略、中央凹视觉和多分辨率感知列为未来值得继续探索的方向。

所以,CBS更像是给主动视觉补上了一块底层能力。

过去机器人转动“眼睛”,更多是在改变视线方向;这篇论文则进一步证明,眼睛的运动本身,也可以成为感知信息的一部分。

从“看见”,到真正知道该看哪里、怎么看、又如何利用这一眼的运动理解空间,人形机器人的视觉或许还需要继续向前。

论文链接:https://www.science.org/doi/10.1126/scirobotics.aec7205