Figure 03专门重做了视觉系统,相机帧率达到上一代2倍、延迟降至四分之一;Helix 02进一步把头部相机、手掌相机、触觉和本体感知接进统一的视觉运动网络。传感器越来越多,视觉系统越做越复杂。但当机器人头部的两只眼睛真的可以转动、追踪,甚至共同盯住一个目标时,一个长期存在的问题也出现了:眼睛转动时产生的几何信息,能不能也参与机器人对三维世界的判断。加拿大约克大学团队在《Science Robotics》上发表的研究《Convergent binocular stereo: Depth perception for humanoid robot vision》,给出的答案是能。
眼睛已经会转,计算没跟上
机器人用两只摄像头看世界,核心任务之一是从左右图像的差异里恢复场景的深度和三维空间关系。目前工程上的常见做法是把两台摄像头固定平行放置,原因是好算。当左右相机保持平行,同一个物体在两幅图像里的位置差主要发生在水平方向,算法沿着同一水平线找到对应点,利用水平视差计算距离。搜索范围小,几何关系也稳定。大量传统算法,包括后来不少深度学习立体视觉方法,都沿用了这套平行双目配置。
但人的双眼从来不是固定朝前的。当你盯住眼前一根手指,两只眼球会同时向内转,两条视线交汇在同一个位置;手指逐渐移远,双眼又会慢慢向外打开。这个动作叫会聚。一些类人机器人头部早已能完成扫视、会聚和追踪,但这些动作更多停留在眼睛朝哪里看。真正计算深度时,系统往往仍回到固定平行双目,或者使用额外的立体相机、LiDAR。于是出现了一个具体的错位,眼睛已经会转了,深度计算却没有真正用上这些运动。一旦两台相机向内旋转,原本简单的几何关系就被打乱,同一个点在左右图像中不仅会左右错开,还可能上下错开,算法需要同时计算水平视差和垂直视差。但多出来的这些信息并不只是计算负担,垂直双目视差本身也包含三维空间信息,与表面的深度、大小、曲率、倾斜等几何属性有关。
CBS先钉一个锚点,再把眼睛怎么转算进去
CBS的第一步是让两只眼睛真正看向同一个地方。当两台摄像头同时向内旋转、共同注视空间中的一个目标时,两条光轴会在一个位置交汇,这就是注视点。在理想情况下,这个点会落在左右图像的中心附近,水平和垂直视差都接近于0。这相当于先给算法钉下一个几何锚点。有了这个锚点,机器人知道的不再只有两张图像哪里不一样,还包括两台相机分别转了多少、朝向哪里,以及它们正在共同注视什么位置。眼睛怎么转,由此真正进入了深度计算。接下来,CBS再根据会聚状态下的相机几何关系,从粗到细寻找左右图像中的对应点,同时计算水平和垂直视差,最终恢复场景的深度信息。论文具体使用了SIFT特征、极线约束和Gabor滤波等方法。为了验证这套方法,研究团队搭建了一套两只摄像头都可以独立水平、垂直转动的双目系统,并建立了CBS-BM数据集,一共包含49个真实场景。
重复图案里,深度学习容易认错的地方它更稳
论文拿CBS与SGBM、ELAS等传统方法,以及IGEV++、MoCha、RAFT-Stereo、CRE-Stereo等8种深度学习方法进行了比较。在普通场景、远距离场景,以及一些要求误差非常小的指标上,部分平行双目和深度学习方法表现更好。但综合49个场景来看,CBS取得了最低的平均深度误差和平均水平视差误差。真正把差距拉开的是重复图案。比如一排几乎一模一样的物体,或者连续重复的格纹,两只摄像头虽然从不同角度拍到了同一个场景,但画面里长得太像的地方太多,算法很容易对错号。CBS在这里多了一层信息,除了比较两幅画面,它还知道两只相机此刻分别朝向哪里、共同注视在哪里。图像本身分不清的时候,这组会聚几何就能继续帮助算法缩小匹配范围。在重复图案子集中,CBS的平均深度误差比次优方法低约0.8米,平均水平视差误差低约100像素。全图范围下,CBS只有6.08%的像素深度误差超过0.40米,次优平行方法这一比例达到39.33%。
69秒一次计算,离实时还差得远
CBS证明了眼睛怎么转可以进入视觉计算,但要真正跑在人形机器人上,它还有几道现实门槛。最直接的一个是速度,目前CBS在AMD Ryzen 7 7700X处理器上完成一次计算约需69秒,达不到机器人实时感知的要求。这套方法对电机精度和相机标定也很敏感,因为相机究竟转了多少、朝向哪里,本身就是深度计算的一部分。论文把算法优化、更高精度电机和在线标定列为后续方向。远距离目标同样是短板,目标越远,两只眼睛的会聚角越小,对电机细微转动的精度要求越高。再往前一步,CBS还没有解决一个更接近人眼的问题:下一眼应该看哪里。人的视觉并不是机械地盯住一个点,而是会根据任务不断改变注视位置。CBS更像是给主动视觉补上了一块底层能力,过去机器人转动眼睛更多是在改变视线方向,这篇论文进一步证明,眼睛的运动本身也可以成为感知信息的一部分。从看见,到真正知道该看哪里、怎么看、又如何利用这一眼的运动理解空间,人形机器人的视觉还需要继续往前走。
