机器人视觉与感知

六自由度物体位姿估计

六自由度物体位姿估计,要解决的不仅是物体在哪里,而是它到底以什么姿态摆着——从传感器看到的画面里,把它完整的位置和完整的倾斜方向都算出来。对一个必须去抓取物体的机器人来说,知道物体“在那边”是不够的;它需要两个问题的完整答案。物体在空间里的什么位置(三个数字:左右、上下、远近)?它又朝着哪个方向转着(再加三个数字:绕这三个方向各自的倾斜量)?这六个数字合起来,就是物体的位姿;DoF 指的是自由度,也就是一个刚体可以被摆放的六种相互独立的方式。

想象在黑暗中从一张杂乱的桌子上拿起一只咖啡杯。你的手不是只对着一团模糊的东西去抓;你的大脑会不假思索地判断出:这只杯子是侧转着的、把手朝向背面、还略微歪着,于是你的手指还没碰到就已经摆成了能正好握住它的形状。机器人则必须有意识地把这同样的六个数字算出来。它拿相机或深度传感器看到的画面,去和存好的物体模型做比对——匹配边缘、表面上的点,或学到的视觉图案——然后求解出唯一的那个位置和朝向,使模型能与画面严丝合缝地对上。

凡是机器人必须真正地去对付某个特定物体、而不只是躲避障碍的场合,这件事都很重要:工厂机械臂伸进一筐乱堆的零件、家用机器人要把叉子以正确的方向放下,或者增强现实系统要把一个虚拟标签精确地钉在一台真实机器上。如今的方法常常借助深度学习来识别物体、并在物体被部分遮挡或光照怪异时也能猜出它的位姿,再拿传感器实际测到的几何去打磨这个初步的猜测。

一台分拣机器人对一盘缠在一起的螺栓拍下一张深度图像,估计出最上面那颗螺栓的六自由度位姿,先把夹爪转到对应的角度,再合拢夹住它。

位置加朝向:六个数字告诉夹爪到底该如何接近。

DoF 即自由度;一个可自由漂浮的刚体恰好有六个自由度——三个用于位置、三个用于朝向——所以完整的答案才被称为六自由度位姿。

又称
6D pose estimationobject pose estimation6D 位姿估计物体姿态估计