機器人視覺與感知

六自由度物體位姿估計

六自由度物體位姿估計,要解決的不僅是物體在哪裡,而是它到底以什麼姿態擺著——從感測器看到的畫面裡,把它完整的位置和完整的傾斜方向都算出來。對一個必須去抓取物體的機器人來說,知道物體「在那邊」是不夠的;它需要兩個問題的完整答案。物體在空間裡的什麼位置(三個數字:左右、上下、遠近)?它又朝著哪個方向轉著(再加三個數字:繞這三個方向各自的傾斜量)?這六個數字合起來,就是物體的位姿;DoF 指的是自由度,也就是一個剛體可以被擺放的六種相互獨立的方式。

想像在黑暗中從一張雜亂的桌子上拿起一隻咖啡杯。你的手不是只對著一團模糊的東西去抓;你的大腦會不假思索地判斷出:這隻杯子是側轉著的、把手朝向背面、還略微歪著,於是你的手指還沒碰到就已經擺成了能正好握住它的形狀。機器人則必須有意識地把這同樣的六個數字算出來。它拿相機或深度感測器看到的畫面,去和存好的物體模型做比對——匹配邊緣、表面上的點,或學到的視覺圖案——然後求解出唯一的那個位置和朝向,使模型能與畫面嚴絲合縫地對上。

凡是機器人必須真正地去對付某個特定物體、而不只是躲避障礙的場合,這件事都很重要:工廠機械臂伸進一筐亂堆的零件、家用機器人要把叉子以正確的方向放下,或者擴增實境系統要把一個虛擬標籤精確地釘在一台真實機器上。如今的方法常常借助深度學習來辨識物體、並在物體被部分遮擋或光照怪異時也能猜出它的位姿,再拿感測器實際測到的幾何去打磨這個初步的猜測。

一台分揀機器人對一盤纏在一起的螺栓拍下一張深度影像,估計出最上面那顆螺栓的六自由度位姿,先把夾爪轉到對應的角度,再合攏夾住它。

位置加朝向:六個數字告訴夾爪到底該如何接近。

DoF 即自由度;一個可自由漂浮的剛體恰好有六個自由度——三個用於位置、三個用於朝向——所以完整的答案才被稱為六自由度位姿。

又稱
6D pose estimationobject pose estimation6D 位姿估计物体姿态估计