三維視覺與幾何

本質矩陣

本質矩陣(essential matrix)是基礎矩陣的「已校正版」兄弟。當你已經知道每台相機的內部參數(焦距、主點),就能把它們剝除,改用射線而非像素來運算——也就是從相機中心量起的三維方向。在這些正規化座標下,對極約束變成 x' 的轉置乘以 E 再乘以 x 等於零,此時 x 與 x' 是已校正的射線方向,而非原始像素。兩矩陣之間的關係是精確的:E 等於第二台相機內參矩陣的轉置,乘以 F,再乘以第一台相機的內參矩陣。

E 的特別之處在於它能乾淨地分解成你真正想要的兩樣東西:相機之間的相對旋轉與平移。具體而言,E 等於平移向量的外積矩陣乘以旋轉矩陣——簡記為 E = [t]× R。外積矩陣 [t]× 是把「與 t 做外積」化為乘法的那個 3×3 矩陣。由於這個結構,E 只有 5 個自由度(旋轉 3 個、平移方向 2 個——平移的長度無法僅從影像回復,這就是著名的全域尺度不確定性)。

要把 E 轉成位姿,你對它做奇異值分解(SVD),再讀出旋轉與平移方向。代數會給出四個候選解——兩個可能的旋轉與兩個可能的平移正負號配對——它們都滿足對極方程式,卻對應到不同的實體配置(相機面對面、鏡像等等)。你用 cheirality(朝向性)檢查來消除歧義:在每個候選解下三角化幾個匹配點,保留那個把點放在兩台相機「前方」而非後方的唯一解。最小估計器是 Nister 的五點演算法,僅用五組對應點就能回復 E,是運動回復結構與視覺 SLAM 前端中 RANSAC 內的主力。

概念上,基礎矩陣說「這兩個像素可能是一對」,而本質矩陣說「而且這就是讓它們成為一對的實際旋轉與平移方向」。E 是從原始影像幾何通往「(差一個尺度的)度量重建相機如何移動」的橋樑。

從 E 回復的平移長度未知——你只得到方向。絕對尺度必須來自外部:已知的基線、已知尺寸的物體、慣性測量單元或輪速里程計,或 GPS。這正是為什麼單一移動相機能描繪房間的形狀,卻無法得知其真實大小。

又稱
E matrixE 矩陣