三維視覺與幾何

基礎矩陣

基礎矩陣(fundamental matrix)是一個 3×3 的數字表格,它編碼了兩個未校正視角之間完整的對極幾何——「未校正」意指你不需要知道每台相機的焦距或鏡頭參數。它的功能濃縮在一條優雅的方程式裡:若某個場景點在第一張影像出現在像素 x、在第二張出現在像素 x',則 x' 的轉置乘以 F 再乘以 x 等於零。這裡 x 與 x' 寫成齊次座標(像素的行與列,再附加一個 1),這條式子表示這兩個點與單一一組剛性的雙相機配置相容。

從幾何上讀,F 是一台把「點」變成「線」的機器。用 F 乘上第一張影像中的點 x,你就得到它在第二張影像中對極線的係數:對應點 x' 必須滿足這條直線方程式,也就是落在線上。取轉置後,F 把第二張影像的點映成第一張影像中的對極線。兩個對極點是 F 所消滅的特殊方向:F 乘以第一個對極點為零,F 的轉置乘以第二個對極點也為零。這正是為什麼 F 的秩是 2 而非 3——它的行列式必為零——而在估計時強制施加這個約束至關重要。

仔細計數,F 有 9 個元素,但只有 7 個自由度:少了一個是因為把 F 乘上任何非零常數方程式都不變(整體尺度沒有意義),再少一個是因為秩為 2(行列式為零)的約束。你從對應點估計 F。經典的正規化八點演算法在把座標重新縮放到數值表現良好後(Hartley 正規化),用八組或更多匹配解一個線性系統,再把最小的奇異值歸零以強制秩為 2。七點演算法利用秩的約束,只需七組匹配。在充滿誤匹配的真實影像中,F 會被放進 RANSAC 內擬合,反覆嘗試最小樣本,保留最多對應點所認同的那個 F。

因為 F 直接在像素座標中運作,它把相機的相對運動與每台相機未知的內部校正全都揉在一起。這既是它的優點(不需校正),也是它的弱點(它本身無法告訴你度量單位下的旋轉與平移)。一旦你確實知道相機的內部參數,就能把 F 轉換成本質矩陣,再從中萃取出真正的相對位姿。

忘記強制秩為 2 是經典錯誤:一個一般化的 3×3 擬合會給出不再通過共同對極點的對極線,使三角測量惡化。同樣重要的是,未正規化的八點演算法在數值上極差——正是 Hartley 的座標正規化讓它變得可用。

又称
F matrixF 矩陣