三維視覺與幾何

多視角立體

多視角立體(multi-view stereo,MVS)產生的是你想到攝影測量時腦中浮現的那種稠密、細緻的三維:不是幾千個散落的特徵點,而是幾乎每個像素都有一個深度值,跨許多張照片融合成完整的表面。它接續運動回復結構之後。SfM 給你相機的已校正位姿與一團稀疏點雲;MVS 則用這些已知相機,把介於其間各處的幾何都重建出來。

它的支配原則是光度一致性(photo-consistency)。考慮表面上的一個候選三維點。若你把它投影到每一台看得到它的相機,那些像素應該看起來相似——同樣的顏色、同樣的局部紋理——因為它們都是同一塊實體表面的影像。位於錯誤深度的點,投影出的像素會互不匹配、不一致。所以 MVS 假設多個深度,保留那些其多視角投影互相吻合者,通常以正規化交叉相關或一個容許光照與視點變化的學習式相似度來評分吻合程度。這把重建化為一個逐像素的深度搜尋,並以平滑性與可見性加以正規化。

經典 MVS 有幾種風味。平面掃描立體(plane-sweep)把場景切成多個深度平面,在每個平面上測試光度一致性。PatchMatch MVS,COLMAP 稠密階段的核心,巧妙地在相鄰像素間傳播良好的「深度與法向量」猜測並加以精煉,聯合估計局部表面朝向以獲得更銳利的結果。各影像的深度圖接著被融合——跨視角交叉檢查一致性後合併——成為單一稠密點雲,最後再由表面重建(例如 Poisson)變成無縫的網格並貼上紋理。學習式 MVS(MVSNet 及其眾多後繼)以神經式成本量取代手工成本,該成本量由把影像特徵扭轉到各深度假設上建構而成,往往能在弱紋理區域改善完整度。

MVS 繼承了立體視覺的困難情形並添上自己的。無紋理表面給不出光度一致性訊號;鏡面與透明材質直接違反亮度恆定假設;細小結構與凹處難以從足夠多的角度看到。它相對於雙視角立體的一大優勢是冗餘性:有許多重疊視角時,某些影像中的遮蔽會被其他影像覆蓋,離群值也會被多數表決壓下,因此當你加入分布良好的相機時,覆蓋率與穩健性會明顯提升。

更多視角只有在真正帶來新視點時才有幫助。從幾乎相同位置拍的一百張照片提供的三角測量視差很小,幾乎勝不過兩個好視角;繞著物體分散良好的十幾張照片通常重建得好上許多。拍攝的幾何分布比照片數量更重要。

又称
MVS