三維視覺與幾何

深度估計

深度估計(depth estimation)的任務是為每個像素指定一個距離:在該像素看到的表面離相機多遠。自然的輸出是深度圖(depth map),一張其值為公尺(或某種一致單位)而非顏色的影像。深度是平面照片丟棄的那缺失的第三維,而回復它是通往三維視覺幾乎一切的門戶——重建、機器人導航、擴增實境的遮蔽、自動駕駛與三維攝影,全都建立在它之上。

方法大致分兩大家族。主動式感測在物理上量測深度:光達(LiDAR)發射雷射脈衝並計時其返回;飛時相機(time-of-flight)用調變光做同樣的事;結構光感測器(如初代 Kinect)投射一個已知圖案並讀取其變形。這些直接給出度量深度,但耗電、需硬體,且常在戶外或在光亮/深色表面上吃力。被動式感測從一般影像推論深度:立體視覺由兩視角的視差、多視角立體由眾多視角的光度一致性、單眼深度則由單一影像配合「世界看起來如何」的學習式先驗。

有一個關鍵區分貫穿所有方法:度量深度與相對深度。度量深度給出以公尺為單位的真實距離,需要已校正的感測器、已知的基線,或某種絕對參考。相對(或仿射不變)深度只給出次序與比例——這個像素是那個的兩倍遠——這也是單一未校正影像因尺度不確定性所能誠實提供的全部。許多現代學習式模型正是預測相對或「尺度與位移不變」的深度,因為這樣才能跨相機與場景泛化;要回復度量尺度則需額外資訊。

當前最先進的做法把幾何與學習混用。在有多視角之處,經典立體與多視角立體給出強健的幾何深度;學習式模型(相對深度的 MiDaS 與 DPT、在巨量混合資料集上訓練的 Depth Anything、度量單眼的 Metric3D 與 ZoeDepth,以及像 Marigold 這類以擴散模型為基礎的估計器)即使只從單一影格也能提供出奇穩健的深度。實務上,系統會融合它們:可靠處用幾何,以學習式先驗填補遮蔽、無紋理區域與本質上歧義的單眼情形。

在不知道深度圖類型的情況下別貿然比較。一個相對深度模型可能看起來像素級完美,卻無法用來量門口的寬度,因為它的「公尺」是任意的。在信任任何絕對數值前,務必先確認模型輸出的是度量、尺度不變,還是尺度與位移不變的深度。

又稱
depth prediction深度估測