稠密光流
稠密光流在「每一個」像素都估計一個運動向量,產生完整的光流場,而非僅在稀疏角點上的向量。結果通常以「方向對應色相、大小對應飽和度」的方式視覺化,於是移動物體會亮成一團彩色斑塊,而靜止背景維持灰色。影片分割、畫面插補、以動作為基礎的動作辨識等下游任務,實際吃進去的就是稠密光流。
經典的稠密方法會加入一個正則項(regularizer),以在平坦與邊緣像素上克服孔徑問題。Horn-Schunck(1981)是變分法:它最小化「亮度恆定誤差」加上一個「全域平滑項」,後者懲罰 (u, v) 在空間上的大幅變化,把可靠的角點估計擴散進有歧義的區域。Farneback(2003)是 OpenCV 中標準的快速經典方法,它把每個鄰域建模成像素座標的二次多項式,並求解能把一格的局部多項式對映到下一格的位移;它能以互動速率執行,並能良好處理中等程度的運動。
如今學習式方法在準確度上居於主導。FlowNet(2015)是第一個端到端回歸光流的 CNN,因為稠密的真值光流幾乎無法以人工標註,它在合成資料(FlyingChairs)上訓練。其關鍵架構構想在 PWC-Net 中成熟(特徵金字塔、在每一層把第二格朝第一格扭曲、以及一個由特徵相關性構成的成本體積,cost volume),接著是 RAFT(2020),它在每一對像素之間建立一個四維「全對」相關性體積,並執行一個循環的 GRU,反覆精修「單一」高解析度光流場。RAFT 及其後繼者(GMA、FlowFormer)是目前強力的基線。品質以端點誤差(endpoint error, EPE)衡量,即預測與真值光流向量之間的平均歐氏距離,常用基準有 Sintel 與 KITTI。
各方法共通的難題是:遮擋(一個像素在某格可見、在下一格被擋住,便沒有正確的光流)、極大位移(又小又快的物體),以及無紋理區域。RAFT 的「全對」相關性正是針對大位移而設計,這是早期由粗到細方法常常漏掉的情形。