運動與視訊

畫面插補

畫面插補在真實影格「之間」合成全新的影格,於是以 24 或 30 fps 拍攝的影片可平滑轉換成 60 或 120 fps,或放慢成清晰的慢動作。根本的挑戰在於:你正在發明從未被擷取的像素——要在某個中間時刻把內容正確地擺好,你必須弄清楚兩張相鄰影格之間萬物如何移動,再一致地算繪出那張中間視圖。

存在兩種主要策略。以光流為基礎的方法估計兩張輸入影格之間的雙向光流,再把兩張影格都扭曲(warp)到目標時刻 t(例如中點 t = 0.5)並加以混合;此處的進展包括線性與二次運動模型,以及 softmax 潑灑(softmax splatting,一種前向扭曲,能解決多個像素對映到同一處時誰勝出的問題)。以核為基礎的方法(AdaConv、SepConv)則為每個輸出像素學習一個隨空間變化的卷積核,不靠顯式光流就直接從一個鄰域生成新像素,這能優雅地處理小運動與模糊,卻在大位移時吃力。近期系統以 Transformer 或擴散先驗(diffusion prior)結合光流與合成。廣為使用的模型包括 DAIN(深度感知)、快速即時的 RIFE,以及 FILM(為大運動與近似重複照片而設計)。

其失效模式很有啟發性。遮擋與去遮擋(disocclusion)造成破洞——只在兩張影格其中之一可見的區域——純扭曲無法正確填補。大運動與非線性運動破壞了簡單線性混合背後的等速度假設,產生疊影(ghosting)與撕裂。運動模糊與亮度變化更進一步違反比對假設。品質以 PSNR 與 SSIM 衡量保真度、以 LPIPS 衡量感知真實度,但一個壞插補的明顯破綻是鬼影般的肢體、融化的邊緣,以及快速移動物體周圍的卡頓。

天真的線性混合(僅把兩張影格平均)只要有東西移動就一定會產生疊影;令人信服的插補需要顯式的運動補償加上遮擋推理。大、快或旋轉的運動仍是最難的情形,連強力模型也會把中間影格塗糊。

又稱
video frame interpolationVFIframe-rate up-conversion