多模態大型語言模型

影片理解(video understanding)

影片理解(video understanding)是對一連串隨時間推移的畫面推理,而非單一畫面——烹飪教學、監視器片段、運動精華、課堂錄影。模型得抓住正在發生什麼、又如何變化:誰走進了房間、下一步是什麼、為什麼那名球員越位。這是視覺再加上前後之分這個額外維度。

最直接的作法是抽樣畫面——每秒幾張,或挑關鍵影格——把每張當影像編碼,再把整串影像詞元餵給模型,常附上時間戳,好讓它對順序與時長推理。難題在於量太大:即使以不高的抽樣率,一分鐘影片也是上千個詞元,因此系統會池化影格、挑出顯著時刻,或用記憶技巧把長片塞進脈絡窗。音訊也常被一併融合,因為聲音承載了影片大半的意義。

因為大多數影格被略過,模型會漏掉抽樣之間的短暫事件,也難以掌握細緻的時間順序——她是在放蛋之前還是之後加鹽?長影片在沒有大刀闊斧的摘要下,仍大致超出能力範圍。

又稱
video LLMvideo question answering