多模態與視覺語言
文字生成影片
文字生成影片把文生圖從單張靜照延伸到一段會動的影片:模型要從提示合成一連串畫面,不只每張各自合理,還要在時間上連貫,於是同一隻狗以一致的光照與可信的軌跡跑過同一個院子,而不是每一格都閃成一隻不同的狗。難的不是單格畫質,而是時間一致性。
多數現代系統是運作於學習過的潛在空間中的影片擴散模型。一個時空自編碼器把影片壓縮成潛在詞元,再由一個 transformer 或 U-Net 去噪器——除了一般的空間層之外,還配上時間注意力或 3D 卷積——學會在文字條件下對整段序列去噪。把影片視為一串時空潛在補丁、再聯合去噪(如基於 transformer 的擴散),正是當前最強模型背後的做法。影格率、長度與解析度通常靠級聯或插幀階段來延展。
前沿挑戰是長度與物理:要在許多秒內維持身分與運動,會對記憶與一致性造成壓力;而模型學「外觀」遠勝於學「動態」,於是物件會變形、肢體會增生、直覺物理被例行性地違反。評估也尚無定論,因為沒有單一指標能同時涵蓋時間連貫、提示忠實度與運動真實感。
又称
另见