神經資料的基礎模型與表徵學習
多模態(神經+行為+語言)模型
指把神經活動與其他資料流——行為(運動學、影像、姿態)、感覺刺激與語言——聯合表示的模型。常見兩種樣態。融合式讓模型以多種模態為條件,以銳化其表徵或解碼:例如 Neuroformer 便是作用於尖峰、行為與刺激之上的 GPT 式模型。對齊式則把神經表徵映射到某預訓練模型的嵌入空間——CLIP 式的視覺嵌入,或語言模型的詞元空間——使解碼可為開放詞彙或生成式,如從功能性磁振造影進行語意語言重建,以及藉擴散先驗進行影像重建。
此處尤須誠實,因為最驚人的展示皆在於此。非侵入式語意語言解碼所還原的是要旨與改寫,而非逐字的內在言語,通常需要每位受試者數小時的訓練,且若受試者抗拒便會退化或失效。影像重建屬語意層級且常為受試者專屬。對齊至預訓練模型空間是有力的橋樑,但其輸出是以強生成先驗為條件的重建,而非思想的直接轉錄。
當解碼器耦合一個大型生成先驗時,把輸出歸因於大腦須格外謹慎:先驗可能從薄弱的神經證據幻想出連貫內容,因此評估必須控制單靠先驗本身會產生什麼。
又称
另见