神經資料的深度學習

神經資料的 Transformer

Transformer 把自注意力(self-attention)——對序列中每個元素,依可學習的查詢–鍵相似度計算其他所有元素的加權組合——應用於神經時間序列與神經群體。注意力機制移除了循環瓶頸:它平行處理一整個窗,並能直接關聯遠距的時間點或遠距的電極,適合 ECoG 語音解碼與多腦區記錄那種又長又多通道的脈絡。位置編碼則補回注意力本身無法感知的時間(或空間)次序。

對神經資料而言,挑戰在於資料飢渴:注意力的歸納偏置弱、參數多,因此從零訓練的 transformer 會在多數 BCI 資料集有限的試次數下過度擬合。故其成功主要來自自監督預訓練與基礎模型配方,以及注入原始架構所缺結構的領域專屬詞元化(逐通道分塊、尖峰計數分箱)。

在 ECoG 語音解碼中,自注意力讓模型能把某音素的皮質特徵與許多字之前的脈絡相關聯,但同一模型若在單一參與者有限資料上從零訓練便會過度擬合——增益只有在該參與者未標記記錄上做自監督預訓練後才出現。

注意力的長程能力確實存在,但在 BCI 規模的資料上,它主要透過預訓練才見成效。

又稱
self-attentionneural transformer