神經資料的基礎模型與表徵學習

神經尖峰詞元化

指如何把連續或點過程的神經訊號轉成 transformer 所讀取的離散或連續「詞元」的設計選擇。三種主要策略佔主導。分格再分塊將尖峰轉為時間分格的放電率矩陣,再把格子分組成小塊(Neural Data Transformer 的作法)——成本低,但會失去格內的細部時序。逐尖峰詞元化把每個尖峰表示為一個詞元,攜帶學習到的單元身分嵌入與以旋轉位置或傅立葉特徵編碼的連續時間戳(POYO)——保留精確時序,並自然容納數量可變、無序的神經元集合。向量量化則學習一個碼本,把訊號時窗映射到離散碼(LaBraM 為腦電設計的神經詞元器),提供適合遮罩詞元預測的有限詞彙。

取捨十分具體。逐尖峰詞元保留時序,但序列長度隨放電率增長;分格緊湊卻粗糙;離散 VQ 碼可支援乾淨的語言模型式目標,但捨棄了細部振幅與時序。詞元化也是解決或延後異質性問題之處:逐單元的身分嵌入,正是讓單一模型能跨越含不同神經元陣列的關鍵。

勿將詞元與神經元混為一談。在逐尖峰方案中,一個詞元是單一尖峰事件;神經元的身分只是附加其上的一個嵌入,因此高放電的單元會貢獻許多詞元。

又称
neural tokenizationtokenizing neural activity