資料牆與非平穩性
最具體的極限是量的問題:高品質神經語料相較於支撐語言與視覺模型的網路規模資料而言微乎其微,而再多的巧思也變不出更多慢性的人類皮質內記錄。更糟的是,與文字不同,神經分布在你腳下移動 — 日常非平穩性與訊號漂移意味著預訓練分布與部署分布永不相同。
一條示意性的領域適應上界:部署誤差受限於預訓練誤差,加上預訓練分布與部署分布之間的散度(新受試者、漂移),再加上一個不可約項 lambda。預訓練無法抹去巨大的分布落差。
存在通用的神經編碼嗎?
在每一項遷移主張之下,躺著一個這個領域尚未定案的科學問題:跨越不同大腦,是否存在足夠的共享結構,使單一表徵能真正通用?樂觀的證據是真實的 — 低維神經流形與守恆的旋轉動力學在動物間反覆出現。但通用性與遷移極限以及更深層的神經編碼問題都警告:通用性或許有其根本界限 — 基礎模型可能在學一種共享的計算幾何,也可能只是在學一個由提供資料的那些實驗室所構成的便利平均。
評測仍不成熟
這個領域的基準測試還很年輕,也容易被操弄。跨場次、保留受試者的評估(FALCON 式的少樣本解碼基準)方向正確,但排行榜過擬合與場次內回報會誇大表面上的進展。兩項紀律最為重要:永遠回報保留受試者/保留場次的數字,並讓準確率搭配可詮釋性,使增益是被理解、而非僅被觀察。過度宣稱是這個領域的職業風險。
大型神經模型的隱私與安全
一個在眾多人腦上訓練的模型,本身就是一個新的攻擊面。由於網路會記憶,共享骨幹便招來成員推論(我的記錄是否在訓練集中?)、腦紋再識別,以及模型反演對私密神經特徵的重建。因此,為建立基礎模型而匯集神經資料,直接與你在第二冊研讀過的神經隱私承諾相衝突 — 這是治理前沿才剛開始處理的張力。
一份誠實的清單與未來走向
以一份清楚的清單為這條學習路徑作結。已證實:能削減校準的多場次預訓練、通道無關的解碼器、領域內的少樣本情境內適應,以及編碼數位孿生。正在浮現:真正的跨受試者與多模態神經加語言模型。尚未解決:真正的跨族群通用性、可信的尺度定律、無需重新校準的抗漂移穩健性、標準化的保留基準,以及保護隱私的訓練。對未來十年的清醒判讀,期待的是穩定而不炫目的進展 — 更好的遷移、更少的校準、更嚴謹的基準 — 而非某個單一的「大腦 GPT」時刻。