神經資料的基礎模型與表徵學習
大規模神經資料語料庫
指預訓練資料問題:匯集足夠龐大且多樣的神經紀錄以訓練基礎模型。公開行動指出了方向——International Brain Laboratory 跨多實驗室標準化 Neuropixels 紀錄、人類顱內資料集(AJILE 等),以及大型臨床腦電語料庫如天普大學醫院的檔案——而 NWB(Neurodata Without Borders)等標準化格式使匯集成為可能。
即便如此,最大的神經語料相較於訓練本領域所取法之模型的文字與影像資料集,仍屬微小。異質性有雙面性:跨物種、跨腦區、跨任務與跨設備的多樣性正是通用模型所需,但同時也是可能鈍化甚至逆轉遷移的分布偏移。資料共享、同意、標準化與慢性紀錄的高昂成本是實務上的限速因素,這也是為何資料匯集(而非模型架構)常是規模化的真正瓶頸。
又稱
另見