非平穩性與解碼器漂移
昨天表現出色的語音解碼器,今天可能就失靈。神經訊號是非平穩的:電極微幅位移、組織阻抗改變、異物反應持續演變、注意力與喚醒程度起伏,皮質本身也隨使用者學習而重新規劃。統計上這是共變量偏移——即使底層的言語意圖未變,解碼器所見的輸入分布仍會漂離其訓練時的分布。把解碼器參數建模為緩慢漂移,問題便一目了然:
\theta_t = \theta_{t-1} + \omega_t, \qquad \omega_t \sim \mathcal{N}(0, Q), \qquad p_{\text{day }d}(r) \neq p_{\text{day }1}(r)以隨機漫步看待漂移:有效的解碼器參數在數日間游移,第 d 天的特徵分布不再與第一天吻合。固定的解碼器無法追上這種變化;必須有某物去適應。
把解碼器的有效參數想成每天走一小步隨機漫步,於是訊號的統計特性慢慢地偏離第一天。凍結的解碼器追不上這種漂移——系統中必須有某物隨時間去適應。
- \theta_t
- 第 t 天的有效解碼器參數。
- \omega_t \sim \mathcal{N}(0, Q)
- 每天走的一小步隨機位移。
- p_{\text{day }d}(r) \neq p_{\text{day }1}(r)
- 第 d 天的特徵分布不再與第一天吻合。
電極沉降、神經元位移,於是一週前的校準逐漸失效——這就是神經非平穩性。
重新校準與穩定化解碼器
有兩種哲學對抗漂移。第一種重新配適解碼器:重新校準在每次工作階段開始時,跑一小段已知句子(監督式),或在沒有真值時,倚賴以語言模型自身輸出為偽標籤的半監督自我重新校準:
\hat{\theta}_d = \arg\max_{\theta} \; \mathbb{E}_{\hat{w} \sim p_{\text{lm}}} \bigl[ \log p_\theta(\hat{w} \mid X_d) \bigr]半監督重新校準:把解碼器重新配適,使其在當日資料上與語言模型偽標籤 \hat{w} 的一致性最大化。它免去了每日校準的負擔,但若不加把關,可能鞏固語言模型的偏誤。
與其要求使用者每天重新校準,不如把解碼器重新配適,使其輸出與「語言模型認為說了什麼」(偽標籤)最一致。它免去每日負擔——但若不加把關,可能把語言模型的偏誤烙進解碼器裡。
- \hat{\theta}_d
- 為第 d 天重新配適的解碼器參數。
- \hat{w} \sim p_{\text{lm}}
- 由語言模型提出的偽標籤。
- \log p_\theta(\hat{w} \mid X_d)
- 給定那些標籤時,解碼器對今天資料 X_d 的解釋有多好。
- \mathbb{E}_{\hat{w} \sim p_{\text{lm}}}
- 對語言模型偽標籤取平均。
系統解碼今天的嘗試,讓語言模型把它們清理成可能的句子,再拿這些去訓練——這就是自我重新校準。
第二種哲學則凍結解碼器、把資料搬過去對齊:穩定化潛在空間解碼器利用神經流形穩定性——即群體活動的低維幾何比任何單一通道都更穩定這項發現——把每天的記錄對齊到一個固定的潛在空間,使已訓練的讀出端能連續數月保持有效。
- 工作階段開始時,先錄製一小段固定、已知目標句子的區塊。
- 估計當日的特徵統計,並將其對齊到參考潛在空間(重新置中、白化或流形對齊)。
- 若有標籤,於校準區塊上更新讀出端;若無,則改用語言模型偽標籤。
- 監測線上信心與錯誤訊號,當漂移超過閾值時,重新觸發校準。
泛化:詞彙、階段與受試者
除了保持穩定,解碼器還應能泛化。三個軸線難度遞增:開放詞彙解碼(任意詞,而非固定集合)、跨工作階段(無須重新校準的新一天),以及跨受試者(皮質解剖與電極位置各異的新個體)。目前對這三者的押注是自監督預訓練與神經基礎模型:把跨階段、跨個體的大量未標註神經資料匯集起來,學習可遷移的表徵,再用少量標註語音微調。
誠實的效能上限
誠實的開放問題,是那些不夠光鮮的:跨越多日而無須每日重新校準的韌性、對詞彙外與語碼轉換語音的優雅表現、低到足以支撐真實對話的延遲,以及能熬過慢性植入緩慢生物變化的解碼器。橫亙在展示與療法之間的,是這些問題,而非某個好日子裡的巔峰準確度。
解碼言語的隱私、能動性與治理
在整個 BCI 中,語音解碼是心智隱私與神經權利最尖銳的案例。讀出意圖中的語言,比任何游標解碼器都更接近讀心,而嘗試相對於內在言語的界線不只是技術問題——倫理正棲身於此。當前系統解碼的是嘗試發聲,是使用者主動發起的刻意行為;它們並未竊聽自由流動的內心獨白。但隨著內在言語解碼進步,這條令人安心的界線將逐漸模糊,設計上必須刻意守住它。
語言模型帶出第二個問題,關乎能動性與作者身分:當流暢的先驗補上使用者並未完全成形的字詞時,這句話究竟是誰的?這些都不是事後的補充。它們主張採用裝置端解碼、由使用者明確控管解碼器何時聆聽、對語言模型貢獻多少保持透明,並在技術超前之前先建立治理框架。