語音與語言神經義肢

迴路中的語言模型

幾乎所有高效能語音或手寫 BCI,都會將帶雜訊的神經序列模型與一個語言模型配對,後者編碼了「哪些詞序列較合理」的先驗知識。神經模型針對音素或字元逐時間步輸出機率;集束搜尋(beam search)解碼器將這些機率與 n 元語法或神經語言模型融合,輸出最可能的句子,並修正許多神經層面的錯誤。

這正是為何原始的逐符號神經準確率與最終詞錯誤率可相差一個數量級,也是為何在完全不改動神經訊號的情況下,啟用或升級語言模型即可提升所回報的效能。

語言模型是一把雙刃的先驗:它能大幅降低分佈內語言的錯誤,卻可能產生流暢、自信卻錯誤的文字(幻覺),並使輸出偏向其訓練語料;它也模糊了「單靠神經訊號究竟攜帶多少資訊」這類主張。

又稱
LM decodingbeam-search decoding語言模型解碼