語音與語言神經義肢
音素解碼
以一種語言約 40 個音素(或一組語音特徵)作為解碼目標,使神經模型隨時間輸出一連串音素機率序列,再由語言模型組合成詞。音素構成一套精簡、可涵蓋整個語言的字母集:一個能在約 40 個單位上類推的解碼器,原則上可以產生任何詞,包括詞彙表外的詞,這是固定詞分類器做不到的。
Willett 等人(2023)在一位漸凍症(ALS)患者身上,從植入 6v 區的兩片小型皮質內電極陣列解碼嘗試發聲的音素,並結合語言模型,在 125,000 個詞的詞彙量下達到每分鐘約 62 個詞,詞錯誤率約為 24%,而在受限的 50 詞集合上則低得多。
音素邊界在神經訊號中並未被清楚切分,而且神經時間步數遠多於音素數,因此需以無需對齊的訓練目標(CTC)或以注意力機制為基礎的序列到序列模型來彌合長度不匹配的問題。
又称
另见