語音與語言神經義肢

直接語音合成(神經聲碼器)

直接從神經活動而非文字產生可聽見的語音波形,讓使用者重獲帶有韻律與近乎對話節奏的聲音。神經解碼器輸出聲學特徵(例如梅爾頻譜圖)或構音特徵,再由神經聲碼器,也就是 WaveNet、HiFi-GAN 或類似的生成模型,繪製出波形。

相較於腦到文字,其優點包括延遲更低,以及能傳達語調與強調;此外,還可從使用者發病前的錄音重建其個人化嗓音。Metzger 等人(2023)在一位癱瘓受試者身上,將文字、合成的個人化嗓音,以及由高密度皮質腦電圖驅動的臉部虛擬化身結合在一起。

重建使用者自己的嗓音,以上揚的疑問語調說出一句話,這是只輸出無語調文字的純文字解碼器所無法傳達的。

合成能還原文字解碼所捨棄的韻律與嗓音身分。

合成語音的評判標準是可懂度,也就是未受訓的聽者能否將其轉寫出來,而非僅看頻譜誤差;直接合成目前在原始準確率上落後於文字解碼,但在自然度、速度與表達力上勝出。

又称
speech synthesis BCIneural vocoder神經聲碼器