語音與語言神經義肢
直接語音合成(神經聲碼器)
直接從神經活動而非文字產生可聽見的語音波形,讓使用者重獲帶有韻律與近乎對話節奏的聲音。神經解碼器輸出聲學特徵(例如梅爾頻譜圖)或構音特徵,再由神經聲碼器,也就是 WaveNet、HiFi-GAN 或類似的生成模型,繪製出波形。
相較於腦到文字,其優點包括延遲更低,以及能傳達語調與強調;此外,還可從使用者發病前的錄音重建其個人化嗓音。Metzger 等人(2023)在一位癱瘓受試者身上,將文字、合成的個人化嗓音,以及由高密度皮質腦電圖驅動的臉部虛擬化身結合在一起。
重建使用者自己的嗓音,以上揚的疑問語調說出一句話,這是只輸出無語調文字的純文字解碼器所無法傳達的。
合成能還原文字解碼所捨棄的韻律與嗓音身分。
合成語音的評判標準是可懂度,也就是未受訓的聽者能否將其轉寫出來,而非僅看頻譜誤差;直接合成目前在原始準確率上落後於文字解碼,但在自然度、速度與表達力上勝出。
又称
另见