JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

語音 BCI 的核心問題:頻寬、神經解剖與兩大範式

為何語音復健是頻寬最高的 BCI 目標、它在皮質何處可解,以及「腦訊號轉文字」與「直接合成」如何劃分整個領域。

承先啟後:從拼字器到語音

在第一卷中,你已建立核心直覺:什麼是腦機介面解碼管線如何把訊號轉為指令,以及EEGECoG皮質內記錄各自的取捨。本路線要深入探討 BCI 所能輸出中最艱難的一項:連續、自然的語言。臨床動機十分迫切——那些因漸凍症(ALS)、腦幹中風或閉鎖症候群而構音不能的人,心中語言流暢,卻無法驅動產生言語的肌肉。

使問題可解的關鍵觀念轉折在於:語音神經義肢並非讀取抽象思緒,而是解碼嘗試發聲的運動計畫——那些原本要驅動聲道的皮質指令,即使最終沒有聲音發出,仍然會被產生。

頻寬論證

為何投入如此多心力在語音,而非做一個更快的拼字器?答案是頻寬。對話式語音約為每分鐘 150 個詞,而英文文字的資訊量約在每字元一位元的量級(夏農的經典估計)。兩者相乘,自然語音的資訊率遠超每秒十位元——比逐字母的P300SSVEP拼字器在實務上所能達到的高出一個數量級。

R_{\text{info}} \;\approx\; \underbrace{2.5}_{\text{words/s}}\;\times\;\underbrace{5}_{\text{char/word}}\;\times\;\underbrace{1}_{\text{bit/char}} \;\approx\; 12\ \text{bits/s}

數量級的目標:自然語音約承載每秒十餘位元的資訊,正是語音 BCI 所追求的頻寬。

一個粗略估算:以每秒約 2.5 個字、每字 5 個字元、每字元約 1 位元的真實資訊來算,自然語音約承載每秒十餘位元——這正是語音 BCI 所追求的頻寬。

R_{\text{info}}
資訊率,以每秒位元計。
2.5,\ 5,\ 1
三個因子:每秒字數、每字字元數、每字元位元數。

拿一個好的打字型 BCI(每秒幾位元)來比——語音的目標大約高十倍,這正是語音神經義肢的目標。

可解碼的語音位於皮質何處

可解碼的語音位於腹側感覺運動皮質(vSMC),其中保有發音器官——喉、唇、舌、下顎與軟顎——的體感拓撲圖。關鍵在於,這是一種運動表徵而非語意表徵,因此遠比從語言理解區域讀取意義來得可解。而嘗試、想像與內在言語的區分,決定了你能取得多強的訊號:嘗試發聲——受試者主動試圖構音——即使沒有可聞的輸出,仍能強力驅動 vSMC;而內在(默想)言語則較弱、變異更大,且空間組織性遠遠不足。

兩大範式:文字與嗓音

腦訊號轉文字把皮質活動解碼成離散的符號序列——字元、音素或詞。由於輸出是語言,你可以把語言模型引入迴圈以修正錯誤並確保流暢,這讓文字成為準確度的冠軍。代價則是延遲,以及逐字稿所捨棄的一切:你的嗓音、你的韻律、你的節奏。

直接語音合成則反其道而行,透過神經聲碼器直接解碼成音訊波形。它能還原帶有韻律、且具即時串流感的嗓音——但也更困難、更嘈雜,因為你必須重建一個豐富的聲學訊號,而非從有限的字母表中挑選。

兩種範式都體現同一個閉迴路——擷取、濾波、特徵抽取、解碼器——僅在效應端(文字呈現器或音訊合成器)以及是否即時閉合回饋上分道揚鑣。

哪些訊號承載得了語音?

究竟什麼訊號承載得了語音?覆蓋 vSMC 的高密度 ECoG是主力:它兼具廣覆蓋,以及足以追蹤高伽瑪頻段(約 70–150 Hz)的空間與頻譜解析度,而高伽瑪正是承載多數語音相關資訊的局部放電代理。皮質內微電極陣列(如猶他陣列)則加入單一與多單元的解析度,但取樣的組織體積極小。相較之下,頭皮EEG受體積傳導嚴重模糊、又難以取得高伽瑪,因此從 EEG 進行連續語音解碼至今仍遙不可及。