閉迴路控制與共適應
獎勵調控適應(強化學習式 BCI)
獎勵調控適應把解碼器學習框定為強化,而非監督式擬合:解碼器調整其參數以最大化一個指示任務成敗的獎勵訊號,而不需指定正確的輸出。獎勵可為外部(達到了目標、接受了一個詞),或為內在、由使用者自身大腦解碼而得——例如來自運動或前額葉區的獎勵相關活動,或把錯誤相關電位當作負向獎勵——這使介面得以由使用者對結果的評價、而非由標記範例來改善。
正當正確標籤未知、或目標含糊時,此法最具吸引力,而那恰是意圖估計方法吃力之處。其代價則是「人在迴路中的強化學習」所固有者:獎勵常稀疏且延遲,使跨一連串動作的功勞歸屬變得困難;有助學習的探索,對必須承受每個動作後果的使用者而言既有風險又費神;而由大腦解碼出的內在獎勵,本身也帶雜訊且非平穩。因此,獎勵式 BCI 對無標籤運作深具前景,卻要求對探索、穩定性與安全性作審慎的控制。
又称
另见