JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

誠實評估:證據標準、指標與依從性

如何把真實的真實世界結果與僥倖的展示區分開來:正確的機率水準與對照、不洩漏的交叉驗證、資訊速率與吞吐量指標,以及「人們是否會持續使用」的人因現實。

什麼才算證據

在實驗室之外,證據標準正是橫亙在「真實能力」與「行銷說詞」之間的東西。消費級神經科技證據標準借鑑臨床研究:預先註冊、足夠的樣本量,以及最重要的——恰當的對照。許多神經回饋與刺激的宣稱,一遇上加盲的偽刺激對照便蒸發,因為預期與安慰劑效應強大,一個相信裝置有效的使用者,往往會表現得彷彿它真的有效。若一項研究沒有加盲的偽對照,就把它的效應視為未經證實,而非被推翻——但確實是未經證實。

誠實地高於機率

真實世界的資料集又小又不平衡,因此很容易自欺。有兩項紀律要緊。第一,計算真正的機率水準:對小的測試集而言,二項機率水準高於天真的 1/N,而置換檢定則給出免分布假設的顯著性門檻。第二,防範資料洩漏:在神經資料的交叉驗證中,你必須尊重資料的結構——絕不能讓同一次試驗、或同一位受試者的樣本同時落在訓練集與測試集——否則你報告的準確率,真實世界永遠復現不了。

\mathrm{acc}_{\text{crit}} \approx \frac{1}{N} + z_{1-\alpha}\,\sqrt{\frac{\tfrac{1}{N}\left(1-\tfrac{1}{N}\right)}{n}}

在 n 次測試試驗、N 個類別下,「高於機率」門檻的常態近似:試驗數少時,臨界準確率遠高於 1/N。報告準確率卻不做此修正,是典型的小樣本過度宣稱。

有意義的指標

單看準確率,對一個溝通裝置而言是糟糕的摘要。資訊傳輸率(ITR)把準確率、選項數與速度綜合成每分鐘位元數——這是本領域最接近共通貨幣的東西,儘管它偏袒同步範式、也忽略易用性。至於控制任務,費茲定律吞吐量以使用者命中不同難度標的的速度來量測有效位元,捕捉靜態準確率所隱藏的速度—準確率取捨。

B = \log_2 N + P\log_2 P + (1-P)\log_2\!\frac{1-P}{N-1}

沃波(Wolpaw)在 N 個等機率標的、準確率 P 下的每次選擇位元數;乘上每分鐘選擇次數即得 ITR。留意增加選項的獎賞(log N),一旦準確率 P 下降便迅速被抵銷——這正是速度與可靠性之間誠實的張力。

沒有基準測試會顯示的指標:依從性

最具決定性的真實世界指標,從不出現在排行榜上:人們究竟會不會持續使用這台裝置。長期依從性人因——設定時間、舒適度、認知負荷、失敗時是否從容——往往比幾個百分點的準確率更要緊。一台略不準卻能自行戴上、整天配戴的裝置,就總體實際獲益而言,會勝過一台稍好卻被丟在抽屜裡的裝置。

這正是為何「部署」而非僅是「解碼」是一個研究問題。在家、自行操作的 BCI,以及獨立操作的實證——包括植入使用者在無技術員在場下操控數位裝置——正因為它們是在日常生活中、而非遮蔽室中被量測,才是本領域最有意義的真實世界里程碑之一。

血管內途徑為何對評估重要:一個免開顱遞送的植入物,較容易為長期、在家、獨立使用提供正當理由——而這正是依從性與居家使用指標真正量測的真實世界終點。