應用、倫理與前沿
機器人的可解釋性與信任
可解釋性,是機器人把自己的選擇講給身邊的人聽懂的能力——用人能跟得上的說法,展示它為什麼這麼做。信任,則是你希望由此換來的結果:人們對機器人的依賴恰到好處,既不盲目,也不畏懼。這兩者本就該綁在一起,因為沒有理解的信任,不過是一場賭博。如果一台機器人在走廊裡戛然停住,而你完全不知道為什麼,你就分辨不出它是在小心,還是壞掉了——於是你要麼過度信任它,要麼乾脆不再用它。
當機器人越來越多地從資料中學習、而非照搬手寫的規則時,這種需求就變得更迫切。一個學到的模型可能是個「黑箱」:它給出一個結果,卻沒有一條人能讀懂的、乾淨俐落的理由。可解釋機器人學,努力用樸素的信號把這個箱子撬開——一輛自動駕駛汽車會說「正在為右側的行人減速」,一台倉庫機器人會把它即將抓取的箱子高亮出來,一隻機械臂會在動起來之前,先把它打算揮過去的路徑顯示出來。這種解釋不必把內部的每一個數字都攤開;它只需給人足夠的資訊,去預測、去核對,並在必要時推翻這台機器。
好的解釋能建立起「校準過的信任」——一份與機器人實際可靠程度相稱的信任。這才是真正的目標,因為兩個極端都很危險:信任太少,一台有用的機器人就被擱置不用;信任太多,人就會跟著一台看上去信心十足的機器,徑直走進一個錯誤。因此,誠實的機器人不只告訴你它的決定,還會示意它的不確定性,相當於在說「我相當有把握」或「我這裡是在猜」,好讓人確切地知道,什麼時候該湊近些、再仔細看一眼。
一台手術機器人暫停下來,顯示「置信度低:組織未能清晰辨認」,提請外科醫生在它繼續之前先看一眼。
坦承「我不確定」,有時比一個最終出錯的自信答案更能贏得信任。
目標是「校準過的信任」:按機器人真實的可靠程度去依賴它——不是越信任越好,而是恰到好處。
又稱
另見