可解釋人工智慧(explainable AI, XAI)
/ ik-SPLAY-nuh-bul AY-AY /
可解釋人工智慧,是設法讓模型的推理為人所理解的努力——至少把那只黑箱,部分地變成一只玻璃箱。許多強大的模型,尤其是深度神經網路,是經由數以百萬計、沒有人能跟得上的算術步驟得出答案的。XAI於是問一個更謙卑、更務實的問題:哪怕我們沒法追蹤每一個神經元,能不能給出一種解釋,幫助人去信任、核查、或質疑模型所做之事?
它分成兩條大路。有些模型「天生可解釋」——一棵短小的決策樹、一個簡單的線性公式,邏輯你可以直接讀出來。另一些則是「事後」被解釋的:你保留那個不透明的模型,再外掛一些工具,為「它為何這樣答」編出一個故事,比如標出哪些輸入最要緊。前者誠實,卻往往不那麼準;後者靈活,但它產出的解釋是近似,而非模型真正的內部運作。
凡是決定會影響到一個人之處,可解釋性就要緊——一筆被拒的貸款、一個被標記的腫瘤、一份被篩掉的履歷——因為「演算法說的」不是一個能被接受的理由,而法律也越來越要求更多。但這裡有一處至關重要的誠實:一個聽起來言之成理的解釋,並不等於一份對模型推理的真實陳述。事後解釋可能不穩定、可能彼此打架、還可能被「做手腳」做得看上去很公平,而底下的模型照舊胡來。一個好的解釋,建立起恰如其分的信任;一個油滑的解釋,則製造出虛假的信任。
一家銀行的模型拒絕了一筆貸款。一個可解釋性工具報告出最主要的幾條理由:「負債收入比過高」和「信用記錄過短」。這讓申請人得以理解並申訴這個決定——也讓銀行得以核查:模型是不是在暗地裡倚仗申請人的郵遞區號,把它當成種族的替身。
一個解釋要侍奉兩位主人:受影響的當事人,以及那位核查暗藏偏見的稽核者。
要區分人們常常混為一談的兩樣東西:解釋(關於某一個決定、對人友好的一個故事)和模型真正的機制(實際把它算出來的東西)。大多數流行工具給的是前者,卻暗示著後者。一個言之成理、卻沒有忠實反映模型的解釋,可能比沒有更糟——它會借給你一份不該有的信心。