穩健性與可解釋性

LIME(局部可解釋模型無關解釋)

/ lime (like the fruit) /

LIME解釋單次預測的辦法,是搭一個小巧、簡單的模型去模仿那個龐大複雜的模型——但只在這一個個案的緊鄰處模仿。直覺是這樣:一條彎彎的路,你若只盯著其中幾英尺看,它看上去是直的。一個複雜模型的決策曲面是一條扭動的曲線,可就在某個特定輸入的周圍,一條簡單的直線就能把它近似得足夠好,好到能讀出:對這次預測,哪些特徵要緊。

操作上,LIME拿你的輸入,反覆抖動它,造出許多略加改動的版本,再去問那個黑箱模型對每一個的預測,然後用這些局部答案去擬合一個易讀的模型(通常是線性的),並給離得近的變體最大的權重。結果是一份簡短的清單,比如:「這封郵件被標為垃圾,主要因為出現了『中獎』和『免費』,儘管它也出現了『會議』一詞。」關鍵在於:LIME完全不需要知道模型的任何內部構造——它適用於任何模型,把模型當成一個你只能查詢的盒子。

LIME的饋贈是「易懂」:一個清晰、局部、與模型無關、人人都能領會的解釋。它誠實的弱點也實打實。解釋取決於你如何定義「近鄰」、如何生成那些抖動的樣本,所以把LIME跑兩遍,可能給出不一樣的答案——它默認並不確定。而且,和一切事後方法一樣,它解釋的是一個局部的近似,而非模型真正的推理;拿它來獲取直覺、來除錯,可以;把它當成一紙保證,不行。

一個經典的演示:某個模型能高準確率地區分狼與哈士奇。LIME標出了驅動每次判定的影像區域,結果揭示:模型主要在看背景裡的雪——狼的照片碰巧多是雪景。它壓根沒在認狼;它是一個「雪偵測器」。

LIME最著名的一次擒獲:一個其實在偵測雪的「狼偵測器」。

LIME和SHAP常被混用,但二者有別:SHAP立足於博弈論的保證與「加性」;LIME則擬合一個快速的局部替身,更快,卻更不穩定,重複跑時有時會給出不同的解釋。當這樣兩個工具對同一次預測各執一詞時,這種分歧本身,就是一條值得去查的資訊。

又稱
Local Interpretable Model-agnostic Explanations局部解释局部可解釋