鲁棒性与可解释性

可解释人工智能(explainable AI, XAI)

/ ik-SPLAY-nuh-bul AY-AY /

可解释人工智能,是设法让模型的推理为人所理解的努力——至少把那只黑箱,部分地变成一只玻璃箱。许多强大的模型,尤其是深度神经网络,是经由数以百万计、没有人能跟得上的算术步骤得出答案的。XAI于是问一个更谦卑、更务实的问题:哪怕我们没法追踪每一个神经元,能不能给出一种解释,帮助人去信任、核查、或质疑模型所做之事?

它分成两条大路。有些模型「天生可解释」——一棵短小的决策树、一个简单的线性公式,逻辑你可以直接读出来。另一些则是「事后」被解释的:你保留那个不透明的模型,再外挂一些工具,为「它为何这样答」编出一个故事,比如标出哪些输入最要紧。前者诚实,却往往不那么准;后者灵活,但它产出的解释是近似,而非模型真正的内部运作。

凡是决定会影响到一个人之处,可解释性就要紧——一笔被拒的贷款、一个被标记的肿瘤、一份被筛掉的简历——因为「算法说的」不是一个能被接受的理由,而法律也越来越要求更多。但这里有一处至关重要的诚实:一个听起来言之成理的解释,并不等于一份对模型推理的真实陈述。事后解释可能不稳定、可能彼此打架、还可能被「做手脚」做得看上去很公平,而底下的模型照旧胡来。一个好的解释,建立起恰如其分的信任;一个油滑的解释,则制造出虚假的信任。

一家银行的模型拒绝了一笔贷款。一个可解释性工具报告出最主要的几条理由:「负债收入比过高」和「信用记录过短」。这让申请人得以理解并申诉这个决定——也让银行得以核查:模型是不是在暗地里倚仗申请人的邮政编码,把它当成种族的替身。

一个解释要侍奉两位主人:受影响的当事人,以及那位核查暗藏偏见的审计者。

要区分人们常常混为一谈的两样东西:解释(关于某一个决定、对人友好的一个故事)和模型真正的机制(实际把它算出来的东西)。大多数流行工具给的是前者,却暗示着后者。一个言之成理、却没有忠实反映模型的解释,可能比没有更糟——它会借给你一份不该有的信心。

又称
XAIinterpretable AI可解释AI可解释性可解釋AI可解釋性