可解釋性
大型語言模型可解釋性(LLM interpretability)
一個訓練好的語言模型,本質上是一大堆數字,卻能把文字變成更多文字。可解釋性就是設法打開這個盒子,回答一個聽起來很單純的問題:模型內部到底在做什麼?我們不再把網路當成只看輸出來評斷的黑盒子,而是試著讀懂從輸入到答案之間發生的運算——就像生物學家解剖身體,看哪個器官負責什麼。
實務上這是一道由淺到深的階梯。最輕量的做法只是把輸入和輸出做關聯,或標出哪些字比較重要;更深的做法則伸進模型內部,把它的內部向量解碼成人類能懂的概念,再追蹤這些概念如何被組合。目標不是含糊的故事,而是可驗證的因果說法:如果這個部位在計算那件事,那麼把它關掉就應該以可預測的方式改變行為。
為什麼要費這個工夫?因為我們在高風險場合部署這些模型,卻不知道它們為何如此回答。可解釋性是我們寄望用來抓出隱藏故障模式、驗證模型是在推理而非死背、最終決定該不該相信它所言的途徑。這門學問年輕、片面,也令人謙卑:我們能乾淨地解釋玩具級電路,卻仍只理解前沿模型的零碎片段。
可解釋性是描述性的,不是魔法:解釋也可能是錯的。永遠要問它是否經過因果驗證。
又称
另见