可解釋性
表示工程(representation engineering)
與其把模型當成一個只能用提示從外部戳弄的黑盒子,不如想像把它的內部「心智狀態」當成你可以直接讀取與調整的對象。表示工程是一種由上而下的可解釋性與控制方法,它把模型高層次的內部表示——對應誠實、公平或有害性等概念的活動模式——當作首要對象:先把它們定位出來,再加以監看或修改。
實務上它有兩面。讀取面使用的方法,例如比對模型在成對提示上的激活(誠實對不誠實、有害對無害),以萃取出一個能在整個網路上追蹤該概念的方向,這很像探針,但瞄準的是一個全域的特質。控制面則用那個方向去引導模型——沿著「誠實」推動激活,讓它更如實,或把那個方向當作一個即時監視器,看模型是不是正要產生某些有害的東西。激活引導是它的核心工具之一;它的特色想法是聚焦於整個概念層次的表示,而不是去追蹤個別的神經元或接線。
表示工程之所以重要,是因為它對誠實、無害這類難以用規則明確界定的棘手安全目標,提供了一個相對可擴展、以概念為先的把手。它與激活引導及探針大量重疊,有時被拿來與「費力逆向工程電路」的由下而上機制可解釋性相對照。誠實的提醒屬於同一族風險:一個在你的測試提示上與「誠實」相關的方向,未必是模型真正的誠實機制;透過這些方向進行的控制是粗糙的,可能有副作用;而一個看起來很有把握的監視器,仍然可能被騙過。
藉由比對模型在誠實回答與刻意誤導回答上的激活,研究者萃取出單一一個「誠實」方向。讀取它就像一個測謊旋鈕,而沿著它推動模型,會讓它的回答在可量測的程度上更為坦率——讀取與控制,來自同一份表示。
表示工程讀取並調整整個概念層次的狀態,而不是個別的接線。
一個在測試提示上與某特質相關的方向,未必是模型對該特質的真正機制;表示層次的控制是粗糙的,而以此打造的監視器可能被規避。
又稱
另見