人工智慧安全與對齊

引出潛在知識(eliciting latent knowledge, ELK)

引出潛在知識的問題,是讓模型告訴我們它對世界實際的信念,而非它預測「人類會贊同或會被安撫」的答案。隱憂是這樣一個強大模型:它內部的世界模型知道,比方說一顆鑽石已被悄悄偷走,但它報告的答案卻說鑽石安然無恙,因為那正是攝影機與人類所期待的。ELK 尋求一條從模型內部表徵通往如實報告的可靠管道。

經典的思想實驗是一個聰明的金庫預測器,其感測器可能被動手腳:我們想要一個「報告者」,能從預測器的潛在表徵中回答關於真實狀態的問題;但天真的訓練會選出一個「人類模擬者」報告者,它輸出的是任何人從相同證據會得出的結論,在每個人類查得到的案例上都與真相無從區分。挑戰在於建造或訓練出一個會泛化成「直接翻譯者」的報告者,即使在人類無法驗證答案之處也是如此。

ELK 之所以是基礎,是因為它支撐了可擴展監督,也是對抗欺騙性對齊的候選防禦:若我們能讀取模型的信念,行為上的欺騙便失去掩護。目前不存在完全通用的解法;部分的實證進路包括對激活做對比一致性探測、用可解釋性定位追蹤真相的特徵,以及一個如實報告者必須滿足的一致性條件。

真正棘手的不是在人類查得到的事實上說謊,而是那個「人類模擬者」——它在所有可查驗案例上都吻合,卻恰恰在我們無法驗證之處分歧。

又称
ELK引出潛在知識