人工智慧安全與對齊
機器遺忘(machine unlearning)
機器遺忘的任務,是從一個已訓練好的模型中移除特定訓練資料、或某項特定能力的影響,使結果表現得彷彿從未見過那些資料,而又不必付出從頭重訓的代價。其動機案例都很具體:履行隱私法下的刪除請求、清除受著作權保護或有毒的文本,或從一個其餘部分仍有用的模型中剝除某項危險技能,例如詳盡的生物武器合成。
黃金標準是精確遺忘——在「資料集扣除被遺忘樣本」上重訓,正確但通常太昂貴;於是該領域發展出近似遺忘:用梯度上升或微調更新把模型推離遺忘集,同時用一個保留集維護一般能力,並常附上「結果與精確重訓模型有多接近」的可證界限。能力遺忘則改以某概念為標的,降低在危害領域上的表現,同時讓良性行為原封不動。
棘手之處在於驗證與持久性。模型可能看似已遺忘,知識卻仍潛伏存活,並可被寥寥幾步微調、一次越獄或一個間接提示重新喚回——所以「壓抑」不等於「移除」。遺忘也與效用相互權衡,可能損及糾纏在一起的能力;而要誠實地評估它,需要的是對抗式的重學攻擊,而非只是檢查模型如今會拒答或答錯。
壓抑相對於移除:如今會拒答的模型可能仍持有那份知識,能被輕量微調喚回。要用重學攻擊來稽核,而非只看它是否拒答。
又稱
另見