人工智慧安全與對齊
弱到強泛化(weak-to-strong generalization)
弱到強泛化提出一個尖銳的問題:若你只有一位標籤常常出錯的弱老師,能否仍然引出一個強學生模型大得多的潛在能力?它是對未來情境的一種實證替身——屆時身為弱監督者的人類,必須去對齊比自己懂得更多的模型。寄望在於強模型內部其實已表徵了正確答案,因此弱標籤大多只需指向那份知識,而非從零教起。
經典實驗會用一個小得多的模型所產生的標籤去微調一個大型預訓練模型,再衡量它把與真實標準效能之間的落差補回了多少,並以「效能落差回收率」來總結。結果顯示強學生往往勝過它的弱老師、能泛化越過老師的錯誤;而一些簡單的輔助手段——附加的信心損失、透過中間規模模型逐級自舉、更好的無監督表徵——都能大幅提高回收率,儘管仍遠未達到完全。
這個結果令人鼓舞但有其界限。強模型同樣可能忠實地模仿老師的錯誤而非加以更正,尤其當任務獎勵的是模仿風格而非真相時;而且各領域的回收率參差不齊。因此弱到強最好被理解為「引出潛在能力是可能的」這一證據,而非一份已完成的對齊保證。
其指標是「效能落差回收率」:零代表學生不比弱老師強,一代表它達到了強標籤的上限。
又称
另见