對齊理論
弱到強泛化(weak-to-strong generalization)
一個弱的老師,能不能訓練出一個最終比老師那些有瑕疵的教導還聰明的學生?想像一個聰明的學生由一位平庸的講師授課:如果這個學生真正掌握了學科,他就能抓住要旨、看穿老師偶爾的錯誤,最終對教材的理解超過老師所講解的程度。弱到強泛化問的是:AI 模型能不能做到同樣的事,學會表現得比它所受訓的那些不完美標籤更好?
精確地說,在 2023 年 OpenAI 的一項研究中,研究者用一個弱模型的標籤,來替代「人類對未來超人類系統所能給出的有限、易錯之監督」,並用這些弱標籤去微調一個強得多的預訓練模型。問題在於:這個強學生會只是照抄弱老師的錯誤,還是反而能找回自己的潛在能力、超越老師?他們發現,強學生往往確實能從弱監督中找回大部分的底層能力,但並非全部,留下了一個可量測的表現落差。
它之所以重要,是因為它是超級對齊(superalignment)問題的一個實證替身:如果人類將是超人類 AI 的弱監督者,那麼弱的人類回饋還能否引出強系統完整、且對齊的能力?誠實的但書相當深。它是一個類比,而不是真實情況,弱模型犯的錯誤種類與人類不同。而且「找回能力」並不等於「找回對齊的價值」:一個越過弱標籤而泛化的強模型,同樣很可能朝著錯誤的目標泛化。
用一個小型、約 GPT-2 等級模型的標籤去微調一個強得多的模型;這個強模型的得分往往遠高於它的弱監督者,儘管仍未達到它自身的完整潛力。
強學生超越了弱老師,但只走了一半路。
弱到強泛化是「監督超人類 AI」的一個類比,而非它的解法。從弱標籤中找回能力,並不等於確保強模型採納了正確的價值。
又称
另见