對齊理論

AI 辯論(AI safety via debate)

一個非專家,常常能靠著觀看兩位專家彼此辯論、互相反駁,挑出較有道理的一方,因為謊言通常有個弱點會被對手揭穿,即使這位裁判獨力永遠找不出真相。AI 辯論把這件事變成一種訓練方法:讓兩個 AI 為一個問題各持相反的答案爭辯,再由一個人類來判定誰辯得比較好。

更精確地說,在辯論這個提案中(Irving 等人,OpenAI,2018),兩個模型副本拿到同一個問題,被指派去捍衛相對立的答案。它們輪流陳述,而且重要的是,會指出對方論證中的瑕疵與漏洞。一個可能比辯手弱得多的人類裁判宣布勝負,而模型則被訓練去「贏得辯論」。期望在於:捍衛一個錯誤答案比捍衛一個正確答案更難,因為一個誠實的對手總能揭穿謊言,於是這場賽局的均衡會獎勵誠實、有用、易於查核的論證,即使對於人類無法直接回答的問題,也能給我們一個訓練信號。

辯論之所以重要,是因為它是可擴展監督的另一個候選方法,是迭代放大的姊妹。這裡的誠實至關重要:這是一個「期望」,不是一個「定理」。它取決於真相是否真的比謊言更容易論證,以及裁判是否不會被修辭所騙。已知的失敗模式是真實存在的,例如「混淆論證問題」(辯手把一個瑕疵藏得太深,在可用的步驟內無法被揭穿)以及對裁判的說服式操弄,而目前的實證結果好壞參半。

被問到兩種醫療方案哪一種比較安全時,兩個 AI 各持一方爭辯,彼此點出對方挑揀有利數據的問題,再由一位非專家裁判選出較站得住腳的一方,理想上能落在真相上。

兩個 AI 爭辯,由較弱的人類裁判,理想上由誠實勝出。

辯論假設真相比謊言更容易捍衛、且裁判不會被誤導。兩者都可能失敗,例如論證被混淆到在允許的回合內無法反駁,因此辯論是一個研究提案,而非已被證實的保障。

又稱
debateAI 安全辯論