人工智慧安全與對齊

辯論(debate,AI 安全)

辯論是一種可擴展監督協定:兩個能力相當的模型針對某問題各執相反答案互相爭辯,再由一位較弱的評審(往往是人類)裁定誰勝出。這個賭注是不對稱的:指出一個論證的瑕疵,比建構一個無懈可擊的論證容易;所以若「說真話」在辯論上佔優勢,一個能力有限的評審就能在那些單憑己力永遠無法驗證的問題上,被引導向正確答案。訓練會獎勵每位辯手去說服評審。

形式上它是一個雙人零和賽局,其均衡理應偏向誠實;以複雜度的語言分析,它讓一個多項式時間的評審得以裁決那些「單一不可信模型不該被直接信任去解」的問題。辯手可以引用來源、遞迴拆解爭點,並挑戰對手所提的任何特定主張,迫使謊言在受攻擊之處——也就是評審能集中其有限審視力的那一點——為自己辯護。

實證上辯論在某些任務有幫助、在另一些則無,而且它有已知的失效模式:一個為真但複雜到在可用步數內無法被駁倒的「混淆論證」,可能擊敗一個較簡單的真論證;說服力可能從正確性漂移向修辭;而帶有系統性偏見的評審,也可能同時被兩位辯手利用。它是監督超越人類系統的一個有前景、但尚未被證實的機制。

又称
AI safety via debate辯論機制