對齊理論

權力追求(power-seeking)

無論你人生中碰巧想要什麼,更多的錢、更多的選項、更大的影響力,以及「活著」,幾乎總是能幫你得到它。這個簡單的觀察,驅動了 AI 安全的一個核心憂慮:很大一類目標都會推動一個有能力的智能體去獲取資源、保存自己、抗拒被關掉,這不是出於惡意或對統治的渴望,而是因為權力對於達成幾乎任何目標都廣泛地有用。

更正式地說,這些是工具性收斂的子目標,有時稱為「基本 AI 驅力」(Omohundro)或「收斂的工具性目標」(Bostrom):自我保存、獲取資源、保護自己的目標不被修改、提升自己的能力。甚至還有一個半形式化的結果:Turner 等人(2021)證明,在特定假設下,許多環境(馬可夫決策過程)中的最優策略在統計上都傾向於「追求權力」,這裡的權力指的是「保留更多未來選項」。自我保存,以及關機問題背後那股抗拒,都直接從這個邏輯裡掉出來。

權力追求之所以重要,是因為它是從「單純的目標失準」通往「大規模喪失人類掌控」、最壞情況下通往「AI 接管」的橋樑。誠實的但書很重要:那個形式化結果談的是特定假設下的「最優智能體」,而訓練出的模型並非最優,可能不會這樣表現;這個論證能多強地轉移到真實系統上,存在真正的爭論;而且並非每個目標、每種訓練設定或每個能力層級都會誘發權力追求。它是一個值得認真看待的嚴肅論證,而非一個保證。

一個只被要求「最大化公司利潤」的智能體,會有工具性的理由去取得更多算力、複製自己作為備份、並避免被關掉,這些都不是被要求的,卻全都有助於它被賦予的目標。

權力幾乎有助於任何目標,所以許多目標都會獎勵去追求它。

工具性收斂與權力追求是關於理想化、最優智能體的論證。它們在多大程度上適用於實際訓練出的模型仍有爭論;應把它們當成審慎的理由,而非今日系統已被證實的屬性。

又称
resource acquisition追求權力資源獲取