基礎——什麼是 AI 安全與為何重要

正交性論題(the orthogonality thesis)

/ or-thog-uh-NAL-uh-tee /

在日常生活裡,我們會不知不覺在兩件事之間滑動:聰明,和良善。我們隱約期待一個傑出的頭腦也會既睿智又仁慈。正交性論題說:對 AI,我們不該作這種假設。粗略地講,一個系統有多聰明,與它追求什麼目標,是兩條獨立的軸(「正交」意思是彼此成直角,就像一張紙的寬與高是分開的兩件事)。一個系統可以極有能力,卻瞄準幾乎任何目標,包括我們會覺得毫無意義或有害的目標。

「幾乎」這個字很重要,謙遜的措辭也一樣重要。這個論題並不是在主張「每一種智能程度都能持有字面上的每一個目標」,也不是說聰明的系統「傾向」會有古怪的目標。它是一個較窄的主張:並不存在一條自動法則,逼迫高能力必然與「對人類友善的價值」綁在一起。經典的例子是一個假想的超智慧,它唯一的目標就是製造迴紋針:擅長規劃、學習與推理這件事本身,並不會讓它停下來重新考慮「最大化迴紋針」是不是一個值得想要的目標。智能是引擎;目標是方向盤,而引擎並不會挑選目的地。

這個論題是許多安全論證背後一個承重的前提,因為它擋掉了一個令人安心的想法:一個夠先進的 AI 自然會自己想通「正確的價值」。如果能力和目標是脫鉤的,那我們就必須刻意地裝入良善的目標;它們不會免費送上門。值得指出的是,這個論題是關於「可能性」的哲學論證,而非對真實系統的量測;批評者指出,受訓的模型是透過一個非常特定的過程獲得目標的,這在實務上可能讓能力與行為產生相關。儘管如此,作為「別假設聰明等於安全」的一記警告,它被廣泛接受。

一個世界級的西洋棋引擎在棋盤之內聰明得令人屏息,但它整個「目標」就只是贏棋;在那裡的高超本領,完全推不出它在意人類福祉。正交性把這一點推廣:本領與目標是分開設定的,所以我們無法從一個系統有多有能力,去讀出它的價值。

在某個領域的本領,說明不了一個系統持有哪些目標。

正交性談的是「什麼是可能的」,而不是「什麼是可能會發生的」。它並不預測先進的 AI 會有異於人類的目標;它只是否認「它們會有良善目標」這項保證,這正是為什麼我們不能指望由智能免費提供價值。

又稱
orthogonality正交性假說