對齊理論

價值學習(value learning)

試著把你在乎的每一件事都寫下來,你很快就會放棄。人類價值浩瀚、依情境而定、充滿說不出口的例外,有時還自相矛盾。我們知道不該靠掀桌來贏一盤棋、不該靠把東西扔出窗外來打掃房間,而這些規則從來沒有人明說過。價值學習這項工程,就是要讓 AI 從資料、行為與回饋中「學會」我們所珍視的東西,而不是被交給一本我們其實寫不出來的、明確而完整的規則手冊。

精確地說,價值學習涵蓋了一系列「推斷目標而非設定目標」的途徑。逆向強化學習試圖從觀察到的人類行為中推斷出底層的獎勵。從偏好與回饋中學習(如 RLHF),則從比較與評分中推斷我們想要什麼。合作式逆向強化學習把智能體設定成對真正的目標抱持真實的不確定,並有動機向人類學習它,而這份不確定恰好也讓智能體更願意被糾正。微觀圖像是:與其寫死「不要打破花瓶」,不如展示一些例子,讓系統推斷出背後的偏好。

價值學習之所以重要,是因為它瞄準了外部對齊最難的部分,也就是真正去「設定人類價值」。這裡的誠實無可迴避,因為這是一片爭議極深的領域。人類價值在不同人之間衝突、也隨時間改變;我們常常不理性、做出違背自己所宣稱價值的事,所以行為並不乾淨地揭露價值;而且還有「該學誰的價值」這類開放問題,以及「人們實際做什麼」與「人們應該做什麼」之間那道古老的實然與應然鴻溝。學會預測人類行為,並不等於學會人類價值。

與其寫死「不要撞倒花瓶」這條規則,不如讓一個智能體觀察小心的人類,推斷出他們珍視花瓶的完好,於是它繞道避開花瓶,目標是學來的,而非言明的。

推斷行為背後的偏好,而不是條列規則。

學習人類行為不等於學習人類價值:人會不理性地行動、會違背自己所宣稱的偏好,而且對於 AI 該採納誰的價值,並沒有公認的答案。

又称
learning human valuespreference inference人類價值學習