基於人類回饋的強化學習
偏好比較(preference comparison)
問一個人「用一到十分,這個答案有多好?」,你會得到前後不一、會漂移的數字——這個評分者的七分,是另一個人的四分。但問「這兩個答案哪個比較好,A 還是 B?」,人們又快又一致得驚人。偏好比較就是這麼單純的動作:拿兩個候選行為給人看,記下他偏好哪一個。它正是 RLHF 賴以堆砌而成的原子。
每次比較產出一個小小的事實:在某個情境下,輸出 A 被選為勝過輸出 B。這些二元判斷比絕對分數更容易給得可靠,也省去了在許多不同人之間校準數值刻度的麻煩。接著訓練一個獎勵模型,讓被偏好的項目拿到較高的純量分數,於是一堆「A 勝過 B」的事實,就被悄悄轉成一個平滑、可查詢的獎勵函數。
比較並非毫無麻煩。人會偏好錯的東西——更長、更自信、或更討好的答案——彼此之間也會分歧;超過兩個項目的排名很快就變得不可靠。但作為回饋的基本單位,相對判斷正是基於偏好學習的主力,原因恰恰在於它只向人類索取他們真正擅長的東西。
又称
另见