一筆偏好紀錄長什麼樣
在設計蒐集流程之前,先想像資料集裡的一列。一筆比較包含:一個情境、針對該情境的兩個回應,以及一個標籤說明人類選了哪個回應。這就是人類偏好資料(human preference data)的整個原子單位。
{
"context": "Summarize: <article text>",
"response_a": "<summary A>",
"response_b": "<summary B>",
"preferred": "a" // the human picked A over B
}對控制任務而言,這兩個回應會變成兩段軌跡片段(trajectory clips)——比方說兩段機器人伸手拿杯子的短影片——評分者挑出比較接近目標的那段。形狀完全一樣,只是媒介變了。
設計蒐集流程
好的偏好資料集蒐集(preference dataset collection),重點多半在你展示哪些成對樣本。隨機配對會把評分者的時間浪費在勝負分明的對比上;最有資訊量的成對樣本,是目前模型真正拿不定主意的勢均力敵之局。許多團隊會從模型抽出好幾個回應,請評分者去比較其中最模稜兩可的那些——這是一種輕量的主動學習。
- 固定情境:一組有代表性、你真正在意的提示或起始狀態。
- 產生候選:對每個情境,從目前策略抽出兩個以上的回應。
- 配對並呈現:一次給評分者看兩個,最好是品質相近的。
- 記錄贏家——並可選擇提供「平手」或「兩個都差」的逃生選項,免得評分者被迫做出虛假的選擇。
RLHF 流程示意图,人类偏好收集是第一步,输入奖励模型,再到策略。
誰來標註,以及如何維持乾淨
偏好標註(preference annotation)的品質,為下游一切設下天花板。評分者需要一份書面準則,說明對這個任務而言「比較好」是什麼意思——更準確?更安全?更精簡?——否則他們各自心裡的定義會發散。評分者之間的歧異是資訊,而非單純的雜訊:高歧異的成對樣本往往揭露出指令含糊,或一個真正困難的取捨。
因為評分者是處於迴路中的人類,要留意常見的危害:位置偏誤(總是選第一個選項)、長度偏誤(看起來越長越像越完整)以及疲勞。隨機決定哪個回應被標為「A」、抽查一部分標籤,並把評分者間的一致度當作健康檢查指標來量測。
當 AI 來當評判
人類比較既貴又慢。一個強而有力的替代方案,是用一個受書面原則集引導的 AI 評判,取代部分人類評判——也就是憲法式回饋(constitutional feedback),這正是憲法式 AI(Constitutional AI)背後的想法。模型依照一部明確的「憲法」(要有幫助、要拒絕有害請求等)去批評並排序回應,藉此大規模產生比較。
當標籤來自模型而非人時,這個技術叫做 RLAIF——基於 AI 回饋的強化學習。它用一點點保真度換取大量的吞吐量;實務上團隊會把兩者混用:用稀少的人類比較錨定真正重要的東西,用大量的 AI 比較填補其餘。
大语言模型推理、行动、观察的循环示意图,此处用于评判回答。