JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

蒐集偏好資料

整條流程的好壞,全看它的比較資料。如何設計成對樣本、選誰來標註,以及何時讓 AI 來評判。

一筆偏好紀錄長什麼樣

在設計蒐集流程之前,先想像資料集裡的一列。一筆比較包含:一個情境、針對該情境的兩個回應,以及一個標籤說明人類選了哪個回應。這就是人類偏好資料(human preference data)的整個原子單位。

{
  "context": "Summarize: <article text>",
  "response_a": "<summary A>",
  "response_b": "<summary B>",
  "preferred": "a"        // the human picked A over B
}
一筆比較。模型從不看到數字——只看到一對樣本中的贏家。

對控制任務而言,這兩個回應會變成兩段軌跡片段(trajectory clips)——比方說兩段機器人伸手拿杯子的短影片——評分者挑出比較接近目標的那段。形狀完全一樣,只是媒介變了。

設計蒐集流程

好的偏好資料集蒐集(preference dataset collection),重點多半在你展示哪些成對樣本。隨機配對會把評分者的時間浪費在勝負分明的對比上;最有資訊量的成對樣本,是目前模型真正拿不定主意的勢均力敵之局。許多團隊會從模型抽出好幾個回應,請評分者去比較其中最模稜兩可的那些——這是一種輕量的主動學習。

  1. 固定情境:一組有代表性、你真正在意的提示或起始狀態。
  2. 產生候選:對每個情境,從目前策略抽出兩個以上的回應。
  3. 配對並呈現:一次給評分者看兩個,最好是品質相近的。
  4. 記錄贏家——並可選擇提供「平手」或「兩個都差」的逃生選項,免得評分者被迫做出虛假的選擇。
本文所做的一切都是在搭建第一步:你收集到的成对比较,正是用来训练奖励模型、并经由它微调策略的数据。

RLHF 流程示意图,人类偏好收集是第一步,输入奖励模型,再到策略。

誰來標註,以及如何維持乾淨

偏好標註(preference annotation)的品質,為下游一切設下天花板。評分者需要一份書面準則,說明對這個任務而言「比較好」是什麼意思——更準確?更安全?更精簡?——否則他們各自心裡的定義會發散。評分者之間的歧異是資訊,而非單純的雜訊:高歧異的成對樣本往往揭露出指令含糊,或一個真正困難的取捨。

因為評分者是處於迴路中的人類,要留意常見的危害:位置偏誤(總是選第一個選項)、長度偏誤(看起來越長越像越完整)以及疲勞。隨機決定哪個回應被標為「A」、抽查一部分標籤,並把評分者間的一致度當作健康檢查指標來量測。

當 AI 來當評判

人類比較既貴又慢。一個強而有力的替代方案,是用一個受書面原則集引導的 AI 評判,取代部分人類評判——也就是憲法式回饋(constitutional feedback),這正是憲法式 AI(Constitutional AI)背後的想法。模型依照一部明確的「憲法」(要有幫助、要拒絕有害請求等)去批評並排序回應,藉此大規模產生比較。

當標籤來自模型而非人時,這個技術叫做 RLAIF——基於 AI 回饋的強化學習。它用一點點保真度換取大量的吞吐量;實務上團隊會把兩者混用:用稀少的人類比較錨定真正重要的東西,用大量的 AI 比較填補其餘。

用 AI 评审替代人工:大语言模型依据成文原则进行推理,选出更好的回答,这正是 RLAIF 的核心。

大语言模型推理、行动、观察的循环示意图,此处用于评判回答。