大型語言模型工程
KTO(Kahneman–Tversky 最佳化)
多數對齊方法需要偏好配對:對同一個提示,給出一個被選中的答案與一個被拒絕的答案。這種資料昂貴且常常不自然,因為真實回饋通常是以孤立判斷的形式抵達——這個輸出好、那個輸出壞——而非成對的比較。KTO 完全拿掉了配對的要求:它在各自只帶一個二元標籤(合意或不合意)的個別輸出上訓練,而這正是你能從讚與倒讚的紀錄裡廉價收割到的那種訊號。
它的目標函數借用了 Kahneman 與 Tversky 展望理論裡人類價值的形狀。KTO 不去最大化偏好機率,而是衡量每個輸出相對於一個參考點(大致是模型的平均行為)所隱含的獎勵,再把它送進一個「對收益凹、對損失凸」、內建損失趨避的價值函數。合意範例被往上推、不合意的被往下壓,但是不對稱的,於是模型因壞輸出而受的懲罰,重於它因好輸出而得的獎賞,呼應了人們實際衡量風險的方式。
實務上,KTO 在相當規模下追平甚至勝過像 DPO 這類配對方法,卻能靠遠為雜亂、也遠為豐沛的資料維生,並且容忍正負範例之間的不平衡。代價是多了兩個掌管損失趨避不對稱的超參數,以及一個依賴:展望理論的框架得真的是你想讓系統去重視的東西的好模型。
KTO 不需配對是它的招牌優勢,但它仍需要一個參考模型來定義價值函數的錨點,就和 DPO 一樣。
又稱
另見