大型語言模型工程
拒絕取樣微調(rejection sampling fine-tuning)
用 PPO 做 RLHF 很強,但操作很重:它把生成、獎勵評分、與在策略更新交織進一個難以穩定的精巧迴圈。拒絕取樣微調是那個鈍而穩健的替代方案。從當前模型對每個提示取樣許多候選回應,用獎勵模型把它們全部評分,每個提示只留下最好的那一個(或少數幾個),然後就平實地對這些贏家做監督式微調。你讓獎勵模型負責過濾,讓普通的交叉熵負責學習。
它最好被理解成 best-of-N 蒸餾。生成 N 個樣本並選出最高分者,正是 best-of-N 推論,而後者可靠地勝過單一樣本;拒絕取樣微調接著把這份增益折回權重裡,使日後的單一樣本漂向 best-of-N 本會產出的東西。這套程序可以反覆——取樣、過濾、微調、再來一遍——每一輪都把策略往上輕推,卻從不必跑強化學習的最佳化器。
它的優點是穩定與簡單:它重用 SFT 的機制、平行化毫不費力、避開了 PPO 的調參頭痛,這也是為什麼它出現在多個主要模型配方中的一個階段。它的極限是:品質受限於取樣所能碰巧撞見的、以及獎勵模型所能辨認的;每個提示生成 N 個候選很昂貴;而天真地只在頂尖樣本上訓練,可能悄悄縮減模型的多樣性。
\hat{y} = \arg\max_{i\in\{1,\dots,N\}} r_\phi(x, y_i),\quad y_i \sim \pi_\theta(\cdot\mid x);\ \text{then SFT on }(x,\hat{y})
把 N 個樣本中獎勵最高者當作新的監督目標,然後對它微調。
拒絕取樣微調是離策略且受獎勵模型上限所限:它只能放大模型本來就偶爾會產出的好行為,永遠無法發明它從不取樣到的行為。
又称
另见