前沿與開放問題

RL 的縮放法則(scaling laws for RL)

在語言建模裡,縮放法則把進展變成了一道配方:當你擴大模型大小、資料與算力時,損失會沿著一條平滑、可預測的冪次律下降,於是你能事先規劃能力。RL 的縮放法則(scaling laws for RL)問的是:決策是否服從同一種乾淨的曲線——當你投入更多參數、更多環境互動與更多算力時,智能體的表現會不會可預測地進步?

這幅圖景比監督式學習裡的更混亂。RL 多了語言建模沒有的旋鈕——探索、環境互動的量與多樣性、平行行動者的數量,以及演算法的選擇——而且訊號是一個充滿雜訊、非平穩的獎勵,而非乾淨的損失。儘管如此,研究者在一些地方仍找到相當規律的趨勢:離線 RL 與序列模型智能體裡的模型與資料縮放,以及大型自我對弈與遊戲系統裡「算力對表現」的曲線。

把 RL 的縮放法則弄對會帶來變革,讓實驗室能預測「多少算力與互動」能買到一個目標技能,而不必用猜的。但開放的問題很嚴肅:哪一個軸(資料、模型、探索)會先成為瓶頸、曲線會斷裂還是停滯,以及當一個智能體自己生成經驗時,要如何定義「資料」這個軸。它直接連結到更廣的神經縮放法則研究,以及 RL 的基礎模型。

\mathcal{L}(C)\;\approx\;\mathcal{L}_{\infty}+\Big(\tfrac{C_0}{C}\Big)^{\alpha}

縮放法則:與下限之間的表現差距,隨算力 C(以及模型大小與資料)的冪次而縮小。