JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

邁向通用智慧體:強化學習的基礎模型與規模化

強化學習能否複製讓語言模型變得通用的那套配方——先在一切資料上預訓練,再專門化?基礎模型、通用智慧體、規模法則,以及永遠出不完題目的世界。

語言模型的配方,以及 RL 為何抗拒它

基礎模型(foundation model)會在龐大、多樣的語料上一次性預訓練,再適應到無數任務。這套配方讓語言變得通用。RL 的基礎模型(foundation models for RL)夢想的是同一件事:在海量行為上預訓練單一智慧體,使任何新的控制任務都只是快速適應,而非從頭訓練。障礙則是 RL 特有的:沒有現成的互動資料網路;行為綁定在特定的身體與動作空間上;而獎勵又是任務專屬的,不像文本的下一個字元目標那樣通用。

把每个状态、动作和回报都变成一个词元:控制问题于是化为一段序列,模型可以用预测下一个词元的方式来预训练。

词元化流程:原始输入先转为词元 id,再变成嵌入向量。

把 RL 當成序列建模

決策變換器(Decision Transformer)把這件事具體化了:把軌跡當成一串(待領回報、狀態、動作)符元餵給一個變換器,再用普通的監督式學習訓練它預測下一個動作。測試時你一個期望回報為條件,讓它自迴歸地生成相符的動作——這就是以回報為條件的策略(return-conditioned policies)。沒有貝爾曼回填,也沒有自助;困難的信用分配被攤提進一個大型序列模型裡。正是這個視角,讓 RL 得以接上基礎模型那套規模、預訓練與遷移的工具箱。

决策 Transformer 会对整条轨迹做注意力——点击一个词元,看看哪些过去的状态与回报在塑造下一个动作。

交互式自注意力:选中一个词元会高亮它所关注的其他词元。

把它和第二篇的無監督 RL 階段配在一起,一個輪廓就浮現了:一段漫長、無獎勵或由歷史紀錄驅動的預訓練階段建立廣泛能力,再用一層薄薄、任務專屬的部分把它專門化。這正是基礎模型的範本,移植到了動作上。

通用智慧體——一個網路,多個世界

通用智慧體(generalist agent)把這個夢想推到極致:用同一套權重去玩 Atari、為影像加標題、用真實手臂疊積木、還能聊天——靠情境切換任務,而非重新訓練。把每種模態都符元化成同一串序列,使這件事在原則上可行。通用智慧體距離人類的廣度仍很遠,也常以單任務的巔峰表現換取涵蓋面,但它們是最清楚的存在性證明:基礎模型典範能跨進具身、做決策的領域。

規模法則對 RL 成立嗎?

對語言而言,平滑的規模法則(scaling laws)讓你能從模型大小、資料與算力預測損失——而正是這種可預測性,讓巨額押注變得安全。同樣乾淨的法則是否支配 RL,是個真正開放的問題。回報更吵雜、又受任務上限所限;資料分佈會隨策略變強而偏移;探索還可能造成陡峭、非冪律的跳躍。早期證據顯示,在受控設定下(例如固定資料、看模型大小對表現)的確會出現某些冪律趨勢,但 RL 多了幾條沒有語言模型對應物的座標軸——環境多樣性、回放比例、更新對資料比例。

平滑的扩展定律:在对数-对数坐标下,损失随模型规模、数据与算力可预测地下降——这种可预测性正是强化学习仍在争取的。

损失对规模的对数-对数图,呈现一条直线状的幂律趋势。

開放式學習——偽裝成資料問題的問題

如果 RL 稀缺的資源是多樣的互動,那真正的瓶頸就是環境,而不是智慧體。開放式學習(open-ended learning)正面迎擊這點:打造能持續生成又新又更難的挑戰、永不停歇的系統,讓智慧體永遠不會飽和。最豐富的版本是共同演化的課程——環境與智慧體互相推著對方往前,很像自我對弈(self-play)為 AlphaZero 生出源源不絕的對手。如此一來,泛化便不是來自單一固定資料集,而是來自一個永不重複自己的題目產生器。這把通往通用智慧體的路,重新框定為一個環境設計問題。