JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

強化學習為何還沒迎來它的 GPT 時刻

強化學習智慧體能擊敗世界冠軍,卻可能在稍微換個顏色的迷宮裡跌倒。來認識定義整個前沿的兩道頑固鴻溝——泛化與樣本效率。

超越人類,卻又奇怪地脆弱

到目前為止,你已經看過 強化學習(RL)做出許多驚人的事:精通圍棋、控制核融合電漿、駕駛平流層氣球。所以當你發現同一個智慧體在這些勝利之後,常常只要世界稍微一變就失靈——換個牆面顏色、把獎勵重新縮放、或換到它從未訓練過的關卡——會覺得很突兀。RL 的前沿,重點其實不在發明更聰明的損失函數,而在於彌合狹隘精通廣泛勝任之間的落差。

强化学习系统的核心循环:智能体行动、获得奖励、观察下一状态、不断重复——同一套机制既能精通围棋,也要把一个任务重放上亿次。

图示:智能体向环境发送动作,并接收奖励与下一个状态。

鴻溝一——泛化

RL 中的泛化(generalization)問的是:在某些狀態、關卡或環境上訓練出的策略,到了沒見過的情況還能不能正常運作。這比監督式學習的泛化困難得多,因為在 RL 裡,智慧體自己的動作決定了它會看到哪些資料。一回合早期的小小策略誤差,會把它導向從未練習過的狀態,誤差於是層層放大。更糟的是,智慧體很擅長捷徑學習:它會緊抓住某個剛好能預測獎勵的背景紋理或畫面計數器,而這根拐杖一遇到 分佈偏移(distribution shift)就會碎裂。

  1. 在固定的一組關卡上訓練,再用保留的另一組評估——這是能夠衡量 RL 泛化的標準作法(程序化生成的基準讓這件事成為可能)。
  2. 要看訓練與測試之間的差距,而不只是訓練曲線:訓練拿 9/10、新關卡只拿 2/10,那是過擬合,不是技能。
  3. 探查策略到底抓住了什麼線索——遮住背景、改變顏色、加入干擾物——把捷徑揪出來。
在此网格世界训练 Q-learning 智能体,再想象把它稍稍重新上色——看似已经学会的策略,正是无法泛化到未见关卡的那一个。

交互式网格世界,智能体通过 Q-learning 学习到达目标。

鴻溝二——樣本效率

樣本效率前沿(sample-efficiency frontier)是第二道牆。著名的遊戲智慧體吃掉了相當於數千年的遊玩經驗,而人類只要幾分鐘就能在 Atari 上拿到像樣的分數。這在遊戲之外更重要:在機器人、金融或醫療裡,你負擔不起數百萬次有風險的嘗試,所以經驗的成本才是真正的瓶頸。深層原因是,RL 必須透過探索發掘自己的訓練訊號,而獎勵可能稀疏又延遲——智慧體常常要動作很久,才會有任何回饋告訴它那個選擇好不好。

Q(s,a) \leftarrow Q(s,a) + \alpha\left[\, r + \gamma \max_{a'} Q(s',a') - Q(s,a) \,\right]

Q-learning 更新每一步只把价值调整 α 倍的 TD 误差——这正是为什么学到一个好策略可能需要数百万次交互。

規模化不是已經解決其他一切了嗎?

苦澀的教訓(the bitter lesson)——也就是「搭配更多算力的通用方法,終究會打敗手工雕琢的小聰明」——是整條軌的精神背景。它在語言上奏效得非常壯觀。但在 RL 裡,規模化更為混沌:我們沒有網路規模、源源不絕的互動資料,目標還因為智慧體自己的策略不斷改變資料而呈現非平穩,而乾淨的 RL 規模法則(scaling laws for RL)至今仍在描繪當中。更多算力的確有幫助,但它不會像「更多文本之於語言模型」那樣,自動換來泛化。

缩放定律:随着算力与数据增长,损失平滑下降——这正是“惨痛教训”所依赖、而强化学习不断检验的前提。

对数-对数图,显示损失随模型规模增大而下降。

如何閱讀本軌其餘部分

接下來每一篇都從不同角度進攻這兩道鴻溝。第二篇讓知識在任務間重複利用(元、遷移、持續與無監督 RL)。第三篇追問 RL 能否借用基礎模型的配方,在開放式世界裡擴展成通用智慧體第四篇轉向我們優化的是什麼——獎勵設定、安全、約束、風險。第五篇則以因果收尾,並誠實勾勒出仍未解決的部分。請依序閱讀;它們合起來是一條完整的論證。