JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

強化學習為何還沒迎來它的 GPT 時刻

強化學習智慧體能擊敗世界冠軍,卻可能在稍微換個顏色的迷宮裡跌倒。來認識定義整個前沿的兩道頑固鴻溝——泛化與樣本效率。

超越人類,卻又奇怪地脆弱

到目前為止,你已經看過 強化學習(RL)做出許多驚人的事:精通圍棋、控制核融合電漿、駕駛平流層氣球。所以當你發現同一個智慧體在這些勝利之後,常常只要世界稍微一變就失靈——換個牆面顏色、把獎勵重新縮放、或換到它從未訓練過的關卡——會覺得很突兀。RL 的前沿,重點其實不在發明更聰明的損失函數,而在於彌合狹隘精通廣泛勝任之間的落差。

強化學習系統的核心循環:智能體行動、獲得獎勵、觀察下一狀態、不斷重複——同一套機制既能精通圍棋,也要把一個任務重放上億次。

圖示:智能體向環境發送動作,並接收獎勵與下一個狀態。

鴻溝一——泛化

RL 中的泛化(generalization)問的是:在某些狀態、關卡或環境上訓練出的策略,到了沒見過的情況還能不能正常運作。這比監督式學習的泛化困難得多,因為在 RL 裡,智慧體自己的動作決定了它會看到哪些資料。一回合早期的小小策略誤差,會把它導向從未練習過的狀態,誤差於是層層放大。更糟的是,智慧體很擅長捷徑學習:它會緊抓住某個剛好能預測獎勵的背景紋理或畫面計數器,而這根拐杖一遇到 分佈偏移(distribution shift)就會碎裂。

  1. 在固定的一組關卡上訓練,再用保留的另一組評估——這是能夠衡量 RL 泛化的標準作法(程序化生成的基準讓這件事成為可能)。
  2. 要看訓練與測試之間的差距,而不只是訓練曲線:訓練拿 9/10、新關卡只拿 2/10,那是過擬合,不是技能。
  3. 探查策略到底抓住了什麼線索——遮住背景、改變顏色、加入干擾物——把捷徑揪出來。
在此網格世界訓練 Q-learning 智能體,再想像把它稍稍重新上色——看似已經學會的策略,正是無法泛化到未見關卡的那一個。

互動式網格世界,智能體透過 Q-learning 學習抵達目標。

鴻溝二——樣本效率

樣本效率前沿(sample-efficiency frontier)是第二道牆。著名的遊戲智慧體吃掉了相當於數千年的遊玩經驗,而人類只要幾分鐘就能在 Atari 上拿到像樣的分數。這在遊戲之外更重要:在機器人、金融或醫療裡,你負擔不起數百萬次有風險的嘗試,所以經驗的成本才是真正的瓶頸。深層原因是,RL 必須透過探索發掘自己的訓練訊號,而獎勵可能稀疏又延遲——智慧體常常要動作很久,才會有任何回饋告訴它那個選擇好不好。

Q(s,a) \leftarrow Q(s,a) + \alpha\left[\, r + \gamma \max_{a'} Q(s',a') - Q(s,a) \,\right]

Q-learning 更新每一步只把價值調整 α 倍的 TD 誤差——這正是為什麼學到一個好策略可能需要數百萬次互動。

規模化不是已經解決其他一切了嗎?

苦澀的教訓(the bitter lesson)——也就是「搭配更多算力的通用方法,終究會打敗手工雕琢的小聰明」——是整條軌的精神背景。它在語言上奏效得非常壯觀。但在 RL 裡,規模化更為混沌:我們沒有網路規模、源源不絕的互動資料,目標還因為智慧體自己的策略不斷改變資料而呈現非平穩,而乾淨的 RL 規模法則(scaling laws for RL)至今仍在描繪當中。更多算力的確有幫助,但它不會像「更多文本之於語言模型」那樣,自動換來泛化。

縮放定律:隨著算力與資料增長,損失平滑下降——這正是「慘痛教訓」所依賴、而強化學習不斷檢驗的前提。

對數-對數圖,顯示損失隨模型規模增大而下降。

如何閱讀本軌其餘部分

接下來每一篇都從不同角度進攻這兩道鴻溝。第二篇讓知識在任務間重複利用(元、遷移、持續與無監督 RL)。第三篇追問 RL 能否借用基礎模型的配方,在開放式世界裡擴展成通用智慧體第四篇轉向我們優化的是什麼——獎勵設定、安全、約束、風險。第五篇則以因果收尾,並誠實勾勒出仍未解決的部分。請依序閱讀;它們合起來是一條完整的論證。