超越人類,卻又奇怪地脆弱
到目前為止,你已經看過 強化學習(RL)做出許多驚人的事:精通圍棋、控制核融合電漿、駕駛平流層氣球。所以當你發現同一個智慧體在這些勝利之後,常常只要世界稍微一變就失靈——換個牆面顏色、把獎勵重新縮放、或換到它從未訓練過的關卡——會覺得很突兀。RL 的前沿,重點其實不在發明更聰明的損失函數,而在於彌合狹隘精通與廣泛勝任之間的落差。
圖示:智能體向環境發送動作,並接收獎勵與下一個狀態。
鴻溝一——泛化
RL 中的泛化(generalization)問的是:在某些狀態、關卡或環境上訓練出的策略,到了沒見過的情況還能不能正常運作。這比監督式學習的泛化困難得多,因為在 RL 裡,智慧體自己的動作決定了它會看到哪些資料。一回合早期的小小策略誤差,會把它導向從未練習過的狀態,誤差於是層層放大。更糟的是,智慧體很擅長捷徑學習:它會緊抓住某個剛好能預測獎勵的背景紋理或畫面計數器,而這根拐杖一遇到 分佈偏移(distribution shift)就會碎裂。
- 在固定的一組關卡上訓練,再用保留的另一組評估——這是能夠衡量 RL 泛化的標準作法(程序化生成的基準讓這件事成為可能)。
- 要看訓練與測試之間的差距,而不只是訓練曲線:訓練拿 9/10、新關卡只拿 2/10,那是過擬合,不是技能。
- 探查策略到底抓住了什麼線索——遮住背景、改變顏色、加入干擾物——把捷徑揪出來。
互動式網格世界,智能體透過 Q-learning 學習抵達目標。
鴻溝二——樣本效率
樣本效率前沿(sample-efficiency frontier)是第二道牆。著名的遊戲智慧體吃掉了相當於數千年的遊玩經驗,而人類只要幾分鐘就能在 Atari 上拿到像樣的分數。這在遊戲之外更重要:在機器人、金融或醫療裡,你負擔不起數百萬次有風險的嘗試,所以經驗的成本才是真正的瓶頸。深層原因是,RL 必須透過探索去發掘自己的訓練訊號,而獎勵可能稀疏又延遲——智慧體常常要動作很久,才會有任何回饋告訴它那個選擇好不好。
Q-learning 更新每一步只把價值調整 α 倍的 TD 誤差——這正是為什麼學到一個好策略可能需要數百萬次互動。
規模化不是已經解決其他一切了嗎?
苦澀的教訓(the bitter lesson)——也就是「搭配更多算力的通用方法,終究會打敗手工雕琢的小聰明」——是整條軌的精神背景。它在語言上奏效得非常壯觀。但在 RL 裡,規模化更為混沌:我們沒有網路規模、源源不絕的互動資料,目標還因為智慧體自己的策略不斷改變資料而呈現非平穩,而乾淨的 RL 規模法則(scaling laws for RL)至今仍在描繪當中。更多算力的確有幫助,但它不會像「更多文本之於語言模型」那樣,自動換來泛化。
對數-對數圖,顯示損失隨模型規模增大而下降。
如何閱讀本軌其餘部分
接下來每一篇都從不同角度進攻這兩道鴻溝。第二篇讓知識在任務間重複利用(元、遷移、持續與無監督 RL)。第三篇追問 RL 能否借用基礎模型的配方,在開放式世界裡擴展成通用智慧體。第四篇轉向我們優化的是什麼——獎勵設定、安全、約束、風險。第五篇則以因果收尾,並誠實勾勒出仍未解決的部分。請依序閱讀;它們合起來是一條完整的論證。