怎麼認出「適合強化學習」的問題
在走訪應用之前,先學會辨認它的輪廓。一個問題適合強化學習,是當三件事同時成立:決策是隨時間一個接一個做出的(序列決策)、每個決策會影響接下來發生什麼,而且存在一個清楚的結果好壞概念、可以用獎勵打分,給代理人一個瞄準的目標——真正的目標導向行為。如果你的問題只是一個獨立的決策、又有已知的正確答案,那你大概該用普通的監督式學習就好。
強化學習的各種應用全都共享這個輪廓。我們逐一走過幾個重要的。
遊戲:試金石
遊戲是強化學習最早登上頭條的勝利,原因不難看出:模擬便宜、獎勵明快(輸/贏、分數),而且明顯是回合式的。強化學習代理人能直接從畫面像素學會玩經典的街機遊戲,而AlphaGo更把學習與規劃結合,擊敗了世界頂尖的圍棋棋手——這個分水嶺時刻,讓許多人相信強化學習能攻克那些一向被認為需要人類直覺的問題。
交互式搜索树,展开博弈走法中最有希望的分支。
機器人與控制:在物理世界裡行動
機器人學是強化學習的天然家園:機器人字面上就是一個在環境中採取行動、以達成目標的代理人。強化學習已經教會機器人走路、抓取與操作物體,以及在踉蹌之後重新站穩。同樣的邏輯也延伸到根本沒有機器人的控制問題——調度資料中心的冷卻、管理電網、安排交通號誌——任何「系統做出一連串、效果隨時間展開的決策」之處,往往就是永不重設的持續性任務。
交互式网格世界,Q学习智能体朝目标格移动。
物理世界帶來一個棘手的皺褶:真實的試誤既慢、又貴,有時還不安全。因此大量機器人強化學習會先在模擬中訓練,再遷移到實體硬體上——這個主題後面的軌道會深入探討。
聊天機器人:你正在用的語言模型裡的強化學習
對新手來說有個意外:現代 AI 助理那種樂於助人、有禮貌的語氣,正是被強化學習形塑出來的。大型語言模型(large language model)學會預測文字之後,會再用基於人類回饋的強化學習(reinforcement learning from human feedback, RLHF)加以精修:人們替「兩個回答中比較喜歡哪一個」評分,這些評分變成獎勵訊號,模型再被調整成「產生能賺更多獎勵的回答」。這裡的『環境』是對話、『動作』是生成的文字,而獎勵反映了人類的偏好。
流程图:人类偏好比较训练奖励模型,再微调语言模型的策略。
什麼時候別動用強化學習
誠實很重要。強化學習很強大,但常常是工具箱裡最難的那一個,而且它並不總是對的選擇。當有更簡單的方法夠用時就略過它,尤其在以下情況:
- 如果每個決策彼此獨立、而且你已經有標好的正確答案,就用監督式學習——它更簡單也更可靠。
- 如果你握有世界的完美模型、只需要最佳計畫,古典的規劃或最佳化可能勝過學習。
- 如果試誤的代價太高或不安全、又無法模擬,那麼強化學習所倚賴的探索可能根本行不通。
- 如果你無法定義一個有意義的獎勵,強化學習就沒有可瞄準的目標——先把目標弄清楚。
监督学习循环示意图:数据到模型到预测到损失再到更新。
這就是整個「強化學習是什麼」軌道。你現在已經懂得核心概念、迴圈及其三個訊號、為什麼長期與延遲的獎勵讓學習變難、強化學習與監督式學習和規劃的分別,以及它真正發揮價值的地方。從這裡開始,本領域會潛入數學——但前方的每一條公式,都只是你此刻已握有的某個直覺的精確版本。