JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

強化學習出現在哪裡:遊戲、機器人與聊天機器人

走訪真實的強化學習應用、學會辨認「適合強化學習」的問題,並誠實談談什麼時候別用它。

怎麼認出「適合強化學習」的問題

在走訪應用之前,先學會辨認它的輪廓。一個問題適合強化學習,是當三件事同時成立:決策是隨時間一個接一個做出的序列決策)、每個決策會影響接下來發生什麼,而且存在一個清楚的結果好壞概念、可以用獎勵打分,給代理人一個瞄準的目標——真正的目標導向行為。如果你的問題只是一個獨立的決策、又有已知的正確答案,那你大概該用普通的監督式學習就好。

強化學習的各種應用全都共享這個輪廓。我們逐一走過幾個重要的。

遊戲:試金石

遊戲是強化學習最早登上頭條的勝利,原因不難看出:模擬便宜、獎勵明快(輸/贏、分數),而且明顯是回合式的。強化學習代理人能直接從畫面像素學會玩經典的街機遊戲,而AlphaGo更把學習與規劃結合,擊敗了世界頂尖的圍棋棋手——這個分水嶺時刻,讓許多人相信強化學習能攻克那些一向被認為需要人類直覺的問題。

蒙地卡羅樹搜尋探索最有希望的著法序列——正是這類博弈讓強化學習首次登上頭條。

互動式搜尋樹,展開博弈著法中最有希望的分支。

機器人與控制:在物理世界裡行動

機器人學是強化學習的天然家園:機器人字面上就是一個在環境中採取行動、以達成目標的代理人。強化學習已經教會機器人走路、抓取與操作物體,以及在踉蹌之後重新站穩。同樣的邏輯也延伸到根本沒有機器人的控制問題——調度資料中心的冷卻、管理電網、安排交通號誌——任何「系統做出一連串、效果隨時間展開的決策」之處,往往就是永不重設的持續性任務

在這個網格世界裡,智慧體透過動作抵達目標——正是機器人學習在環境中導航的形態。

互動式網格世界,Q學習智慧體朝目標格移動。

物理世界帶來一個棘手的皺褶:真實的試誤既慢、又貴,有時還不安全。因此大量機器人強化學習會先在模擬中訓練,再遷移到實體硬體上——這個主題後面的軌道會深入探討。

聊天機器人:你正在用的語言模型裡的強化學習

對新手來說有個意外:現代 AI 助理那種樂於助人、有禮貌的語氣,正是被強化學習形塑出來的。大型語言模型(large language model)學會預測文字之後,會再用基於人類回饋的強化學習(reinforcement learning from human feedback, RLHF)加以精修:人們替「兩個回答中比較喜歡哪一個」評分,這些評分變成獎勵訊號,模型再被調整成「產生能賺更多獎勵的回答」。這裡的『環境』是對話、『動作』是生成的文字,而獎勵反映了人類的偏好。

RLHF 把人類偏好變成獎勵模型來調整聊天機器人的策略——這就是隱藏在語言模型裡的強化學習。

流程圖:人類偏好比較訓練獎勵模型,再微調語言模型的策略。

什麼時候別動用強化學習

誠實很重要。強化學習很強大,但常常是工具箱裡最難的那一個,而且它並不總是對的選擇。當有更簡單的方法夠用時就略過它,尤其在以下情況:

  1. 如果每個決策彼此獨立、而且你已經有標好的正確答案,就用監督式學習——它更簡單也更可靠。
  2. 如果你握有世界的完美模型、只需要最佳計畫,古典的規劃或最佳化可能勝過學習。
  3. 如果試誤的代價太高或不安全、又無法模擬,那麼強化學習所倚賴的探索可能根本行不通。
  4. 如果你無法定義一個有意義的獎勵,強化學習就沒有可瞄準的目標——先把目標弄清楚。
如果各個決策彼此獨立、而且你已經有帶標籤的答案,就該選用監督式學習的迴圈,而不是強化學習。

監督式學習迴圈示意圖:資料到模型到預測到損失再到更新。

這就是整個「強化學習是什麼」軌道。你現在已經懂得核心概念、迴圈及其三個訊號、為什麼長期與延遲的獎勵讓學習變難、強化學習與監督式學習和規劃的分別,以及它真正發揮價值的地方。從這裡開始,本領域會潛入數學——但前方的每一條公式,都只是你此刻已握有的某個直覺的精確版本。