JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

強化學習出現在哪裡:遊戲、機器人與聊天機器人

走訪真實的強化學習應用、學會辨認「適合強化學習」的問題,並誠實談談什麼時候別用它。

怎麼認出「適合強化學習」的問題

在走訪應用之前,先學會辨認它的輪廓。一個問題適合強化學習,是當三件事同時成立:決策是隨時間一個接一個做出的序列決策)、每個決策會影響接下來發生什麼,而且存在一個清楚的結果好壞概念、可以用獎勵打分,給代理人一個瞄準的目標——真正的目標導向行為。如果你的問題只是一個獨立的決策、又有已知的正確答案,那你大概該用普通的監督式學習就好。

強化學習的各種應用全都共享這個輪廓。我們逐一走過幾個重要的。

遊戲:試金石

遊戲是強化學習最早登上頭條的勝利,原因不難看出:模擬便宜、獎勵明快(輸/贏、分數),而且明顯是回合式的。強化學習代理人能直接從畫面像素學會玩經典的街機遊戲,而AlphaGo更把學習與規劃結合,擊敗了世界頂尖的圍棋棋手——這個分水嶺時刻,讓許多人相信強化學習能攻克那些一向被認為需要人類直覺的問題。

蒙特卡洛树搜索探索最有希望的走法序列——正是这类博弈让强化学习首次登上头条。

交互式搜索树,展开博弈走法中最有希望的分支。

機器人與控制:在物理世界裡行動

機器人學是強化學習的天然家園:機器人字面上就是一個在環境中採取行動、以達成目標的代理人。強化學習已經教會機器人走路、抓取與操作物體,以及在踉蹌之後重新站穩。同樣的邏輯也延伸到根本沒有機器人的控制問題——調度資料中心的冷卻、管理電網、安排交通號誌——任何「系統做出一連串、效果隨時間展開的決策」之處,往往就是永不重設的持續性任務

在这个网格世界里,智能体通过动作抵达目标——正是机器人学习在环境中导航的形态。

交互式网格世界,Q学习智能体朝目标格移动。

物理世界帶來一個棘手的皺褶:真實的試誤既慢、又貴,有時還不安全。因此大量機器人強化學習會先在模擬中訓練,再遷移到實體硬體上——這個主題後面的軌道會深入探討。

聊天機器人:你正在用的語言模型裡的強化學習

對新手來說有個意外:現代 AI 助理那種樂於助人、有禮貌的語氣,正是被強化學習形塑出來的。大型語言模型(large language model)學會預測文字之後,會再用基於人類回饋的強化學習(reinforcement learning from human feedback, RLHF)加以精修:人們替「兩個回答中比較喜歡哪一個」評分,這些評分變成獎勵訊號,模型再被調整成「產生能賺更多獎勵的回答」。這裡的『環境』是對話、『動作』是生成的文字,而獎勵反映了人類的偏好。

RLHF 把人类偏好变成奖励模型来调整聊天机器人的策略——这就是隐藏在语言模型里的强化学习。

流程图:人类偏好比较训练奖励模型,再微调语言模型的策略。

什麼時候別動用強化學習

誠實很重要。強化學習很強大,但常常是工具箱裡最難的那一個,而且它並不總是對的選擇。當有更簡單的方法夠用時就略過它,尤其在以下情況:

  1. 如果每個決策彼此獨立、而且你已經有標好的正確答案,就用監督式學習——它更簡單也更可靠。
  2. 如果你握有世界的完美模型、只需要最佳計畫,古典的規劃或最佳化可能勝過學習。
  3. 如果試誤的代價太高或不安全、又無法模擬,那麼強化學習所倚賴的探索可能根本行不通。
  4. 如果你無法定義一個有意義的獎勵,強化學習就沒有可瞄準的目標——先把目標弄清楚。
如果各个决策彼此独立、而且你已经有带标签的答案,就该选用监督学习的循环,而不是强化学习。

监督学习循环示意图:数据到模型到预测到损失再到更新。

這就是整個「強化學習是什麼」軌道。你現在已經懂得核心概念、迴圈及其三個訊號、為什麼長期與延遲的獎勵讓學習變難、強化學習與監督式學習和規劃的分別,以及它真正發揮價值的地方。從這裡開始,本領域會潛入數學——但前方的每一條公式,都只是你此刻已握有的某個直覺的精確版本。