一種你早就熟悉的學習
想想看小孩怎麼學騎腳踏車、你怎麼把一款電玩玩得很厲害,或一隻狗怎麼學會新把戲。沒有人會遞給你一本規則書、告訴你每個當下的正確答案。你是去試試看、觀察會發生什麼,然後慢慢地多做有效的、少做沒用的。這個簡單的迴圈——行動、觀察結果、調整——就是強化學習(reinforcement learning, RL)的全部核心。
這跟「被告知答案」不一樣。在強化學習裡,沒有一位老師在旁邊小聲說「這裡的正確動作是 X」。只有「事情結果有多好或多壞」的回饋——其餘的要靠學習者自己摸索出來。我們把這稱為試誤學習(trial-and-error learning),它是動物與人類最古老、最自然的學習方式。
兩個角色:代理人與環境
每個強化學習的故事都剛好有兩個角色。代理人(agent)是學習者與決策者——玩家、狗、機器人、程式。環境(environment)則是代理人互動的一切——遊戲世界、房間、道路、聊天機器人另一端的使用者。代理人行動,環境則回應並回報。
把這兩者分開,是進入強化學習的第一個思考動作。凡是代理人能決定的,就在代理人之內;凡是代理人不能直接控制、只能透過行動去影響的,就是環境。把這條界線畫清楚,往後我們才能精確地推理。
一张循环图:智能体方块与环境方块之间互相传递动作、状态和奖励的箭头。
獎勵:一個說「更好」或「更壞」的數字
代理人怎麼知道什麼「有效」?透過獎勵訊號(reward signal)——代理人行動後,環境回傳的一個數字。吃到食物:+1。撞到牆:-1。贏得遊戲:+100。代理人唯一的任務,就是隨著時間盡可能累積更多獎勵。強化學習所做的一切,都是為了這一個目標。
獎勵定義了代理人「為何而存在」。由此浮現的行為,我們稱為目標導向行為(goal-directed behaviour):沒有人告訴代理人如何達成目標,只告訴它目標值多少,它便自己學出一條路。事實上,這個領域最大膽的主張之一——獎勵假說(reward hypothesis)——宣稱:我們在乎的任何目標,都能表達成「最大化期望累積獎勵」。這個主張我們會在本軌道稍後仔細檢視。
目标的一行总结:最大化随时间累积的总奖励,而不只是下一个数字。
把它合成一個迴圈
把這些拼起來,就得到代理人與環境互動迴圈(agent–environment interaction loop)——一個不斷反覆運轉的引擎:代理人看一眼當下的處境、選一個動作、環境隨之改變並回傳一份獎勵,然後再來一輪。所謂學習,無非就是隨著經驗把這個迴圈做得越來越好。
- 代理人觀察當下的處境。
- 它選擇一個動作。
- 環境轉移到新的處境,並回傳一份獎勵。
- 代理人用這份回饋讓下一次做得更好一點——然後重複。
一个交互式网格世界:智能体在格子间移动,随着从奖励中学习而更新数值。
接下來要去哪
在本軌道接下來的篇章,我們會放慢腳步,依序看清迴圈的每個零件,理解為什麼遲來的獎勵會讓學習變難,把強化學習和你可能接觸過的其他機器學習方式做對比,並走訪強化學習真正在改變世界的場景。先不談方程式——只給你清晰的圖像,讓你帶著它走進後面更技術性的軌道。
一张并排比较监督学习、无监督学习和强化学习的示意图。