JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

邊做邊學:強化學習是什麼

強化學習背後的日常直覺——試試看、觀察結果,然後多做有效的事。

一種你早就熟悉的學習

想想看小孩怎麼學騎腳踏車、你怎麼把一款電玩玩得很厲害,或一隻狗怎麼學會新把戲。沒有人會遞給你一本規則書、告訴你每個當下的正確答案。你是去試試看觀察會發生什麼,然後慢慢地多做有效的、少做沒用的。這個簡單的迴圈——行動、觀察結果、調整——就是強化學習(reinforcement learning, RL)的全部核心。

這跟「被告知答案」不一樣。在強化學習裡,沒有一位老師在旁邊小聲說「這裡的正確動作是 X」。只有「事情結果有多好或多壞」的回饋——其餘的要靠學習者自己摸索出來。我們把這稱為試誤學習(trial-and-error learning),它是動物與人類最古老、最自然的學習方式。

兩個角色:代理人與環境

每個強化學習的故事都剛好有兩個角色。代理人(agent)是學習者與決策者——玩家、狗、機器人、程式。環境(environment)則是代理人互動的一切——遊戲世界、房間、道路、聊天機器人另一端的使用者。代理人行動,環境則回應並回報。

把這兩者分開,是進入強化學習的第一個思考動作。凡是代理人能決定的,就在代理人之內;凡是代理人不能直接控制、只能透過行動去影響的,就是環境。把這條界線畫清楚,往後我們才能精確地推理。

強化學習的兩個角色:智能體採取行動,環境則以新的情境和獎勵作出回應。

一張循環圖:智能體方塊與環境方塊之間互相傳遞動作、狀態與獎勵的箭頭。

獎勵:一個說「更好」或「更壞」的數字

代理人怎麼知道什麼「有效」?透過獎勵訊號(reward signal)——代理人行動後,環境回傳的一個數字。吃到食物:+1。撞到牆:-1。贏得遊戲:+100。代理人唯一的任務,就是隨著時間盡可能累積更多獎勵。強化學習所做的一切,都是為了這一個目標。

獎勵定義了代理人「為何而存在」。由此浮現的行為,我們稱為目標導向行為(goal-directed behaviour):沒有人告訴代理人如何達成目標,只告訴它目標值多少,它便自己學出一條路。事實上,這個領域最大膽的主張之一——獎勵假說(reward hypothesis)——宣稱:我們在乎的任何目標,都能表達成「最大化期望累積獎勵」。這個主張我們會在本軌道稍後仔細檢視。

G_t = R_{t+1} + R_{t+2} + \cdots + R_T

目標的一行總結:最大化隨時間累積的總獎勵,而不只是下一個數字。

把它合成一個迴圈

把這些拼起來,就得到代理人與環境互動迴圈(agent–environment interaction loop)——一個不斷反覆運轉的引擎:代理人看一眼當下的處境、選一個動作、環境隨之改變並回傳一份獎勵,然後再來一輪。所謂學習,無非就是隨著經驗把這個迴圈做得越來越好。

  1. 代理人觀察當下的處境。
  2. 它選擇一個動作。
  3. 環境轉移到新的處境,並回傳一份獎勵。
  4. 代理人用這份回饋讓下一次做得更好一點——然後重複。
動手試試:智能體透過反覆試錯學習網格世界,多走那些能獲得獎勵的步子。

一個互動式網格世界:智能體在格子間移動,隨著從獎勵中學習而更新數值。

接下來要去哪

在本軌道接下來的篇章,我們會放慢腳步,依序看清迴圈的每個零件,理解為什麼遲來的獎勵會讓學習變難,把強化學習和你可能接觸過的其他機器學習方式做對比,並走訪強化學習真正在改變世界的場景。先不談方程式——只給你清晰的圖像,讓你帶著它走進後面更技術性的軌道。

強化學習的位置:與監督式學習、非監督式學習並列,作為第三種學習方式。

一張並排比較監督式學習、非監督式學習與強化學習的示意圖。