強化學習是什麼

強化學習與規劃(RL vs planning)

強化學習和規劃(planning)都想選出好的動作,但出發點不同。規劃假設你已經握有一個世界的模型——狀態與獎勵如何變化的規則——並透過預先推演算出一個好計畫,就像走迷宮前先在紙上把它解開。強化學習則是從真實經驗中學習,往往完全沒有模型,靠著在世界裡行動來摸索出什麼有效。

兩者在中間地帶會變得模糊。基於模型的強化學習(model-based RL)會從經驗中學出一個模型,再在模型裡做規劃;像蒙地卡羅樹搜尋這類經典規劃方法,也能用學到的價值來引導,AlphaGo 就是如此。誠實的對比是:規劃需要一個已知或學到的模型,代價是運算量;從經驗學習不需要模型,代價是嘗試、犯錯,以及必須蒐集的資料。