基於模型的強化學習
Dyna 架構(Dyna architecture)
Dyna 是同時兼得兩個世界的經典配方:一邊從真實經驗學習,一邊從想像的經驗學習。每當智能體走出一步真實的步伐,它會做三件事——用這次真實的轉移更新自己的價值估計、用它更新自己對世界的模型,接著利用餘暇「做夢」,從模型產生假的轉移,也從這些假經驗中學習。
Sutton 最初的 Dyna-Q 就是把普通的 Q 學習包進這個迴圈裡。每次真正互動之後,它跑幾個規劃步驟,每一步挑一個先前見過的狀態—動作對,問模型該期待什麼獎勵與下一狀態,再套用和對待真實經驗一模一樣的 Q 學習更新。模型與價值函數一起進步,而規劃更新傳播資訊的速度,遠快過只等待真實步伐。
Dyna 的美在於它的簡單,以及它清晰的訊息:規劃、行動、模型學習,其實是同一種價值更新,只是由不同來源的經驗餵養。它的弱點則承襲自它的模型——重放一個已經過時、與現實脫節的模型所產生的轉移,會教給智能體一些不再成立的事。
\text{real step} \to \underbrace{Q\text{-update}}_{\text{learn}} + \underbrace{\text{model update}}_{\text{fit}} + \underbrace{n\times Q\text{-update from model}}_{\text{plan}}
Dyna 中每一步真實互動,都觸發一次直接更新,外加從模型抽取的 n 次規劃更新。
又称
另见