階層式強化學習與選項
選項–評論家架構(option-critic architecture)
多年來,選項要嘛得手工設計,要嘛得靠另外、常常笨重的程序去發現。選項–評論家架構彌合了這道縫隙:它直接從任務獎勵出發,用梯度端到端地學會一個選項所含的一切——不靠子目標、不靠輔助獎勵,只有一個目標。你指定想要幾個選項,演算法就推算出每個該做什麼、又該何時停下。
它的做法,是把策略梯度的想法延伸到選項的內部。兩條定理給出期望報酬對「每個選項內部策略的參數」與「其終止函數」的梯度。一個評論家估計選項價值以提供所需的優勢,而演員的部分——選項內策略與終止機率——則據此被往上或往下推。一次訓練整疊,意味著選項會自我塑形,去配合任何真正有助於最大化獎勵的拆解。
它的長處是概念上的乾淨,以及無須人為扶持就能學會時間抽象的能力。被充分記錄的弱點是選項塌縮:在只有任務獎勵引導的情況下,學到的選項常會退化——某個選項獨大,或終止幾乎每步都觸發,於是又退回了扁平策略。馴服這點(通常靠額外的正則項或思慮成本),是使用它時主要的實務顧慮。
又称
另见