模仿學習與逆向強化學習
學徒學習(apprenticeship learning)
學徒學習是運用逆向強化學習做控制的一種早期且深具影響力的方法。它不堅持要找出唯一正確的獎勵,而是假設獎勵是狀態若干已知特徵的加權和——與障礙物的距離、速度、車道位置等——並追求一個比較謙遜的目標:產生一個策略,使其在任何這類獎勵下都表現得和專家一樣好,即使從未確定那組確切的權重。
關鍵量是特徵期望:沿一條軌跡累積的每個特徵的折扣平均值。關鍵觀察是:特徵期望相同的兩個策略,在每一種線性獎勵下都獲得相同的回報。於是演算法在「猜獎勵權重、求解隨之而來的強化學習問題、再調整」之間反覆迭代,直到學習者的特徵期望與專家的相符——此時可證明其表現與專家相當接近。
它的優點是儘管存在獎勵歧義,仍對行為提供保證;它的限制則是依賴手工挑選的特徵,且要求獎勵對這些特徵呈線性。
又称
另见