模仿學習與逆向強化學習
特徵期望匹配(feature expectation matching)
特徵期望匹配是以特徵為基礎的逆向強化學習內部的引擎。先挑一個描述每個狀態的特徵向量,接著用「特徵期望」來概括任一策略——也就是該策略行動過程中平均累積的這些特徵之折扣總和。專家的示範給你一個目標向量;目標就是找到一個策略,使它自身的特徵期望向量正好落在那上面。
它之所以有效,靠的是一段漂亮的代數:若獎勵對特徵呈線性,那麼一個策略的回報就是獎勵權重與其特徵期望的內積。匹配了特徵期望,你就在每一種線性獎勵下都匹配了回報——於是你表現得和專家一樣好,卻完全不需要知道他們真正在最佳化哪個獎勵。
實務上你會最小化兩個特徵期望向量之間的距離,常見做法是反覆在當前獎勵猜測下求解一個強化學習問題,再把權重朝專家較常用到的特徵方向微調。它正是學徒學習與最大熵逆向強化學習所共享的具體最佳化目標。
\mu(\pi)=\mathbb{E}\Big[\textstyle\sum_{t}\gamma^{t}\,\phi(s_t)\,\big|\,\pi\Big],\quad \text{match } \mu(\pi)\approx \mu(\pi^{*})
特徵期望 μ(π);目標是讓學習者的特徵期望與專家的相符。
又称
另见