模仿學習與逆向強化學習
逆向強化學習(inverse reinforcement learning)
逆向強化學習把一般的強化學習整個倒過來。正常的強化學習拿到一個獎勵函數,去搜尋最佳行為;逆向強化學習則拿到行為——也就是專家示範——去搜尋一個能使該行為成為最佳解的獎勵函數。它不是複製專家「做什麼」,而是試著還原他們「為什麼這麼做」:驅動其選擇的那個隱藏目標。
好處在於獎勵比複製來的策略可移植得多。一旦推斷出專家的目標,你就能拿標準強化學習去最佳化它,即使在示範從未涵蓋的狀態或動力學下也能表現良好,或把這目標轉移到新的機器人身體上,或與規劃結合。經典的表述會去尋找一個獎勵,使專家的期望回報至少不低於任何其他策略。
深層的困難是「不適定」:無數個獎勵函數都能解釋同一批示範,包括讓所有策略都最佳的那個無聊的全零獎勵。因此實用的逆向強化學習需要額外假設——特徵匹配、最大熵先驗,或一場對抗賽局——來挑出一個合理的獎勵。
\text{find } r \text{ s.t. } \mathbb{E}\Big[\textstyle\sum_t \gamma^t r(s_t)\,\big|\,\pi^{*}\Big] \ge \mathbb{E}\Big[\textstyle\sum_t \gamma^t r(s_t)\,\big|\,\pi\Big]\ \forall \pi
尋找一個獎勵,使專家的期望回報不劣於任何其他策略。
又称
另见