強化學習理論
逆向強化學習(inverse reinforcement learning, IRL)
逆向強化學習把常見的設定反轉過來。你不是被給定報酬去找策略,而是觀察專家的行為,試圖回復一個「能讓該行為成為最優」的報酬函數。當目標難以寫下卻容易示範時——例如平順又禮讓的駕駛——它是最自然的工具。
這個問題本質上是病態的(ill-posed),因為許多報酬函數都能解釋同一種行為,連全為零的平凡報酬也算。經典的化解之道在於加上結構:最大間隔(max-margin)法要求存在一個報酬,使專家以一個間隔勝過其他選項;特徵期望匹配要求學習者的折扣特徵與專家相符;而最大熵 IRL 則在符合該匹配的前提下,挑選最不武斷的報酬,以熵先驗化解退化。對抗式模仿法如 GAIL 與 AIRL 則繞過顯式回復,用判別器去匹配佔有分布。
即便做到最好,報酬也只能辨識到差一個諸如位勢塑形(potential-based shaping)與尺度的歧義,這正是為何顯式的先驗或正則項不可或缺。
IRL 只能回復到差一個位勢塑形與正尺度的報酬;少了先驗,全零報酬就能平凡地解釋每一段示範。
又称
另见