離線強化學習

行為策略(behavior policy)

你的資料集是某個人、或某個東西產生的。行為策略就是產出紀錄中那些動作的規則:可能是人類操作員、舊有的控制器、先前的強化學習智能體,甚至是隨機策略。你不一定明確知道它是什麼,你只看得到它採取過的動作。

在離線強化學習裡,行為策略界定了資料分布,因而也界定了你能信任的範圍。許多方法會去估計它(通常用行為克隆),好衡量候選策略偏離了多遠,或刻意貼著它走。

它的品質定下一道軟性的下限與一道硬性的上限:接近隨機的行為策略給你廣但淺的覆蓋,接近專家的則給你窄但深的覆蓋。無論如何,你只能對它真正試過的動作放心地學習。

\pi_\beta(a\mid s)

產生資料集中每一筆轉移的(常常未知的)行為策略 π_β。

又稱
data-collecting policylogging policy