蒙地卡羅與時間差分學習
重要性抽樣(importance sampling,在強化學習中)
如果你的資料是由某個策略產生,但你想評估的是另一個策略,這些樣本就會偏斜:目標策略偏愛的動作在資料裡可能很罕見,反之亦然。重要性抽樣用重新加權來修正這件事。每個觀察到的回報都乘上重要性比率——目標策略走出那條軌跡的機率,除以行為策略實際走出它的機率——使得重新加權後的回報平均而言能估計目標策略的價值。
它是離策略蒙地卡羅與許多離策略演算法背後的主力修正,但它有個鋒利的邊:變異數。這個比率是逐步因子的連乘,所以在一條長軌跡上可能爆炸性地趨近零或衝向極大值,讓估計變得極度嘈雜。實務工作者用加權(而非普通的)重要性抽樣、逐決策比率、截斷或裁切,來把變異數壓在可控範圍內。
\rho_{t:T-1}=\prod_{k=t}^{T-1}\frac{\pi(a_k\mid s_k)}{b(a_k\mid s_k)}
重要性抽樣比率:目標策略對行為策略動作機率比值的連乘。
又稱
另見