離線強化學習

批次約束 Q 學習(batch-constrained Q-learning, BCQ)

批次約束 Q 學習正是替「外推誤差」命名的那個方法。它的想法是:只考慮那些看起來「真有可能來自資料」的動作。如果資料從沒出現過接近這個的動作,就連讓智能體去設想它都不准。

BCQ 訓練一個行為策略的生成模型,從中取樣若干候選動作,再對它們略加擾動,然後只在這個受限、落在支撐集內的動作集合上取最大值。於是貝爾曼回填永遠不會去查詢真正沒見過的動作。

它是一個里程碑,證明了離線的失敗關鍵在於「動作的支撐集」,而非演算法本身的選擇。後來的 CQL、IQL 用更簡單的方式達成類似的保護,但 BCQ 那套「限制在支撐集內」的框架,仍是整個領域概念上的主幹。

又称
BCQ