離線強化學習
行為克隆基線(behavior cloning baseline, BC)
在動用任何巧妙的離線演算法之前,先試最笨的辦法:直接照抄資料。行為克隆把紀錄當成一份「狀態對動作」的監督式資料集,訓練一個策略去模仿它,完全不管獎勵。
它就是純粹的監督式學習——把資料集中「給定狀態、其動作」的負對數似然最小化。沒有貝爾曼回填、沒有價值函數、沒有處理分布偏移的那些花招。作為基線,它告訴你某個離線強化學習方法究竟有沒有真的榨出比單純模仿更多的價值。
當資料來自接近專家的來源時,它意外地難以被超越。但它無法勝過行為策略,無法把不同軌跡的好片段縫接起來,而且一旦偏離資料,就會立刻繼承模仿學習那種誤差層層累積的毛病。
又稱
另見