強化學習
演員—評論家(actor-critic)
/ AK-tur KRIT-ik /
演員—評論家是本領域兩大主流家族的一樁巧妙聯姻。演員是一個策略——它決定該做什麼。評論家是一個價值函數——它評判當前情形有多好。它倆一同訓練:演員行動,評論家評估,演員再借評論家的回饋來改進。這就像一位表演者配一名教練:教練不會表演,但它那犀利而即時的評判,能讓表演者比單憑自我批評進步得快上許多。
這樁搭檔的用意,是修補策略梯度最大的弱點。樸素的策略梯度用整整一個回合那充滿雜訊的最終結果去評判每個動作——回饋來得既晚又上躥下跳。評論家則改為提供一個快速的、學來的估計,於是演員當場就能被告知「這一步在此處比預期更好」,無需苦等回合結束。這筆交易——接受評論家估計帶來的一點偏差,換取雜訊的大幅減少——通常會讓學習平滑得多。
幾乎每一個現代強化學習的主力,包括 PPO,骨子裡都是演員—評論家。誠實的告誡是,你現在有兩個學習者,必須步調一致地一起改進:若評論家的評判出錯,它會把演員帶偏;而無論哪一方跑得比另一方快,訓練都可能搖晃乃至崩塌。兩個相互作用的網路,本就比一個更難保持穩定——這是深度強化學習為何挑剔的一個反覆出現的主題。
一隻去夠杯子的機械臂:演員決定每個關節如何運動;評論家估計「這個姿態離成功有多近?」若某個動作讓評論家的估計跳升,演員當即就因此受到獎勵——無需等到杯子被抓住,才學到那個動作有幫助。
演員決斷,評論家評判。評論家那快速的回饋,馴服了策略梯度那嘈雜的、回合末才到的訊號。
演員—評論家是用方差換偏差:評論家的估計比原始回合獎勵平滑,卻可能系統性地出錯,而一個誤導人的評論家會把演員引向錯誤的方向。讓兩個網路平衡地一同改進——誰也別搶跑——正是讓它運轉起來的實踐技藝。
又稱
另見