SARSA
/ SAR-suh /
SARSA 是 Q學習更為謹慎的孿生兄弟。它倆幾乎共享一切——都記著一本 Q 值的筆記本、都把它們朝「當下獎勵加上日後價值」挪近——但有一處意味深長的不同:SARSA 更新一個 Q 值時,用的是它接下來「實際」採取的那個動作,連同任何探索性的失誤,而非它「本可以」採取的最佳動作。它學的是自己「真實」行為的價值,連同其中的瑕疵。
這個名字不過是一次更新所需的五樣東西,按順序排開:State(狀態)、Action(動作)、Reward(獎勵)、next State(下一狀態)、next Action(下一動作)——S、A、R、S、A。第二個「A」才是關鍵所在。正因為 SARSA 是從它自己真實的下一步去學習,它被稱為「同策略」:它改進的,正是它當下所遵循的那個會探索的策略,而非某個它根本沒在用的、理想化的貪心策略。
這在臨近危險處會帶來真切的實際差別。想像一條懸崖邊的路。Q學習假定自己將永遠最優地行動,於是學會貼著崖邊走以求最短路徑——可一個仍在探索的智能體若貼著邊走,偶爾就會隨機地一步踏空。SARSA 把這些偶爾的隨機踏步也算了進去,於是學會與懸崖保持更安全的餘地。兩者並非簡單的孰優孰劣:Q學習為一個完美無瑕的未來行動者找到最優路徑,而 SARSA 則為一個「自知偶爾會失足」的智能體找到更明智的路徑。
經典的「懸崖行走」網格:一排懸崖格子給予重罰。Q學習學出貼著崖邊走的那條大膽路徑(只要你永不失足,它就是最優)。SARSA 仍在用 ε-貪心探索,便學出後退一排的更安全路徑——因為它把那種偶爾會把自己送下崖去的隨機失步也算了進來。
同一座迷宮,兩種心態:Q學習為完美行動者謀劃;SARSA 為一個仍在探索、仍會失足者謀劃。
SARSA 與 Q學習之間那唯一的差別——「實際的下一動作」對「最佳的下一動作」——正是「同策略」與「離策略」的教科書式例證。SARSA 在危險附近那種更安全、更保守的表現並非缺陷;它是「學習你真正在執行的那個策略的價值」所帶來的誠實後果。