回報、價值與策略
動作價值函數(Q 函數,action-value function)
狀態價值函數替處境打分,動作價值函數則替選擇打分。它回答一個對做決策更有用的問題:如果我此刻在狀態 s,並立即採取動作 a,之後再遵循我的策略,我能預期多少回報?藉著替每個可選動作評分,它直接告訴你哪一步看起來最好,而你不必自己去想像下一個狀態長什麼樣。
它寫作 Q-pi(s, a),常直接稱為 Q 函數。它和狀態價值函數的關係很簡單:一個狀態的價值,就是它的動作價值在你的策略會挑選的那些動作上取平均。Q 是許多強化學習方法的主力,因為一旦你有了準確的動作價值,就能靠一條極簡單的規則行動得很好——在每個狀態挑 Q 最大的那個動作。
Q^\pi(s,a)=\mathbb{E}_\pi\!\left[G_t \mid S_t=s,\,A_t=a\right]
在狀態 s 採取動作 a、之後遵循策略的價值。
又稱
另見