回報、價值與策略

狀態價值函數(state-value function)

站在某個處境裡,你也許會問:如果我繼續照平常的方式行動,從這裡開始事情會發展得多好?狀態價值函數正是回答這個問題。對某個給定策略而言,它替每個狀態指定一個數字:你從那個狀態出發、之後一直遵循該策略,所能預期收到的回報。好的狀態——接近目標、充滿機會——價值高;壞的狀態——靠近懸崖、選擇稀少——價值低。

它寫作 V-pi(s),讀作「在策略 pi 下狀態 s 的價值」。注意價值取決於策略:一個狀態有多好,要看你從它出發會怎麼做。同一個棋盤,對高手是贏棋,對弱手卻是輸棋。狀態價值函數把「這看起來有希望」那種模糊感覺,化成一個精確的期望數字,而這正是讓演算法能比較處境、進而學習的關鍵。

V^\pi(s)=\mathbb{E}_\pi\!\left[G_t \mid S_t=s\right]

狀態的價值,是「從該狀態出發並遵循策略」這個條件下,回報的期望值。

又稱
V-functionV^π