一個非凸卻仍乖巧的目標
策略梯度定理(policy gradient theorem) 給出期望回報對策略參數的無偏梯度,於是你可以做梯度上升。但期望回報對那些參數是非凸(nonconvex)的,而標準最佳化理論只保證收斂到駐點(stationary point),不保證全域最優。多年來人們並不清楚 REINFORCE 這類方法究竟能否被信任去找到最佳策略。
策略梯度定理給出期望回報的無偏梯度,即使 J 非凸也可沿其做梯度上升。
策略梯度為何能抵達全域最優
策略梯度收斂 理論建立在一個梯度支配(Polyak–Łojasiewicz 型)不等式上:一個策略的次優程度被它的梯度大小所界定,所以「梯度很小」會逼出接近最優,而不是允許一塊糟糕的平坦區。策略改善定理(policy improvement theorem) 提供了底層那種單調改善的直覺。陷阱在於分布失配(distribution mismatch)項:收斂速度取決於你所造訪的狀態,對最優策略所需狀態的覆蓋程度有多好——探索又從後門偷偷溜了回來。
可互動的小球沿彎曲損失曲面滾向最小值。
用費雪資訊(Fisher information)對梯度做預條件處理,就得到 自然策略梯度(natural policy gradient),它的收斂明顯更快、且對參數化的選擇遠不敏感——這正是 TRPO、PPO 這類信賴域(trust-region)方法在實務上如此穩健的理論核心。
平均獎勵設定
折扣是一種建模上的方便;許多真實系統——排隊、庫存、持續性控制——真正在意的是長期吞吐量。平均獎勵準則(average-reward criterion) 在極限下最佳化每一步的平均回報,完全不用 γ。它的理論把折扣型貝爾曼方程換成一個平均獎勵版本,內含一個增益(gain)與一個偏差函數(bias function),而那些 1/(1−γ) 因子則被 MDP 的混合時間或直徑取代。策略梯度與遺憾值的結果都有平均獎勵版本,只是技術上更難,也經常是開放問題的來源。
可互動的馬可夫鏈,含狀態、轉移箭頭與趨於平穩的分布。
組裝一個 PAC 保證
一個完整的 PAC-RL 結果,就是本軌道各個零件疊起來的成品。你用 集中不等式 界定每一步的模型或價值誤差;用 模擬引理 與 近似誤差界 把該誤差推進到策略價值上;用樂觀與像 貝爾曼秩 這樣的結構度量控制探索;再用 策略梯度收斂 為最佳化步驟背書。乘起來就是一個明確的 樣本複雜度:以 1−δ 的機率,這麼多樣本即可得到一個 ε-最優的策略。
由本軌道各部分拼裝出的 PAC-RL 保證:以至少 1−δ 的機率,回傳的策略與最優相差不超過 ε,所需樣本量是問題參數的多項式。
- 估計:用集中不等式界定模型/價值的統計誤差。
- 傳播:把該誤差轉換為策略次優程度(模擬引理+視界)。
- 探索:用樂觀覆蓋所需狀態,付出取決於結構的代價。
- 最佳化:用收斂的更新把策略推進到與最優相差 ε 之內。
哪些問題仍然開放
理論至今仍落後於實務。我們對深度非線性函數近似仍缺乏緊的 樣本複雜度 界;一般策略梯度與平均獎勵設定的 極小極大下界 仍部分開放;離線強化學習、多智能體均衡,以及在豐富觀測下的探索,都存在「能做到的」與「能證明的」之間的落差。最健康的態度是誠實:理論告訴你哪些假設能買到哪些保證,而這張地圖——而非單一的宏大定理——才是讓你在投入算力之前,就能判斷一個強化學習方法會不會奏效的依據。