隨機控制、濾波與數理財務

隨機極大原理(stochastic maximum principle)

/ PON-tree-AH-gin /

隨機極大原理是通往隨機控制問題的第二條大路,與動態規劃平行且對偶。動態規劃要求整個狀態空間上的價值函數(一個多變數的偏微分方程),極大原理則只沿單一最佳軌跡而行,並透過一個額外的伴隨(共態)過程沿途逐點刻劃最佳控制。它是龐特里亞金確定性極大原理的隨機推廣,當狀態空間高維(此時解 HJB 偏微分方程無望)或雜訊以破壞動態規劃馬可夫假設的方式依賴控制時,它是自然的語言。

其建構引入一個漢密爾頓量與一個伴隨過程。對 dX = b(X,u) dt + sigma(X,u) dB、成本 integral f + g,定義漢密爾頓量 H(x,u,p,q) = b(x,u) . p + trace( sigma(x,u)^T q ) + f(x,u)。一階伴隨過程 (p_t, q_t) 解一個倒向隨機微分方程(BSDE),自終端條件 p_T = grad g(X_T) 倒向運行:dp_t = - grad_x H(X_t, u_t, p_t, q_t) dt + q_t dB_t。關鍵的額外未知量是 q_t——它因「p_t 須適應、儘管其終端條件給在時刻 T」這個要求而被迫存在,恰是鞅表示的被積函數。原理隨即陳述:沿最佳控制 u*,漢密爾頓量逐點被極小化(成本極小化情形),u*_t = argmin_u H(X_t, u, p_t, q_t),對幾乎每個 t 幾乎必然成立。對凸問題此必要條件也是充分的。

極大原理之所以重要,在於它能在 HJB 失效之處擴展、自然處理一般(非馬可夫、隨機係數)問題、並揭示深刻的對偶性:當 V 光滑時,伴隨 p_t 恰是價值函數的梯度,p_t = grad_x V(t, X_t),故兩種方法是同一答案的兩個面貌。一個誠實的提醒:二階項——q_t 過程,以及在一般(漢密爾頓量非凸、擴散依賴控制)情形下還有第二個伴隨過程與一個二階修正項——是不可或缺的,正是它使隨機極大原理確實比確定性的更難;丟掉它就得到錯誤條件。此外,該原理給的是最佳性的必要條件;充分性需要凸性(例如 H 對 (x,u) 凸且 g 凸),而最佳控制的存在則是另一個問題。

對 LQG 問題伴隨過程變為線性:在二次成本下,p_t 結果為 p_t = P(t) X_t,P(t) 即黎卡提矩陣,而漢密爾頓量極小化步驟 grad_u H = 0 給出 R u + B^T p = 0,即 u* = -R^{-1} B^T P X——正是 HJB/黎卡提途徑所得的同一線性回饋。兩法一致,且 p_t = grad_x V 使對偶性顯露無遺。

在 LQG 中伴隨過程為 P(t)X_t,極大原理重現黎卡提回饋——兩條路徑交會。

該原理是必要條件,未必自動充分——充分性需要凸性。而二階(q_t,及一般情形下的第二個伴隨)項不可或缺;省略它會給出錯誤的最佳性條件,這正是隨機原理有別於確定性原理之處。

又称
Pontryagin stochastic maximum principleSMPadjoint method龐特里亞金隨機極大原理伴隨方法