隨機控制、濾波與數理財務

隨機最佳控制與價值函數(stochastic optimal control and the value function)

隨機最佳控制是「駕馭隨機系統使其平均表現盡可能好」的理論。你有一個可透過控制 u_t 影響的狀態 X_t——u_t 是你根據所觀察到的訊息即時選擇的決策——其動態為受控 SDE,dX_t = b(X_t, u_t) dt + sigma(X_t, u_t) dB_t。沿途你付出運行成本 f(X_t, u_t),終點付出終端成本 g(X_T),你希望透過選擇控制策略使期望總成本 J(t,x; u) = E[ integral_t^T f(X_s, u_s) ds + g(X_T) given X_t = x ] 達到極小。這是從自動駕駛、投資組合選擇到存貨管理背後的引擎——任何在雜訊下反覆行動以最佳化長期目標的場景。

核心物件是價值函數 V(t,x) = inf_u J(t,x; u),即在時刻 t 從狀態 x 出發、若自此最佳地行動所能達到的最佳期望成本。它是狀態與時間的函數,而非任何特定控制的函數:它已把決策最佳化掉了。有兩個結構性事實讓它可用。其一,容許控制必須是適應的——只能依賴過去而非未來——且我們通常尋求回饋(馬可夫)控制 u_t = a(t, X_t),即讀取當前狀態並回傳行動的規則。其二,V 滿足動態規劃原理,它說 [t,T] 上的價值可由「在一小步上最佳化、再在該步末用 V」來計算;對此原理求導即得 V 的漢密爾頓-雅可比-貝爾曼偏微分方程。

價值函數是連接通往解的兩大途徑的關鍵:動態規劃途徑(HJB 方程,一個非線性二階偏微分方程,加上一個確認候選為最佳的驗證定理)與龐特里亞金途徑(隨機極大原理與倒向隨機微分方程,透過伴隨/共態過程刻劃最佳控制)。一個誠實的提醒:古典上假設 V 夠光滑以代入 HJB,但一般而言 V 只是連續的,HJB 方程須以黏性解的意義來理解;光滑性(因而乾淨的驗證定理)在非退化(sigma sigma^T 一致橢圓)與係數正則的條件下成立,並非總是如此。此外,定義 V 的極小化必須真的能由某容許控制達到,最佳策略才存在——存在性是帶假設的定理,並非自動成立。

默頓投資組合問題:投資人把財富 W_t 分配於風險資產(幾何布朗運動)與債券,選擇投入股票的比例 pi_t 以最大化終端財富的期望效用 E[ U(W_T) ]。控制是 pi_t,狀態是 W_t,價值函數 V(t,w) = sup_pi E[ U(W_T) given W_t = w ] 解一個 HJB 方程。對冪效用而言,最佳比例是常數的默頓比率 pi* = (mu - r)/(gamma sigma^2)——超額報酬除以變異數、再以風險趨避度縮放。

默頓問題:價值函數把「該冒多少險」化為一個有常數最佳配置的乾淨偏微分方程。

價值函數一般只是連續、未必光滑——故 HJB 常須以黏性解理解。古典光滑性需要非退化(一致橢圓),而那正是驗證定理能直接套用的前提。

又称
stochastic controlcontrolled diffusionvalue function隨機控制受控擴散價值函數