隨機控制、濾波與數理財務

漢密爾頓-雅可比-貝爾曼方程(Hamilton-Jacobi-Bellman equation)

/ HAM-il-tun ya-KOH-bee BEL-man /

漢密爾頓-雅可比-貝爾曼(HJB)方程是動態規劃原理的微分形式:它是隨機最佳控制問題的價值函數必須滿足的偏微分方程。動態規劃原理把一個區間上的價值與該區間末的價值相連,HJB 則把那個區間縮到零,讀出一個關於時間與狀態的逐點方程。它把「對策略的最佳化」(一個無窮維物件)轉成偏微分方程(一個原則上可解或可離散化的局部條件),是連續時間控制的核心計算工具。

對受控擴散 dX = b(X,u) dt + sigma(X,u) dB、運行成本 f、終端成本 g,價值函數 V(t,x) 對 t < T 滿足 HJB 方程 -V_t + sup_u { - L^u V - f(x,u) } = 0(極大化情形;成本極小化時把 sup 換成 inf 並相應改號),終端條件 V(T,x) = g(x)。此處 L^u 是固定控制值 u 下擴散的生成元:L^u V = b(x,u) . grad_x V + (1/2) trace( sigma sigma^T(x,u) Hess_x V )。推導是直接的:對 V(t, X_t) 套用伊藤公式、取期望(鞅部分消失)、再施加動態規劃原理——所得無窮小漂移對 u 取的上/下確界必須沿最佳路徑為零。最佳回饋控制即 sup/inf 內的極大/極小者,a(t,x) = argmax_u { -L^u V(t,x) - f(x,u) },由 V 的梯度與海森矩陣逐點讀出。

HJB 是機率通往非線性偏微分方程的橋樑:它是二階、完全非線性的方程(非線性源於對 u 的 sup),其解又回饋去定義最佳策略。一個誠實而重要的提醒:HJB 的古典(二次可微)解往往不存在——價值函數可能僅是連續的、帶有折角。正確的一般概念是黏性解(Crandall-Lions),在此意義下 V 是帶給定邊界資料的 HJB 之唯一解,即使它不可微。所以一般而言「V 解 HJB」是在黏性意義下成立;古典解(與乾淨的驗證定理)只在正則性下可得,通常是一致橢圓(非退化 sigma sigma^T)加光滑係數。當擴散缺席(確定性控制)時 HJB 退化為一階漢密爾頓-雅可比方程,其震波正是黏性解被發明出來的原因。

再看默頓問題:把冪效用試解 V(t,w) = h(t) w^(1-gamma)/(1-gamma) 代入 HJB。對股票比例 pi 取的 sup 是 pi 的一個簡單二次式,在 pi* = (mu - r)/(gamma sigma^2) 處達極大。代回後留下關於 h(t) 的常微分方程,可封閉求解。HJB 把一個控制問題化為「對一個二次式求導,再解一條 ODE」。

用試解法解 HJB:對控制取的 sup 化為逐點極大化,留下關於時間因子的常微分方程。

HJB 的古典解經常不存在;價值函數是其唯一的黏性解。光滑解需要非退化(一致橢圓)與正則性——唯有此時驗證定理才能直接套用。

又稱
HJBHJB equationBellman equation (continuous time)HJB 方程貝爾曼方程