驗證定理(verification theorem)
驗證定理閉合了動態規劃的邏輯迴圈。HJB 方程是必要條件:若價值函數光滑,則它解 HJB。但要真正解一個控制問題,你通常反向操作——猜出或算出 HJB 方程的一個光滑解 W,由它導出候選回饋控制,接著你需要證明 W 確實是價值函數、且候選控制確實最佳。驗證定理正是那個逆命題:它給出充分條件,使 HJB 的光滑解連同其內部的極大化者一起證明最佳性。
陳述的精神如下。設 W(t,x) 是充分光滑(C^{1,2})的函數,滿足 HJB 方程與正確的終端條件 W(T,x) = g(x),並設 a(t,x) 是在每一點達到 HJB 中 sup/inf 的可測控制。則:(1)對任何容許控制 u,把伊藤公式套用於 W(t, X_t) 可證 W(t,x) <= J(t,x; u)(W 是每種策略成本的下界——這裡用到 HJB 的不等式形式 -V_t - L^u V - f <= 0 對所有 u 成立,使 W(s, X_s) 加累積成本成為次鞅);(2)對候選控制 a,同一計算取等號,故 W(t,x) = J(t,x; a)。兩者合起來迫使 W = V(價值函數)且 a = 最佳控制。證明是乾淨的伊藤加鞅論證;核心在於 W(t, X_t) 在任何控制下的漂移非正、在最佳控制下為零。
驗證定理使整套 HJB 綱領嚴格而非啟發式:它是把「滿足方程的函數」轉成「答案」的證書。一個誠實的提醒、也是它自成一條定理的原因:它假設存在光滑(C^{1,2})解,加上可積性/橫截條件,以確保伊藤所生的局部鞅是真正的鞅(使其期望為零——這裡若是真局部鞅就會破壞該界)。當價值函數不光滑時(常見情形),古典驗證定理不適用,須改用黏性解工具或為自由邊界量身打造的光滑接合驗證。所以一次成功的驗證也是事後證明了價值函數恰好光滑。
在 LQG 調節器中你猜 W(t,x) = x^T P(t) x,P(t) 為對稱矩陣。代入 HJB 並對控制取 sup 得最佳線性回饋 u* = -R^{-1} B^T P x,並把 HJB 化簡為 P(t) 的矩陣黎卡提常微分方程。驗證定理隨即確認:x^T P(t) x 就是價值函數、u* 就是最佳控制——因為來自黎卡提方程的 P 使驗證不等式沿 u* 取等號。
驗證的實際運作:一個二次試解解出 HJB,定理證明它確實最佳。
驗證假設 HJB 有光滑的 C^{1,2} 解,加上保證伊藤局部鞅為真鞅的可積性。當價值函數不光滑時(典型情形),古典驗證失效,須用黏性解或光滑接合論證。