非線性偏微分方程:反應擴散、孤立子與漢米頓-雅可比

漢米頓-雅可比-貝爾曼方程(Hamilton-Jacobi-Bellman equation)

/ HAM-il-ton ya-KOH-bee BELL-man /

假設你在操控某樣東西——一枚火箭、一個投資組合、一台恆溫器——且在每一瞬間你都要選一個控制,以使前方整段旅程的成本維持在低點。當下該怎麼選,而每個選擇又會改變你之後落腳何處?理查·貝爾曼(Richard Bellman)的最佳性原理說:無論你一開始怎麼做,接下來的計畫從你落腳之處算起,本身也必須是最佳的。把這個原理化成微積分,便得到漢米頓-雅可比-貝爾曼方程,最佳控制與動態規劃的主方程。

核心對象是值函數 V(x, t):若你在時刻 t 處於狀態 x、且從那時起都最佳地行動,剩餘所能達到的最佳成本。貝爾曼原理取無窮小極限,便成為 V 的一條偏微分方程。對系統 dx/dt = f(x, a)、配運行成本 L(x, a)(其中 a 是你從集合 A 中所選的控制),HJB 方程是 -V_t + max over a in A of [ -f(x, a) . grad V - L(x, a) ] = 0,常寫成 V_t + H(x, grad V) = 0,其中 H 是對控制做最佳化所形成的哈密頓量。它是一個非線性一階偏微分方程(一個漢米頓-雅可比方程),正是因為對控制取了那個 max/min。在整個狀態空間上把 V 解出來一次,你便能處處讀出最佳控制:在每個 (x, t) 挑出達成最大值的動作 a——那就是回饋律。麻煩在於 V 一般「並不」平滑;它有尖角。所以 HJB 是在「黏性解」的意義下理解的,那正是為使這類方程適定而打造的框架。

為什麼核心?HJB 統一了最佳控制、微分對局,以及(在帶二階擴散項的隨機版本中)大半的數理金融——布萊克-修斯方程與莫頓(Merton)的投資組合問題都是 HJB 方程。它把一個困難的、對軌跡做最佳化的無窮維問題,轉換成狀態空間上一個函數的單一偏微分方程。誠實的提醒有二:值函數通常非平滑,故你確實需要黏性解來保證唯一性;而在高維中求解 HJB 受「維度詛咒」之苦(成本隨狀態變數個數指數成長),這正是為什麼近似與基於學習的方法在實務上如此重要。

要在加速度受限 |a| <= 1 的條件下、以最短時間把一台小車停在原點,HJB 方程說值函數 V(x)(從 x 出發的最短時間)滿足一個一階偏微分方程,其對 a 的最佳化給出「朝目標全速推進」。解就是著名的 bang-bang 控制:永遠朝正確方向以最大加速度推進,恰好變號一次。HJB 同時給出最短時間與回饋律。

貝爾曼最佳性原理,化成值函數的一條偏微分方程。

值函數通常「不」古典可微,故 HJB 無法在尋常意義下求解——黏性解才使它適定且唯一。也要當心維度詛咒:隨著狀態變數個數增加,直接求解 HJB 會變得不可行。

又稱
HJB equationBellman equationdynamic programming PDEHJB方程貝爾曼方程