選擇停止定理(optional stopping theorem)

一場公平賭局在你固定打有限回合期間,期望值維持不變。但若你在一個聰明、依資料而定的時刻收手呢——第一次領先 10 元就退、或隨機漫步一觸到零就退?精選的停止規則能否鎖定一個優於公平的平均?選擇停止定理(也叫選擇抽樣)給出精確答案:在恰當條件下,在一個隨機時刻 T 停下一個鞅,期望仍不變,E[M_T] = E[M_0]。聰明地擇時收手同樣無法打敗公平賭局——而反過來用,它能用一行解掉一大堆「要多久」與「哪個邊界」的問題。

設定用到停時 T:一個你能在它到來時就認出、只憑過去就能判斷的隨機時刻(形式上,事件 {T = n} 屬於 F_n——你永遠不需要看見未來才知道自己已停下)。停止值 M_T 是你在那個隨機時刻的財富。定理說只要下列數個條件之一成立,便有 E[M_T] = E[M_0],而你「必須」檢查一個——這結果一般而言並不成立。常見的充分條件是:(a) T 被某常數所界;或 (b) T 幾乎必然有限且鞅有有界增量;或 (c) E[T] 有限且增量有界,或停止過程 M_(T and n) 一致可積。對下鞅,等號變為 E[M_T] >= E[M_0];對上鞅,E[M_T] <= E[M_0]。

它的威力在於把困難計算變成一行。賭徒破產:一個公平漫步從 0 與 N 之間的 k 出發;因為漫步是鞅,在它首次觸及邊界的停時 T 有 E[M_T] = k,又 E[M_T] = N * P(觸 N) + 0 * P(觸 0),於是 P(到達 N) = k/N——立刻得出。期望時長:過程 S_n^2 - n 是鞅,對它施以選擇停止便一舉得到吸收前的期望時間 k(N - k)。關鍵的提醒(由加倍系統所示)是你「必須」驗證一個條件。對一個無界的公平漫步與「第一次領先 1 就停」的規則,漫步是常返的故 T 有限,然而 E[M_T] = 1 而非 0——定理失敗,因為沒有任何有界性條件成立。永遠要檢查前提;選擇停止是一把鋒利的工具,不是免費午餐。

一行解決賭徒破產:公平 +/-1 漫步從 k 出發,在 T 首次觸 0 或 N 時停。漫步是鞅,故 E[M_T] = k。但 M_T 為 0 或 N,所以 k = N * P(到達 N),得 P(到達 N) = k/N。對鞅 S_n^2 - n 施以選擇停止,同樣給出期望步數為 k(N - k)。

選擇停止把關於鞅的「何時」與「何處」問題化為一行答案——只要它的條件成立。

你「必須」驗證一個條件(T 有界、增量有界、或一致可積)。少了其一定理可能徹底失敗——例如在無界公平漫步上「第一次領先 1 就停」會得 E[M_T] = 1,而非 0。

又稱
OSToptional sampling theoremDoob's optional stopping theorem選擇抽樣定理最佳停止定理