馬可夫決策過程(Markov decision process)
/ MAR-kof dih-SIZH-un PROSS-ess /
馬可夫決策過程,是強化學習據以開局的那張正式棋盤。它把五樣東西釘死:你可能身處的種種情形(狀態)、你能做的種種動作(動作)、一步之後接下來是哪種情形的規則(轉移,可能帶隨機性)、每步動作賺到的分數(獎勵),以及你對未來相比當下有多在乎(折扣)。一個問題一旦這樣寫下來,整套強化學習的機器便嚴絲合縫地各就各位。
它的標誌性特徵——「馬可夫」那一部分——是一個無記憶假設:下一個狀態只取決於當前的狀態與動作,而不取決於你是如何一路走到這裡的全部歷史。在西洋棋這樣的棋類遊戲裡,這是字面上成立的:當前棋子的擺布已告訴你所需的一切,它們以什麼順序到達此處無關緊要。正是這個假設讓數學變得可解,因為智能體永遠只需看「我現在在哪兒」,而不必看「曾經發生過的一切」。
老實說,難處在於現實世界很少這般客氣。自動駕駛汽車單獨的一幀畫面,並不能告訴你另一輛車的速度——你還需要之前的幾幀,所以單憑一張快照並非「馬可夫」的。從業者的補救辦法,是往狀態裡塞進更多東西(疊上好幾幀、加上速度),直到它表現得「夠馬可夫」為止。當你確實看不到完整狀態時,問題就變成了「部分可觀測」的 MDP,那要難得多。
「蛇梯棋」就是一個乾淨的 MDP:狀態=你所在的格子;動作=擲骰(只有這一種);轉移=骰子點數再加上踩到的蛇或梯;獎勵=走到最後一格時+1。你的未來只取決於你當下所在的格子——而非你花了多少回合才到這裡。
五樣配料——狀態、動作、轉移、獎勵、折扣——再加上那條「只有當下要緊」的馬可夫規則。
馬可夫性是你強加在狀態設計上的一個假設,而非世界本身的屬性。如果你的狀態漏掉了某樣未來所依賴的東西,再好的演算法也無法完全彌補——所以強化學習裡大量真正的功夫,都花在設計一個「夠馬可夫」的狀態上。