強化學習
策略(policy)
/ POL-uh-see /
策略是智能體的行動方針:一條規則,給定智能體當下身處的任何情形,它就說該做什麼。如果說狀態是問題,那麼策略就是答案。它是強化學習最終想要學出來的東西——一旦你有了一個好策略,就可以把所有的試錯都丟開,照著它走就行。
說得精確些,策略把狀態映射到動作。確定性策略為每個狀態給出一個固定動作(「燈紅了就停」)。隨機性策略則給出機率(「70% 往左、30% 往右」),再擲骰子決定——這有助於讓智能體對對手保持難以預料,也有助於在學習中進行探索。策略常用希臘字母 π 表示,它把智能體的全部行為濃縮成一個函數。
「策略」之所以是個如此核心的詞,是因為強化學習裡其餘的一切,都在為找出一個好策略服務。價值函數估計一個策略有多好;貝爾曼方程式描述如何改進它;策略梯度方法則直接調整它。一個值得記住的微妙之處:一個策略可以在它受訓的那個世界裡出類拔萃,卻在世界一變的那一刻變得毫無用處,因為它記住的是「該怎麼做」,而非理解了「為什麼」。
一個簡單的紅綠燈策略:狀態「紅」→動作「停」;狀態「綠」→「行」;狀態「黃」→「減速」。學出來的遊戲策略是同一個想法,只是大得多——對每一種可能的螢幕畫面,它都存著按下每個按鈕的機率。
策略把「我處在什麼情形?」變成「我該做什麼?」——對每一種情形都如此。
一個常見的混淆:策略是「行動的規則」,而價值函數是「這條規則將賺到多少獎勵」的估計。有些方法先學價值、再從中讀出策略(Q學習);另一些則直接學策略(策略梯度)。別把兩者混為一談。
又稱
另見