階層式強化學習與選項
管理者–工作者階層(manager–worker hierarchy)
這是階層式智能體最常見的樣貌:兩個以不同時鐘速度運行、彼此耦合的策略。管理者(高層策略)偶爾醒來,看看局勢,往下交付一個目標或子任務。工作者(低層策略)接著全力連跑許多步,採取原始動作去達成管理者所要求的,直到管理者再次醒來發出下一個目標。一個腦子定方向,另一個負責駕駛。
沿著階層往下流的是目標,往上流的是後果。工作者通常是目標條件式的——它的策略與價值函數把管理者的目標當成額外輸入——並以「抵達目標」的獎勵訓練。管理者則以環境的真正獎勵訓練,但它的動作空間是一組目標,而非原始動作,所以它在一個粗得多、慢得多、也好規劃得多的時間尺度上運作。
幾乎每個有名字的階層方法——封建式強化學習、帶頂層選擇器的選項、HIRO 這類目標條件式方案——都是這個模式的某個實例。反覆出現的工程難題是非平穩性:工作者還在學的時候,同一個目標在不同時間會產生不同結果,於是管理者瞄準的是個移動中的靶。穩定這個兩層互動,正是大半實務工作的重點。
又称
另见