階層式強化學習與選項
封建式強化學習(feudal reinforcement learning)
封建式強化學習把智能體組織成中世紀的指揮鏈:領主為封臣設定目標,封臣為自己的下屬設定目標,只有最低階才真正碰到世界。高層的「管理者」看著局勢、發出一個目標——常是在某個抽象空間裡移動的方向——而低層的「工作者」純粹因達成那個目標而獲獎,從不因任務的真正獎勵而獲獎。管理者學的是哪些目標會帶來獎勵;工作者學的是如何抵達它被交付的任何目標。
由 Dayan 與 Hinton 於 1992 年的原作命名的兩個原則,讓階層保持乾淨。獎勵隱藏指的是:一層只因達成它上司的命令而獲獎,而非因全域目標,於是每一層都有定義明確的工作。資訊隱藏指的是:每一層以自己的解析度看世界,忽略下層處理的細節與上層的宏圖。現代的 FeUdal Networks 論文用深度網路復興了這個想法,讓管理者在一個學到的潛在空間裡發出目標。
它的吸引力在於強烈的時間抽象,以及在稀疏獎勵任務上的良好表現,因為即使環境的獎勵罕見,工作者始終有個密集、即時的目標可追。難處在於讓兩層保持同步:若管理者提出工作者搆不到的目標,或工作者鑽了目標獎勵的漏洞卻無助於真正的任務,這個階層就會悄悄瓦解。
又称
另见