階層式強化學習與選項
階層式強化學習(hierarchical reinforcement learning)
想想你怎麼煮咖啡。你不會把它規劃成上千個細微的肌肉抽動;你想的是「磨豆、燒水、再沖」,而每一步只在你真正做到它時,才展開成更小的步驟。階層式強化學習給智能體同樣的天賦:高層不必每個時間步都挑一個低階動作,而是挑一個短期目標或子行為,再由低層去執行。同一個問題在兩個或更多時間尺度上同時被解決。
在機制上,你把一個扁平策略拆成分層的控制器。頂層策略在一小組「時間上延展的行為」之間選擇——可以叫它選項、技能或子目標——底層策略則把選定的行為連續執行許多步,直到完成。每一層仍是有自己狀態、動作與獎勵的強化學習問題,但頂層現在面對的是一串短得多、粗得多的決策,學起來、規劃起來都容易得多。
在又長又稀疏獎勵的任務上,回報最明顯:扁平的智能體可能要漫遊數千步才偶然碰到一點好處,而結構縮短了有效視野,也讓有用的行為能跨任務重複利用。代價是你現在得自己學或設計那個階層,而拆解選得不好,可能害處大於好處。本領域大半的內容,正是在談如何把這個拆解做對。
又稱
另見