階層式強化學習與選項

子目標發現(subgoal discovery)

如果一個階層的好壞全看它的拆解,那下一個顯而易見的問題就是:子任務從哪來?子目標發現要解決的,是自動找出有用的中途目標,而非由人手寫。理想是讓智能體自己注意到「抵達門口」或「撿起鑰匙」是天然的路標,並圍繞它們生出選項或目標。

各種做法可分成幾個家族。圖式方法建立「哪些狀態通往哪些狀態」的模型,去找結構上特殊、許多路徑都必經的狀態——門口、交叉口、瓶頸。頻率方法標出那些常出現在成功軌跡、卻很少出現在失敗軌跡的狀態。獎勵式與新奇式方法則提出令人意外、難以抵達、或能最大化某種內在訊號的子目標。每種情況裡,被發現的狀態都成了目標條件式工作者受訓要抵達的標的。

好的子目標能把一個無望的稀疏獎勵任務,化成一連串短而可學的小跳;壞的則白白增加開銷,或把智能體送進死路。誠實地說,目前最先進的全自動發現仍然脆弱,是個活躍的研究領域——要在多樣任務上可靠地做對,仍是階層式強化學習核心的開放問題之一。

又称
automatic subgoal identification