階層式強化學習與選項

多樣性就是你所需要的(Diversity Is All You Need, DIAYN)

DIAYN 是無獎勵技能發現最有名的具體配方,它把一句口號化成目標:技能的價值,取決於你能否從它做的事把它們區分開來。具體而言,智能體在回合開始時抽一個技能編碼 z,依一個以技能為條件的策略行動,每當它造訪的狀態讓一個獨立分類器容易猜出它正在執行哪個 z 時,就獲得獎勵。各技能彼此競爭,去佔據狀態空間裡各不相同、可辨識的角落。

形式上的目標,是最大化技能 z 與智能體造訪狀態 s 之間的互資訊,同時用一個熵的紅利讓策略的動作保持多變。實務上你訓練一個判別器去從 s 預測 z,並用它指派給真實技能的對數機率,當作內在獎勵。互資訊的目標把不同技能推向不同的狀態分布,而熵則防止每個技能塌縮成單一僵硬的行為。

DIAYN 令人印象深刻之處在於:在環境獎勵為零的情況下,它就發現了真正有用的行為——智能體單憑「想變得可區分」的驅力,就學會走、跳、或往不同方向移動——這些隨後能為階層控制鋪路,或為下游任務暖身。它已知的限制是覆蓋率:因為獎勵只要求可區分性,技能傾向散布在容易抵達的狀態,可能錯過真正目標所在意的那些罕見、攸關任務的區域。

r_z(s)=\log q_\phi(z\mid s)-\log p(z)

當判別器能從造訪狀態 s 有把握地還原技能編碼 z 時,就獎勵該技能。

又称
DIAYN