階層式強化學習與選項
技能發現(skill discovery)
想像把一個智能體丟進一個沒有任務、沒有獎勵的世界,告訴它:就去學會做些有趣、各不相同的事吧。技能發現正是如此——在設定任何特定任務之前,純粹從互動中學一套可重用的行為。成果是一組由某個潛在編碼索引的技能,等真正的目標終於到來時,智能體能再叫用它們,很像孩子早在被要求去拿玩具之前,就已精通走路、抓握與攀爬。
沒有外部獎勵,你就需要一個內部的,於是這些方法發明了內在目標。最有影響力的一族,會獎勵技能彼此相異、且效果可預測:每個技能都該把智能體帶往一個可辨識、各不相同的行為區域,好讓你光看就能猜出正在執行哪個技能。最大化這份可區分性——常表述成技能與其造訪狀態之間的互資訊目標——在完全沒有任務獎勵的情況下,就能產出一組多樣而可控的行為。
它承諾的回報很大:一座只需預訓練一次、就能跨許多下游任務重用的技能庫,縮短每個新任務所需的學習。誠實的提醒是:無監督技能往往覆蓋空間中容易、高覆蓋率的部分,而非與任務相關的部分;而從自生的技能搭橋到某個特定目標,仍可能需要可觀的微調。
又称
另见