探索
稀疏獎勵下的探索(exploration in sparse-reward settings)
在許多真實任務裡,獎勵幾乎是沉默的:你走了上千步什麼也沒拿到,然後在最後——如果你曾僥倖撞上成功的話——才得到孤零零的一分。沒有獎勵梯度可循,一個最大化價值的智能體就無坡可爬——隨機亂揮基本上永遠觸發不了獎勵,所以它永遠開始不了學習。這正是像 epsilon-貪婪這種天真探索悄悄崩潰的地方。
標準的解救之道全都在製造一個更稠密的訊號。內在動機——好奇心、新奇性或計數獎勵——在真實獎勵出現之前,就先給智能體某個可以追逐的東西。獎勵塑形(reward shaping)則手工打造中途的指引。其他做法改變智能體學習所用的資料:事後重標(hindsight relabelling)假裝它抵達的任何地方就是目標,而課程學習與示範則把它種在接近成功之處。共通的想法是:當環境本身拒絕說話時,想辦法讓進展變得可衡量。
又称
另见