探索

新奇性搜尋(novelty search)

新奇性搜尋下了一個激進的賭注:完全無視目標,只獎勵「做了某件新的事」。它不以智能體賺到多少任務獎勵來評分,而是以它的行為跟先前所見一切有多不同來評分,並在一個行為描述子(behaviour descriptor)的空間裡衡量。整個族群被不停推向「為新奇而新奇」,沒有任何直接逼它真正解決任務的壓力。

違反直覺地,這在具欺騙性的問題上常常勝過目標驅動的搜尋——在那些問題上,貪婪地往獎勵爬會直直走進死胡同;而追逐新奇會持續生出一塊塊踏腳石,那是個對獎勵視而不見的探索者永遠不會造訪的,而解答經常就藏在其中。這些想法源自演化計算,如今在品質–多樣性(quality-diversity)方法中與強化學習融合,這類方法尋求的是一整批既新奇又高效的行為,而非單一個最佳策略。

又稱
novelty search in RL