回報、價值與策略

策略(policy)

策略可以用一句話概括成智能體的大腦:它選擇要做什麼的規則。給定當前狀態,策略會說出該採取哪個動作,或更一般地,給每個可能的動作一個機率。智能體所做的一切都源自它的策略;在強化學習裡,學習最終就是指改良這條規則。

它寫作 pi,其中 pi(a 給定 s) 表示在狀態 s 採取動作 a 的機率。策略可以簡單到只是小型格子世界的一張查詢表,也可以複雜到是一個把相機像素映射成馬達扭矩的深度神經網路。重點在於從處境到行為的那個對應。由此衍生兩個重要區分:策略可以是確定性或隨機的,也可以是最佳的、或只是當前的最佳猜測。

別把策略(怎麼行動)和價值函數(情況有多好)搞混。價值替策略提供資訊,但真正產生行為的是策略。

又稱
behaviour ruleπ