強化學習是什麼

智能體–環境互動迴圈(agent–environment interaction loop)

這是強化學習的心跳,一遍又一遍地重複。智能體觀察當前情境,選一個動作,送進環境。環境回以一個新情境和一個獎勵。智能體接收後再次選擇。感知、行動、拿到獎勵、重複——這個循環轉一圈,稱為一個時間步(time step)。

強化學習的所有機制都掛在這個迴圈上。它產生的狀態、動作、獎勵之流——也就是智能體的經驗——是智能體唯一拿得到的資料;沒有另外一份訓練集。所謂學習,就是用這道資料流去改進策略,好讓一圈又一圈下來,選出的動作傾向於收集到更多獎勵。

S_t \xrightarrow{A_t} (R_{t+1}, S_{t+1})

在狀態 S_t 下智能體採取動作 A_t,得到獎勵 R_{t+1} 與下一個狀態 S_{t+1}。