強化學習
智能體—環境循環(agent-environment loop)
/ AY-junt en-VY-run-munt loop /
智能體—環境循環是強化學習的心跳,整個領域都建立在它之上。想像一個玩家和一款電子遊戲。每一刻,玩家(智能體)看到螢幕(狀態),按下一個按鈕(動作),遊戲隨即回應:畫面改變,分數或升或降(下一個狀態與一份獎勵)。接著又重來一遍,再一遍,成千上萬次。這個不停歇的循環——觀察、行動、承受後果、再觀察——就是所謂的「循環」。
說得精確些:世界被切成兩塊。智能體是我們想要訓練的那個決策者;其餘的一切都是環境。每一個時間步,環境遞給智能體一個狀態,智能體挑選一個動作,環境再返回一份獎勵和一個新狀態。智能體唯一的目標,是選出那些能在長期內累積盡量多獎勵的動作。關鍵在於,環境對智能體而言是個黑箱——沒有人告訴它規則,它只能看到自己每次嘗試帶來的後果。
這個框架之所以重要,正因為它刻意做到了最簡。它不假設智能體是機器人、遊戲玩家、恆溫器還是推薦系統——任何會採取行動並承受結果的東西都套得進去。反過來說,智能體與環境之間那條分界線是一種建模選擇,而非自然給定的事實;一旦劃得草率(狀態有誤導性、獎勵沒真正抓住你想要的東西),後面的一切都會被悄悄毒化。
掃地機器人:狀態=它在哪裡、感測器看到什麼;動作=前進、轉彎或回充電座;獎勵=每清掃一塊新地板+1,撞牆一次-1。跑過許多次後,它學出一條「掃得最多、撞得最少」的路線。
循環的一次轉動:觀察狀態、選擇動作、收到獎勵與下一個狀態——如此反覆。
所謂「智能體」,是你能透過學習去改變的那一部分;改不了的一切都算環境。這條界線劃錯了——比如把關鍵資訊藏在狀態之外——即便演算法完美無缺,問題也可能根本無法被學會。
又稱
另見