強化學習是什麼

獎勵訊號(reward signal)

獎勵(reward)是環境在每個動作之後交給智能體的一個數字,等於在說「剛剛那下有這麼好,或這麼糟」。贏一局:+1;輸了:−1;把機器人撞壞:一個很大的負數。它刻意保持簡單——就只是一個純量——因為這個數字就是智能體對「成功」的全部定義。智能體學到的一切,都是從追逐它而來。

正因為獎勵定義了目標,設計獎勵成了強化學習中最細膩的工藝之一。只獎勵你真正想要的,別獎勵方便的替代指標:用「移動距離」當獎勵,智能體可能原地打轉;用「船收集分數」當獎勵,牠可能在小湖裡無限繞圈刷分,而不去完成比賽。獎勵也可能很稀疏——幾乎到處都是零,只有在獲勝時才不為零——這會讓學習困難許多。

獎勵是對「結果」的回饋,不是指令;它從不告訴智能體該採取哪個動作,只說明結果有多好。