強化學習是什麼
什麼是強化學習(reinforcement learning)
想像你在教狗狗一個把戲。你不會給牠一本說明書,而是讓牠嘗試,做對了就給點心。久而久之,狗狗學會哪些動作能換到點心。強化學習(reinforcement learning,RL)用同樣的方式訓練軟體:一個智能體在某個世界裡行動,收到一個叫做「獎勵」的數字,慢慢摸索出長期能賺到更多獎勵的行為。
更精確地說,強化學習是機器學習的一個分支:智能體完全透過互動、觀察後果來學會一個「策略」——也就是根據情境選擇動作的規則——而不是靠一份標好正確答案的資料集。它的目標是最大化長期累積的期望獎勵,而非眼前的好處。正因如此,強化學習特別適合那些「一連串決策、效果隨時間展開」的問題:遊戲、機器人、控制,以及訓練語言模型助理。
又称
另见