強化學習是什麼

試誤學習(trial-and-error learning)

強化學習的核心,就是「邊做邊看會發生什麼」——就像小孩學騎腳踏車那樣。沒有老師在旁邊說「這裡的正確動作是 X」。取而代之,智能體嘗試一個動作,觀察結果與獎勵,然後微調自己:多做有效的、少做沒效的。好的行為是被「摸索」出來的,不是直接交到手上的。

這之所以強大,是因為我們往往無法事先寫出正確答案,卻能在看到好結果時認得出它。代價是:智能體得真的經歷失敗才能從中學習,這可能很慢,在真實世界裡甚至昂貴或不安全。它也逼出一個貫穿整個強化學習的難題:我做過的這麼多動作裡,到底是哪一個真正造成了這個結果?