強化學習是什麼
監督式學習與強化學習(supervised vs reinforcement learning)
在監督式學習裡,老師為每個範例提供正確答案:這張圖是貓、那張是狗。模型只要學著照抄標籤即可。在強化學習裡沒有標準答案——只有一個獎勵告訴你結果有多好,從不告訴你哪個動作才正確。智能體必須靠親自嘗試,自己摸索出好的動作。
還有另外兩個差異。監督式資料通常彼此獨立且固定,而強化學習智能體的資料是牠自己產生的序列,且牠自己的選擇決定了接下來會看到什麼——行動畏縮,你就永遠學不到大膽的招數會怎樣。再者,監督式回饋是「指導性」的(「答案是 X」),獎勵卻只是「評價性」的(「那一下得 3 分」)。這些差別,正是強化學習為何需要探索、信用分配和長期眼光的原因。
它們並非對手:RLHF 就是用獎勵去微調一個先以監督式訓練好的語言模型,所以現代系統常常是兩者接力使用。
另见