強化學習是什麼

序列決策(sequential decision making)

強化學習處理的是一個接一個的決策,而且今天的選擇會改變你明天要面對的情境。單一的快照式決策——判斷這封信是不是垃圾郵件——是各自獨立的。但開車、下棋、管理投資則是一條鏈:每一步都重塑了世界,也重塑了你接下來能有的選項。強化學習正是為這種「鏈」而生。

正是這種環環相扣,讓問題既豐富又困難。眼前誘人的動作可能把你帶向糟糕的下場,而早期一點小小的犧牲卻可能開出一條制勝之路——所以智能體必須衡量整段軌跡,而非孤立的單步。選擇、後果與未來的選擇全都糾纏在一起,這也是為什麼強化學習在意的是長期累積獎勵,而不是任何單一決策帶來的好處。