強化學習是什麼

獎勵假說(reward hypothesis)

獎勵假說(reward hypothesis)是強化學習立基的賭注:我們在意的每一個目標,都能被表述成「最大化某個純量獎勵的期望總和」。贏得比賽、摺好蛋白質、把房間維持在二十一度、進行一段有幫助又誠實的對話——這假說說,每一個都能改寫成「盡可能賺取最多的累積獎勵」。用一個數字編碼「目的」,是個大膽的主張。

正是這個想法,讓強化學習得以成為單一而通用的框架,而不是一袋零散的技巧。但它是假說,不是定理,在實務上會反咬一口:把一個豐富、多面向的目標硬塞進一個數字,會招來獎勵駭客(reward hacking)——智能體滿足了獎勵的字面,卻違背了它的精神。是不是一切真的都能化約成純量獎勵,至今仍有真正的爭論。

「期望」很重要:結果往往帶有隨機性,所以智能體最大化的是跨許多種可能未來的平均累積獎勵,而不是某個保證的總和。