多臂吃角子老虎機(multi-armed bandit)
/ MUL-tee-armd BAN-dit /
想像一排吃角子老虎機,每一台都有自己一個未知的中獎率。你的拉桿次數固定,想盡量多贏。每一次拉桿都是個兩難:是守著目前賠付最好的那台,還是去試另一台——它說不定暗地裡更好?這個,剝到只剩骨架,就是多臂老虎機——可能是最簡單的強化學習問題,只剩「探索對利用」那一點張力,別無其他。(「單臂強盜」是吃角子老虎機的舊時俚語。)
讓老虎機如此乾淨的,是它省去的東西:這裡沒有狀態。世界不會因你的所作所為而改變——拉一下桿永遠不會把你送進一個新情形,它只是賠付而已。這是把「一連串情形」抽掉之後的強化學習,只剩下那個純粹的問題:如何在「已知不錯」與「可能更好」的選項之間分配嘗試次數。正因為如此簡單,它可以被嚴格地分析,其策略也帶著數學上的保證。
老虎機遠不是個玩具。它是 A/B 測試、線上廣告投放、新聞文章推薦、臨床試驗設計背後那台日常的引擎——凡是你必須在「回報不確定的選項」之間反覆抉擇、並邊走邊學之處,都有它。要記住的關鍵侷限是:老虎機假設你的選擇不會改變世界未來的狀態。一旦某個動作會改變你下一步所面對的情形(大多數真實遊戲、機器人學、對話),你就離開了老虎機的地界,需要 MDP 那整套機器了。
一個網站為同一篇文章測試三個標題。每位訪客被展示其中一個;點擊就是回報。一個老虎機演算法會逐漸把更多訪客導向點擊率更高的那個標題——但仍少量地繼續展示另外兩個,以防早期的領先只是運氣。它一邊學一邊賺,不像固定的 A/B 測試那樣。
最純粹的「探索對利用」問題:在回報不確定的選項間反覆抉擇,且沒有會變化的狀態。
老虎機是「強化學習」減去「狀態」這個概念:你的動作不會改變你接下來要面對的東西。正是這一處簡化,讓老虎機擁有乾淨俐落的最優策略;也正因如此,它的經驗無法整批照搬——大多數現實問題確實有會變化的狀態,而那恰恰是老虎機繞開的那個難處。