多臂老虎机(multi-armed bandit)
/ MUL-tee-armd BAN-dit /
想象一排老虎机,每一台都有自己一个未知的中奖率。你的拉杆次数固定,想尽量多赢。每一次拉杆都是个两难:是守着目前赔付最好的那台,还是去试另一台——它说不定暗地里更好?这个,剥到只剩骨架,就是多臂老虎机——可能是最简单的强化学习问题,只剩「探索对利用」那一点张力,别无其他。(「单臂强盗」是老虎机的旧时俚语。)
让老虎机如此干净的,是它省去的东西:这里没有状态。世界不会因你的所作所为而改变——拉一下杆永远不会把你送进一个新情形,它只是赔付而已。这是把「一连串情形」抽掉之后的强化学习,只剩下那个纯粹的问题:如何在「已知不错」与「可能更好」的选项之间分配尝试次数。正因为如此简单,它可以被严格地分析,其策略也带着数学上的保证。
老虎机远不是个玩具。它是 A/B 测试、在线广告投放、新闻文章推荐、临床试验设计背后那台日常的引擎——凡是你必须在「回报不确定的选项」之间反复抉择、并边走边学之处,都有它。要记住的关键局限是:老虎机假设你的选择不会改变世界未来的状态。一旦某个动作会改变你下一步所面对的情形(大多数真实游戏、机器人学、对话),你就离开了老虎机的地界,需要 MDP 那整套机器了。
一个网站为同一篇文章测试三个标题。每位访客被展示其中一个;点击就是回报。一个老虎机算法会逐渐把更多访客导向点击率更高的那个标题——但仍少量地继续展示另外两个,以防早期的领先只是运气。它一边学一边赚,不像固定的 A/B 测试那样。
最纯粹的「探索对利用」问题:在回报不确定的选项间反复抉择,且没有会变化的状态。
老虎机是「强化学习」减去「状态」这个概念:你的动作不会改变你接下来要面对的东西。正是这一处简化,让老虎机拥有干净利落的最优策略;也正因如此,它的经验无法整批照搬——大多数现实问题确实有会变化的状态,而那恰恰是老虎机绕开的那个难处。