强化学习
探索与利用(exploration vs exploitation)
/ ek-splor-AY-shun vurs ek-sploy-TAY-shun /
想象你最爱的那家餐馆。你是点那道你早已知道很美味的菜(利用),还是试一道新菜——它也许更出色,也许令人失望(探索)?这个日常的两难,正是强化学习的核心张力。一个总是走当前最佳着法的智能体,永远发现不了更好的;一个总是尝新的智能体,又永远兑现不了它已经学到的东西。
这种张力无可回避,因为智能体在学习的同时也在行动。每一个动作既是一次抉择(去做此刻看来最好的事),也是一场实验(去弄清那个动作究竟通向何方)。两者无法同时做到极致:花在搜集信息上的时间,就是没花在赚取奖励上的时间,反之亦然。把这个平衡拿捏得恰到好处,从真切的意义上说,就是这门技艺的全部。
并不存在普适的解,只有一道策略光谱——从粗糙的 ε-贪心(大多时候利用,偶尔掷骰子),到那些在最不确定处探索得更多的精巧方案。一个自然且有充分依据的直觉是:在知之甚少的早期大胆探索,随着认识日渐扎实再多去利用。但探索得太少,你可能会永远锁死在一个平庸的习惯上,既自信又错误;探索得太多,你又会把奖励白白挥霍在那些本就不可能有回报的选项上。
你搬到一座有二十家咖啡馆的新城。头几周里,你每天换一家试(探索)。一旦找到三家心头好,你便大多回去光顾它们(利用)——但仍时不时溜进一家新店,万一它更好呢。这种混搭,恰恰就是一个好的强化学习智能体所做的事。
去试新选项以学习(探索)对上吃定已知的最佳(利用)——两者无法同时最大化。
纯粹的利用是一个陷阱:一个一旦锁定它找到的第一个还过得去的选项就不撒手的智能体,可能永远学不到一个好得多的选项其实近在咫尺。危险在于,它从头到尾都感觉自己很成功——按它自己的尺度奖励很高,而一个高得多的天花板,却被永远搁置在未曾探索之处。
又称
另见