强化学习

智能体—环境循环(agent-environment loop)

/ AY-junt en-VY-run-munt loop /

智能体—环境循环是强化学习的心跳,整个领域都建立在它之上。想象一个玩家和一款电子游戏。每一刻,玩家(智能体)看到屏幕(状态),按下一个按钮(动作),游戏随即回应:画面改变,分数或升或降(下一个状态与一份奖励)。接着又重来一遍,再一遍,成千上万次。这个不停歇的循环——观察、行动、承受后果、再观察——就是所谓的「循环」。

说得精确些:世界被切成两块。智能体是我们想要训练的那个决策者;其余的一切都是环境。每一个时间步,环境递给智能体一个状态,智能体挑选一个动作,环境再返回一份奖励和一个新状态。智能体唯一的目标,是选出那些能在长期内累积尽量多奖励的动作。关键在于,环境对智能体而言是个黑箱——没有人告诉它规则,它只能看到自己每次尝试带来的后果。

这个框架之所以重要,正因为它刻意做到了最简。它不假设智能体是机器人、游戏玩家、恒温器还是推荐系统——任何会采取行动并承受结果的东西都套得进去。反过来说,智能体与环境之间那条分界线是一种建模选择,而非自然给定的事实;一旦划得草率(状态有误导性、奖励没真正抓住你想要的东西),后面的一切都会被悄悄毒化。

扫地机器人:状态=它在哪里、传感器看到什么;动作=前进、转弯或回充电桩;奖励=每清扫一块新地板+1,撞墙一次-1。跑过许多次后,它学出一条「扫得最多、撞得最少」的路线。

循环的一次转动:观察状态、选择动作、收到奖励与下一个状态——如此反复。

所谓「智能体」,是你能通过学习去改变的那一部分;改不了的一切都算环境。这条界线划错了——比如把关键信息藏在状态之外——即便算法完美无缺,问题也可能根本无法被学会。

又称
interaction loopperception-action loopRL loop感知—行动循环交互循环