机器学习
强化学习(reinforcement learning)
强化学习让机器像训练小狗一样学习:不是把正确答案直接摊给它看,而是让它去尝试,再根据结果给予奖励或责罚。这个学习者——称为「智能体」——做出一个动作,看看会发生什么,然后收下一份奖励或惩罚。经过成千上万次尝试,它会逐渐偏向那些能赚到最多奖励的做法。从没有人告诉它正确的一步该怎么走;它只能在「玩」的过程中自己摸索出来。
正因如此,它在游戏和机器人领域才如此强大。一个学下国际象棋或玩电子游戏的程序,得到的只是一个信号——你赢了、你输了、你得分了——它必须自己弄清楚,在它走过的众多步子里,到底哪一步真正起了作用。一个学走路的机器人,会因为站稳、向前迈进而得到奖励,于是跌跌撞撞地摸索出一套能用的步态。智能体始终被两股冲动拉扯:是利用它已经学会的招数,还是去探索某个可能回报更高的新尝试。
里程碑出现在 2013 至 2015 年,DeepMind 的 DQN 仅凭屏幕上的原始像素和分数,从零学会了玩几十款雅达利游戏——并在许多款上击败了人类高手,而且每一款用的都是同一套算法、同样的网络结构和同样的设置(只是为每款游戏分别训练了一份独立的副本)。一个常见的误解是,机器是「被编程成会赢」的。其实并非如此:它一开始只是胡乱挥舞、毫无章法,全靠自己笨拙摸索的后果,一点点学了出来。
AlphaGo 学下围棋,部分靠的是与自己对弈数百万局,唯一的奖励就是「赢」——最终击败了人类世界冠军。
这个名字源自心理学:B. F. 斯金纳在二十世纪中叶的实验表明,凡是后面跟着奖励的行为,往往会被重复——也就是被「强化」。它的现代机器版本成形于 1980 至 90 年代,由理查德·萨顿和安德鲁·巴托等研究者为这一想法奠定了数学基础。
又称
另见