機器學習
強化學習(reinforcement learning)
強化學習讓機器像訓練小狗一樣學習:不是把正確答案直接攤給牠看,而是讓牠去嘗試,再根據結果給予獎勵或責罰。這個學習者——稱為「智能體」——做出一個動作,看看會發生什麼,然後收下一份獎勵或懲罰。經過成千上萬次嘗試,牠會逐漸偏向那些能賺到最多獎勵的做法。從沒有人告訴牠正確的一步該怎麼走;牠只能在「玩」的過程中自己摸索出來。
正因如此,它在遊戲和機器人領域才如此強大。一個學下西洋棋或玩電子遊戲的程式,得到的只是一個訊號——你贏了、你輸了、你得分了——它必須自己弄清楚,在它走過的眾多步子裡,到底哪一步真正起了作用。一個學走路的機器人,會因為站穩、向前邁進而得到獎勵,於是跌跌撞撞地摸索出一套能用的步態。智能體始終被兩股衝動拉扯:是利用它已經學會的招數,還是去探索某個可能回報更高的新嘗試。
里程碑出現在 2013 至 2015 年,DeepMind 的 DQN 僅憑螢幕上的原始像素和分數,從零學會了玩數十款雅達利遊戲——並在許多款上擊敗了人類高手,而且每一款用的都是同一套演算法、同樣的網路結構和同樣的設定(只是為每款遊戲分別訓練了一份獨立的副本)。一個常見的誤解是,機器是「被程式設計成會贏」的。其實並非如此:它一開始只是胡亂揮舞、毫無章法,全靠自己笨拙摸索的後果,一點點學了出來。
AlphaGo 學下圍棋,部分靠的是與自己對弈數百萬局,唯一的獎勵就是「贏」——最終擊敗了人類世界冠軍。
這個名字源自心理學:B. F. 史金納在二十世紀中葉的實驗表明,凡是後面跟著獎勵的行為,往往會被重複——也就是被「強化」。它的現代機器版本成形於 1980 至 90 年代,由理查·薩頓和安德魯·巴托等研究者為這一想法奠定了數學基礎。
又稱
另見