強化學習是什麼

強化學習應用概覽(reinforcement learning applications overview)

強化學習在「成功意味著一連串決策、而非單一標籤」的地方最為出色。它從零學會圍棋、西洋棋和 Atari 遊戲;它操控學走路、學抓取的機器人;它調節資料中心散熱、管理能源與交通、優化推薦與廣告競價、設計實驗,還幫忙在核融合反應爐裡導引電漿。凡是動作隨時間展開、朝著目標推進的地方,強化學習都是候選方案。

它近來最受矚目的用途,是對齊大型語言模型:以人類回饋進行的強化學習(RLHF),透過獎勵較受偏好的回應,把原始的下一字預測器變成有幫助、無害的助理。不過,強化學習並不是預設工具。它可能很吃樣本、不穩定,在真實世界裡訓練也不安全,所以它最划算的時機是:模擬便宜、獎勵定義清楚,而且序列結構真的重要時。