應用、環境與模擬到真實

強化學習用於自動駕駛(RL for autonomous driving)

自動駕駛要求車輛在車流中感知、預測並安全地行動。RL 對其中的「決策層」尤其有吸引力——變換車道、匯入、協商通過路口——因為怎麼做才對,取決於其他駕駛接下來會怎麼動。

狀態結合了由感測器導出的特徵,例如鄰近車輛、車道與號誌;動作是轉向與油門,或更高層的駕駛機動;獎勵則在前進、舒適與安全之間取得平衡。由於撞車無法接受,RL 幾乎完全在模擬中訓練,常常面對會自己學習的車流(多智能體情境),再非常謹慎地遷移。許多正式系統只把 RL 用在子問題上,外面仍包著以規則為本的安全層。

罕見事件的長尾——孩童突然衝出、梯子掉在路上——主宰了真實世界的安全,卻幾乎不在資料裡出現,而一次災難性失誤就已經太多。所以全程端到端的 RL 駕駛,至今大多仍是研究上的願景,而非已出貨的產品。

又稱
learned driving policiesRL for self-driving