基於人類回饋的強化學習

人在迴圈中的強化學習(human-in-the-loop RL)

多數強化學習想像的是一個智能體獨自從固定獎勵訊號學習。人在迴圈中的強化學習,則在智能體學習的同時讓人持續主動參與——即時地觀察、糾正、示範、核可或介入。想像一位駕訓教練腳邊有第二個剎車踏板,或一位偶爾搶過操控的教練。這份持續的引導,遠比單靠獎勵,更快也更安全地塑造智能體學到什麼。

人的參與可以有許多形式:給偏好比較、提供示範供模仿、發出純量核可或即時糾正、否決危險動作,或在智能體卡住時重置它。這些訊號被折進學習裡——化為一個獎勵模型、一個輔助的模仿損失,或一個對動作的安全濾網。它的定義性特徵在於:回饋在訓練期間互動式地到來,所以人能對智能體當下的弱點作出反應,而不必事先全部預料。

人同時是瓶頸,也是安全網。他的時間稀缺、注意力會飄移,所以難題在於:何時該求助、如何讓每次查詢都值得、以及在智能體還很不行時如何保持安全。做得好,這是在混亂的真實世界裡最安全的訓練方式;做得草率,就只是把人的時數燒掉,卻換不到什麼。

又称
interactive RL