前沿與開放問題
安全強化學習(safe reinforcement learning)
一個標準 RL 智能體會樂意把車開下懸崖一千次,只要那是它發現「懸崖是壞東西」的方式——在電玩裡無妨,對真實的汽車、無人機或手術機器人卻無法接受。安全強化學習(safe reinforcement learning)研究的是「在尊重安全約束的同時學會好的行為」,無論是在訓練期間(探索時別造成傷害),還是在部署時(即使極罕見也絕不違反限制)。
它有幾種形式化的立場。其一把安全編碼成硬約束,在「期望成本有界」的前提下優化回報——這就是受限馬可夫決策過程的觀點。其二把目標塑造成風險敏感,在意最壞情況而非平均。其三則用一個安全層或護盾,在不安全的動作執行之前就把它濾掉,通常背後有一個「哪些狀態是可挽回的」的學得或手工模型。許多做法還加上保守的探索,讓智能體謹慎試探、而非盲目亂闖。
安全 RL 是 RL 研究與真實世界部署之間的橋樑,而它遠未被解決。在一個不完美的模型下「以高機率保證某約束成立」、在「一次都不墜入災難」的前提下安全地學習,以及在安全與表現之間取捨,全都是活躍的問題。它直接連結到受限 MDP、風險敏感 RL,以及更廣的 AI 安全領域。
又称
另见