前沿與開放問題

風險敏感強化學習(risk-sensitive RL)

標準 RL 最大化的是期望回報——也就是多次執行的平均。但平均藏住了尾部:一個平均很漂亮的策略,可能偶爾會災難性地失敗,而對一輛自駕車、一項醫療處置或一筆投資來說,你真正在意的正是那個罕見的災難。風險敏感強化學習(risk-sensitive RL)改變了目標,讓智能體優化的是風險或最壞情況、而非僅僅是平均,刻意用一點平均表現去換取小得多的下檔風險。

它借用了金融與決策理論的工具。有些方法優化某個風險度量,例如條件風險值(CVaR),它聚焦於最差那幾個百分比結果的平均;另一些則使用懲罰變異數的指數效用,或學出回報整個分佈、再據以審慎行動的分佈式 RL。這個旋鈕是一個風險參數,可從風險中立一路內插到深度規避風險的行為。

它在「賭注是真的、結果又不確定」的場合都很重要,並與安全 RL 重疊——只不過風險度量是「柔性地」勸退壞尾部,而非施加硬約束。開放的議題包括:如何從有限資料可靠地估計尾部風險、在罕見事件上訓練的不穩定,以及如何挑選一個與人類關係人實際容忍度相符的風險態度。

\mathrm{CVaR}_{\alpha}(Z)=\mathbb{E}\big[\,Z \mid Z \le \mathrm{VaR}_{\alpha}(Z)\,\big]

條件風險值:在最差 α 比例結果上取平均的回報,正是風險規避型智能體要守住的尾部。