應用、環境與模擬到真實

強化學習用於推薦系統(RL for recommendation systems)

傳統推薦系統預測你「現在」會點什麼。RL 推薦系統則改為規劃一連串動作——在整個工作階段、甚至多次回訪之間要呈現什麼——以最大化長期的參與度或滿意度,而不只是緊接著的那一次點擊。

狀態是使用者的歷史與情境;動作是要推薦的單一項目或一整排項目;獎勵是諸如觀看時間、回訪、購買等訊號。把它框成 MDP,能讓智能體去重視那些日後才會回報的動作,例如現在端出一個小眾項目以建立長期信任。由於你無法在真實使用者身上自由實驗,正式系統大量倚賴從記錄資料做的離線 RL,並搭配離策略修正。

獎勵的選擇會強力左右行為,所以這既是技術決定、也是倫理決定。一味最大化原始參與度,可能放大標題黨、同溫層與成癮迴圈,這正是推薦系統的獎勵設計值得認真審視的原因。

又称
sequential recommendationRL recommenders