強化學習理論
UCRL(信賴上界強化學習,upper confidence reinforcement learning)
UCRL 是在未知 MDP 中拿到可證後悔界的標準做法,建立在一句簡單口號上:面對不確定時保持樂觀。智能體持續記錄報酬與轉移的統計,圍著它們建信賴區間,然後假裝環境是這些區間內「最好的可能」來規劃。照這個美好模型行動,自然會把智能體推向它仍不確定的狀態。
具體而言,UCRL2 以回合進行。每回合開始時,它構造一組與資料相符的可信 MDP,挑出最樂觀的那個,用延伸價值迭代算出其最優策略,並一直執行到某個狀態–動作計數翻倍,再重新規劃。這種樂觀驅動的探索換來大約「直徑乘以 √(S·A·T)」量級的後悔界,接近 minimax 地板。後驗抽樣的變體能更簡單地達到類似保證。
這些保證很漂亮,但演算法很少原封不動地大規模執行:在整組信賴集合上規劃很昂貴,而且界假設的是表格式或結構緊密的 MDP。它持久的貢獻,是支撐絕大多數現代探索方法的那條樂觀原則。
\tilde{O}\big(D\,S\sqrt{A\,T}\big)
UCRL2 的後悔界;D 是 MDP 的直徑,即狀態間最壞情況的移動時間。
又稱
另見