深度強化學習基礎
深度強化學習(deep reinforcement learning)
傳統強化學習用一張表格存放價值,每個狀態一格。這在井字遊戲上行得通,但只要狀態變成影像、感測器訊號或數不清的棋盤局面,表格就崩潰了。深度強化學習把表格換成神經網路:智能體不再查表,而是直接從原始輸入算出價值,學習就是微調網路權重,讓它的猜測愈來愈準。同一套能讓網路從像素認出貓的機制,也能讓智能體估計眼前這個畫面有多好。
具體做法是:拿任何一個強化學習演算法——Q 學習、策略梯度、行動者–評論家——把它的查表換成擁有數百萬參數的函數近似器,再以源自貝爾曼方程或策略目標的損失,用梯度下降來訓練。好處是泛化:網路在相似狀態間共享結構,所以一個情境學到的經驗能遷移到沒見過的情境。代價是脆弱:表格能容忍的移動目標與相關資料,會讓天真的深度強化學習變得不穩定,這也正是本領域其餘條目存在的理由。
又称
另见