統計學習理論

PAC-Bayes 界

與其押注在單一假設上,不如想像你隨身帶著一整個假設上的機率分布,每次預測時隨機抽一個出來。PAC-Bayes 把這種隨機化預測器的平均真實風險,界定為其平均經驗風險再加一個懲罰——而這個懲罰,正是你從先驗分布(看資料前選定)移動到後驗分布(看資料後選定)所花費的資訊量。貼近先驗,付出就少;為擬合資料而遠離,就在泛化上付出代價。

對一個先驗與任意資料相依的後驗,至少以一減 delta 的機率,後驗的期望真實風險與期望經驗風險之間的落差,被「從後驗到先驗的 Kullback–Leibler 散度」加上一個對數信賴項、再除以樣本數(通常在一個平方根之下)所界定。此界對每一個後驗同時成立,故學習者可優化後驗以最小化右端。由於散度取代了任何顯式的容量度量,這個界會自動適應演算法實際產生的後驗。

PAC-Bayes 透過利用平坦性,給出大型神經網路少數非空泛的泛化界之一:一個可被擾動而不抬升訓練誤差的後驗,與寬廣先驗之間的散度很小。它也與貝氏推論及資訊論泛化相統一,並支撐實用的正則化與自我設界學習。代價是:這些界針對的是隨機化的 Gibbs 預測器;去隨機化為單一確定性網路可能損失緊度。

\mathbb{E}_{h\sim Q}[R(h)]\le \mathbb{E}_{h\sim Q}[\hat{R}(h)]+\sqrt{\frac{\mathrm{KL}(Q\,\|\,P)+\ln\frac{2\sqrt{m}}{\delta}}{2m}}

McAllester 型 PAC-Bayes 界:後驗的經驗風險,加上一個與先驗的散度複雜度項。

又稱
PAC-Bayesian boundsPAC-Bayes 界PAC 貝氏界