統計學習理論
不可知學習
最初的 PAC 模型假設真理就住在你的假設類別之內——一個令人安心卻不切實際的前提。不可知學習放棄了它。它承認世界可能有雜訊、標記可能根本不是輸入的確定性函數、而你的類別可能根本就錯了。誠實的目標於是變成相對的:做到幾乎和你類別所能提供的最佳假設一樣好(無論那個最佳是什麼),而不是去追逐一個可能並不存在的完美。
固定一個任意的輸入與標記之聯合分布,並令類別內可達到的最佳誤差(近似誤差)為真實風險在類別上的下確界。若某演算法以一減 delta 的機率,用關於準確度與信賴度多項式的樣本數,輸出一個真實風險至多為「該類最佳誤差加 epsilon」的假設,它就不可知地 PAC 學習了該類別。總誤差因此拆成近似誤差(類別的內在侷限,資料無法消除)與估計誤差(有限樣本造成的落差,即 epsilon 所控制者)。這正是偏差—變異數分解的形式化棲所。
不可知學習是幾乎所有機器學習的現實設定,因為沒有任何有限類別能精確捕捉真實。它的樣本複雜度同樣由容量(如 VC 維度、Rademacher 複雜度)主宰,但速率會退化:估計誤差以慢的一除以根號 m 縮放,而非可實現情形的一除以 m,因為你必須估計一個非零的最優風險。在計算上,不可知學習往往遠難於可實現學習——在標準假設下,即使不可知地學習半空間這類簡單類別也是難解的。
又称
另见