應用:貝氏推論、資訊與模擬

最大概似估計(maximum likelihood estimation)

你有資料,還有一族以某個未知參數標號的候選模型,而你想挑出最好的那個。最大概似估計做了最自然的選擇:挑出那個參數值,使得你「實際觀測到」的資料最有可能發生。這是「讓證據最不令人意外的解釋」的原則,也是頻率派統計中佔主導地位的估計法,以及機器學習的一根支柱。

機制如下。寫下概似 L(theta) = p(data given theta)——你觀測到的資料的機率,當成參數 theta 的函數來看。最大概似估計就是使 L 最大的那個 theta。實務上你幾乎總是改去最大化對數概似 ln L(theta),因為資料通常獨立、概似是個連乘積,取對數把它變成連加(i=1 到 n 求和 ln p(x_i given theta)),微分起來容易多了。然後你令導數為零並求解。例如,n 次獨立白努利試驗給出 s 次成功,最大化對數概似得到妙不可言、直覺十足的答案 theta-hat = s/n,即樣本比例;對常態資料,均值的 MLE 就是樣本平均。

MLE 之所以佔主導,靠的是良好的大樣本行為:在溫和條件下它是一致的(隨 n 增長它逼近真值)、漸近常態、且漸近有效(在極限下沒有競爭者的變異數更小)。它也與貝氏世界乾淨地相連——MLE 是平坦先驗下的後驗眾數。但要誠實面對它的侷限:小樣本時 MLE 可能有偏(常態變異數的 MLE 除以 n 而非 n - 1,平均而言偏小),模型彈性大時它會過度配適,而它的樂觀完全建立在模型設定正確之上——最大化一個錯誤模型的概似,你得到的是最好的錯答案。

在一枚正面機率 p 未知的硬幣上,10 擲觀測到 7 正面。概似正比於 p^7 (1-p)^3。取對數、微分、令為零得到 7/p - 3/(1-p) = 0,解出 p = 7/10 = 0.7——這個值使觀測到的序列最有可能,且恰好就是樣本比例。

挑出使觀測到的資料最有可能的參數——通常是藉由最大化對數概似。

MLE 只跟模型一樣好:模型正確時它在大樣本下一致且有效,但小樣本時可能有偏(它把變異數估計除以 n 而非 n-1),而若模型設定錯誤,它會自信地配適那個錯誤模型。

又称
MLEmaximum likelihood最大概似法最大概似估計量