最大似然估計(maximum likelihood estimation)
在一個參數所有可能的取值之中,哪一個讓你實際觀測到的資料最有可能出現?這唯一的問題就是最大似然的全部想法。它把一種直覺形式化:你所見的最佳解釋,就是在其之下「你所見的事最不令人意外」的那個;它也把擬合模型變成一個定義明確的最佳化問題。
給定資料,以及一個帶參數 theta、能對任何可能資料集賦予機率(或機率密度)的模型,似然 L(theta) 就是把那個機率當作 theta 的函數、並固定住已觀測資料來讀。最大似然挑出使 L 最大的 theta_hat,實務上就是最大化對數似然 ln L——它是求和而非連乘、在數值上友善得多——藉由解 d(ln L)/d theta = 0。峰的陡峭程度決定不確定度:變異數約為 -d^2(ln L)/d theta^2(費雪資訊)的倒數,所以尖銳的似然峰意味著參數被精確定出,平坦的峰則意味著約束很差。
這是物理中最一般、最廣用的估計原理,而最小平方法正是它在「獨立高斯誤差」下的特例,因為最大化 exp(-chi^2 / 2) 就等於最小化 chi^2。它是粒子物理擬合、微中子振盪分析與宇宙學參數萃取的基礎。誠實的警告是:似然是「給定參數下資料的機率」,而非「給定資料下參數的機率」;要把它變成關於 theta 的機率陳述,需要貝氏定理與一個先驗。而且最大似然的良好性質(例如無偏)只在漸近意義下成立,因此對小樣本、或在物理邊界附近,它可能有偏或行為不良。
從時間 t 內觀測到的 n 次放射性衰變,衰變率的最大似然估計就只是 lambda_hat = n / t,這是藉由最大化「恰好觀測到 n 個計數」的卜瓦松似然而得。
最大化卜瓦松似然,還原出那個顯而易見的估計:速率 = 計數 / 時間。
似然 L(theta) 是「給定參數下資料的機率」,而非「給定資料下參數的機率」;要把它變成關於 theta 的機率陳述需要貝氏定理與先驗,而最大似然的無偏性只在漸近意義下成立。