数学基础

最大似然估计(maximum likelihood estimation)

/ MAK-sih-mum LYKE-lee-hood es-tih-MAY-shun /

最大似然估计是一套挑选模型设置的配方,挑出的设置能让你观测到的数据显得最不意外。它的逻辑很像侦探断案:你手上有证据(数据),又有几名嫌疑解释(各种可能的参数取值),你便把那个「最有可能恰好产生出你所见情形」的解释加冕为真凶。一句话:选那组参数,使你实际拿到的数据在它之下概率最大。

假设你抛一枚弯掉的硬币 10 次,得到 7 个正面。这枚硬币暗藏的偏向是多少?最大似然的回答是:那个让「10 次里出 7 个正面」尽可能概率最大的偏向——算下来,合情合理地,正是 0.7。你把「你这批数据的概率」写成未知参数的一个函数,再拧动旋钮,直到那个概率达到顶峰。实践中人们最大化的是这个概率的对数(对数似然),因为把许多小数的连乘变成连加,会让数学和计算机都舒坦得多。

这条原则悄悄垫在机器学习的一大片底下。许多模型的训练——从逻辑回归到神经网络——都是乔装打扮过的最大似然,而最小化那个常见的交叉熵损失,恰恰就等价于最大化似然。所以当一个分类器「学习」时,它往往不过是在搜寻那组「最能解释训练数据」的参数。一句实话上的局限:最大似然可能过拟合,把它碰巧见到的那批数据攥得太紧;而且它对「你该有多大信心」一言不发——它只递给你一个最佳猜测,不附带任何误差棒。一旦再添上一份先验信念,你就跨进贝叶斯的世界了。

抛一枚弯掉的硬币 10 次,看到 7 个正面。如果硬币真正的正面概率是 0.5,出现 7 个正面是可能的,却不是最有可能的个数。试试 0.6、0.7、0.8,分别算一算「10 中出 7」在各自之下有多大概率;这个概率恰好在 0.7 处达到顶峰。于是这枚硬币偏向的最大似然估计就是 0.7——数据对它自己作出的最佳猜测。

十抛七正:让这一确切结果概率最大的偏向是 0.7——这就是最大似然估计。

似然不等于概率:概率问的是「在固定参数下,数据有多大可能」,而似然反过来问「哪组参数最能解释固定的数据」。最小化交叉熵损失——分类器的标准选择——在数学上和最大似然是同一回事。

又称
最大似然估计极大似然估计最大概似估計MLEmaximum likelihood