齊夫分配(Zipf distribution)
/ ZIFF /
齊夫分配是「少數幾樣東西稱霸」的法則。把物項依出現頻率排名——詞依詞頻、城市依人口、網站依流量、財富依持有人——齊夫的模式說,排名第 k 的物項其頻率大致與 1/k^s 成正比,指數 s 在 1 附近。最常見的詞(英文的 the)大約是第二名的兩倍頻繁、第三名的三倍,依此類推。清單的頂端高聳於一條緩慢消退、由罕見物項構成的長尾之上。
精確化為排名 k = 1, 2, ..., N 上的離散分配,pmf 為 P(X = k) = (1/k^s) / H,其中 H 是歸一化的總和 H = (1/1^s + 1/2^s + ... + 1/N^s),稱為廣義調和數,加入它使機率總和為 1。單一的形狀參數 s 控制頻率隨排名下降的陡峭程度:s = 0 攤平為離散均勻,而較大的 s 使頭部愈發稱霸。齊夫是連續柏拉圖(Pareto)分配的離散手足,也是冪次律的近親;三者都描述重尾、無尺度的現象,其中平均值可能是糟糕的摘要,因為少數幾個巨人會扭曲它。
有兩個誠實的告誡值得標明。第一,真實資料往往只在排名的中段範圍服從齊夫,在最頂端與最底端偏離,所以「齊夫定律」是經驗上的規律,而非精確的律令。第二,當指數 s 等於或小於 1 且容許 N 無限制增長時,調和總和發散,均值可能不存在——這是重尾的標誌,使普通的取平均與通常的中央極限論證變得危險。
在大量英文文本中、s 接近 1 時,the 可能占所有詞的約 7%、of 約其一半、and 約三分之一——頻率追隨 1/1、1/2、1/3。少數幾個詞構成巨大占比;數千個罕見詞構成尾巴。
頻率正比於 1/k^s:高聳的頭部與長而沉重的尾巴。
齊夫是通常只在中段排名成立的經驗規律。當指數 s 至多為 1 且 N 無界時均值可能不存在,所以「平均排名」可能毫無意義。