隨機圖與網路

優先連接與無標度網路(preferential attachment and scale-free networks)

/ BAR-ah-bah-shee AL-bert /

優先連接是一個生成式增長模型,解釋網路為何發展出重尾(冪律)度數分布:新節點偏好連到已連得好的節點,故高度數頂點累積更多邊——「富者愈富」。不同於以法令強加度數分布的組態模型或 Chung-Lu,優先連接把冪律當成一條簡單局部規則的湧現後果而產生。它回答的問題是:透過什麼機制,網路可能有機地長出樞紐與無標度結構?

典範的 Barabasi-Albert 模型逐頂點生長一張圖。每一步來一個新頂點並連到 m 個既有頂點,選每個目標的機率正比於其當前度數。因高度數頂點更可能被選中,它們長得更快,而仔細的分析(此模型本質上是甕/波利亞過程,與較早的 Yule 與 Simon 過程相關)顯示度數分布收斂到冪律 P(度數 = k) 對大 k 正比於 k^(-3)——指數 3 對此規則的線性優先連接是普適的。「無標度」之名意指度數分布沒有特徵尺度:其尾在每個尺度上看來相同,這是冪律的標誌。隨之有兩個結構後果:網路有少數巨大樞紐(最老、連得最多的頂點,「先行者優勢」),且典型距離超小,為 (log n)/(log log n) 階,因樞紐作為捷徑。嚴格理論(Bollobas-Riordan 等)把冪律指數、最大度數(其增長如 n^(1/2))與直徑精確化。

優先連接之所以重要,是因為它是經驗上無所不在的冪律最簡單的動態解釋,並把隨機圖繫於增強過程、甕模型與紀錄理論。它是最常被援引來解釋網頁、引用網路與蛋白質交互作用結構的模型。誠實的提醒分量不輕。其一,「無標度」被過度宣稱:嚴格的統計工作(Broido-Clauset)顯示強冪律在真實資料中遠比此模型的流行所暗示的罕見;許多網路只是近似重尾,或對數常態也擬合得一樣好。其二,指數 3 是線性優先連接所特有的;次線性連接(機率正比於 度數^alpha 且 alpha < 1)給出伸展指數而非冪律,而超線性連接(alpha > 1)給出單一頂點連到幾乎所有東西——故冪律對精確的連接規則並不穩健。其三,此模型如常陳述者不產生聚類、局部結構樹狀(除非修改),故如其他易處理模型一樣,錯失真實社交網路的三角形豐度。

從少數頂點開始,逐個加入節點,每個連到 m = 2 個較早的頂點,選取機率正比於當前度數。n 步後度數分布 whp 接近 P(度數 = k) 約 2 m (m+1) / (k(k+1)(k+2)),它衰減如 k^(-3)。最早的那幾個頂點因有最多時間累積連結,最終成為度數約 n^(1/2) 階的樞紐。

線性優先連接產生 k^(-3) 冪律與 n^(1/2) 大小的樞紐——但該指數對規則很脆弱。

「無標度」被廣泛過度宣稱:強冪律在真實資料中比此模型的名氣所暗示的更罕見,且指數 3 是線性連接所特有(次線性給伸展指數,超線性給單一主導樞紐)。基本模型也無聚類。

又称
Barabasi-Albert modelrich-get-richerYule processpower-law networkscale-free network優先連接無標度網路冪律網路富者愈富