機率與貝氏方法

高斯過程(Gaussian process)

/ GOW-see-un PROSS-ess /

高斯過程,是一種「對整條曲線、而不只是對單個數字保持不確定」的辦法。大多數方法只往你的資料點中穿過一條最佳直線;高斯過程則不然,它在「一切可能合理穿過這些點的函數」之上,保留一個機率分布。想像一束扭來扭去的曲線,全都穿過你觀測到的那些點:在你有資料的地方,它們緊緊攢在一起;在資料缺失的地方,它們大大地散開。這一散開,正是模型在誠實地承認「我不知道」。

把這些曲線繫在一起的,是一個「核」——一條關於「兩個輸入有多相似」的規則。常用的選擇說:相鄰的輸入應當給出相鄰的輸出——曲線是光滑的,而非鋸齒狀的。把你的資料和核餵給高斯過程,對於任何你問起的新點,它都會吐出兩樣東西:一個預測,和一根誤差棒——也就是最可能的取值,以及一份對「自己有多沒把握」的坦白度量,而這份不確定會隨著你遠離真正觀測過的地方而自動增大。

它為何重要:那根內建的誤差棒,使高斯過程成為「當每個資料點都來之不易、而摸清自己的不確定性又至關重要」時的寵兒——調試一項昂貴的實驗、優化一道工業流程、為感測器建模。它們用極少的點便能漂亮地運作,也不需要手工設定什麼架構。誠實的癥結在於成本:標準方法的運算量隨資料點數目的立方增長,所以樸素的高斯過程在大資料集上會噎住;而它們的品質,也極度依賴於選對一個合理的核。它們是「小而珍貴的資料」的首選利器——而非用於數以百萬計的列。

用寥寥幾根勘測樁,去預測一片丘陵地形的高度。緊挨著某根樁的地方,高斯過程信心十足,誤差棒細如髮絲。在兩根相距甚遠的樁之間的半途,它仍會猜出一個平滑的高度,卻畫出一條寬寬的誤差帶——誠實地標明:中間那道谷地,可能下凹,也可能隆起。在那兒補上一根樁,誤差帶便收縮到幾乎為零。

高斯過程在資料附近信心滿滿,遠離資料則明顯地犯怵——這份不確定是白送的,而非事後補上的。

高斯過程幾乎是免費地給出不確定性,但它們的計算成本隨資料集規模的立方增長,所以若不借助近似,它們天生就不適合大資料。而且它們的預測,只在你所選的核合理時才合理——一個糟糕的核,會給出自信滿滿的胡話。

又稱
GP高斯过程高斯過程