學習範式
聯邦學習(federated learning)
/ FED-er-ay-tid LER-ning /
設想一群醫院,都想要一個更好的診斷模型,卻在法律和倫理上被禁止彼此分享病歷。聯邦學習提供了一條路:與其把所有人的原始資料匯到一處,不如把模型的副本送到每份資料所在的地方,在本地訓練,然後只把「學到的東西」匯總回來——資料本身從不外傳。
它的循環是這樣的。一台中央伺服器持有一個共享模型,把它發給眾多參與方——手機、醫院、銀行。每一方都在自己的私有資料上訓練這個模型,再傳回僅僅是由此得出的參數更新(描述模型如何變化的一組數字),而不是任何原始樣本。伺服器把所有這些更新平均成一個改進過的全域模型,再發出去。一輪又一輪,模型從每個人的資料裡學習,而那些資料始終留在各自的裝置或機構裡。
它的吸引力在於隱私與務實:那些敏感的、受監管的、或乾脆大到搬不動的資料,仍能為一個共享模型出一份力。但它並不自動就既私密又輕鬆。共享的更新有時能洩露出關於底層資料的資訊,所以聯邦學習常要配上加密或加雜訊之類的額外保護。它也更難訓——各參與方的資料各不相同、裝置會掉線、通訊是個瓶頸——因此它通常是用一些準確度和大量工程複雜度,去換來它所購得的那份隱私。
手機鍵盤的下一詞預測,會從你的打字習慣裡學著變好——但你的簡訊從不離開手機。每天夜裡,你的手機用你的輸入訓練那個共享模型,只上傳參數的變化。伺服器把來自數百萬部手機的更新平均成一個更好的模型。你的私人簡訊,自始至終都留在你的裝置上。
把模型搬到資料那裡,而不是把資料搬到模型這裡。
把原始資料留在本地,並不等於隱私就有了保障——共享的參數更新可能洩露資訊,所以聯邦學習通常還需加密或加雜訊之類的額外保護,才算真正安全。
又稱
另見