聯邦隱私(federated privacy)
/ FED-uh-ray-tid PRY-vuh-see /
聯邦隱私,通常透過「聯邦學習」來實現,它把訓練模型的常規配方整個翻轉過來。它不再把每個人的原始資料都拉到一個中央大堆裡、在那裡學習,而是把模型派到資料本就所在之處——你的手機、某家醫院自己的伺服器——讓它在本地學習,再只把「學到的東西」(一些小小的數學更新)帶回來,原始資料始終不動。想像一位廚師,想從一百個家庭廚房裡取經,卻從不踏進任何一間:每家各自在自己的廚房裡做菜,寄回來的只是他們對菜譜的微調。
從機制上看:一台中央伺服器把當前的模型發給成千上萬台裝置;每台裝置用自己的私有例子把模型改進一點點;裝置只把它們的參數更新傳回來;伺服器把這些更新平均成一個更好的共享模型,然後循環往復。你的照片、訊息或病歷,自始至終不離開你的裝置。這正是為什麼手機能學會預測你的下一個詞,也是為什麼那些依法不能共享患者檔案的醫院,仍可以聯合訓練出一個診斷模型。
它為何重要:聯邦學習把原始資料留在本地,從而繞開了一整類資料洩露,也讓本來在法律上無法合作的機構得以協作。但是——這是許多宣傳一筆帶過、卻必須誠實說清的要害——「聯邦」並不自動等於「隱私」。模型更新本身就可能洩露出產生它們的那些資料的資訊;研究者已經證明,有時僅憑這些更新就能反推出訓練樣本。所以現實中的系統會把聯邦與差分隱私、加密聚合等其他防護手段結合起來。把資料留在裝置上,是一個有力的開端,卻不是一份完成了的保證。
你手機的鍵盤發現你經常打出一個它原本不認識的俚語詞。某個夜裡,趁充電時,它根據你的打字算出一個微小的模型更新,只上傳這個更新——而非你的訊息。數百萬台手機都做著同樣的事,於是那個共享的鍵盤模型悄悄變得更好,與此同時,沒有任何一條訊息離開過任何一台手機。
「學到的東西」上路了,原始資料卻留在家中。(但那「學到的東西」本身仍可能洩露——故需額外的防護。)
常見的誇大:「聯邦=隱私」。單憑它自己,並不成立。它的要點是資料留在本地,但上傳的更新仍可能把資料洩露出去;而一個心懷惡意或被攻陷的中央伺服器,更有許多可乘之機。聯邦降低了暴露面,卻不會在沒有額外技術的情況下將其消除。