資料最小化:別搬動訊號
最便宜的防禦,就是根本不暴露資料。裝置端(邊緣)解碼在植入物或穿戴式處理器上執行模型,只送出低維度的結果 — 一個游標速度、一個選定的字母 — 而從不送出原始訊號;不曾離開的東西,就無從被攔截。但模型仍需向眾人學習,而聯邦式解碼透過交換更新量而非資料來訓練共享模型:每台裝置在自己的紀錄上運算,只送出梯度。問題在於梯度本身可被反演,以部分重建其底層資料,因此單靠聯邦是必要卻不充分的 — 它通常與下述的保證搭配使用。
差分隱私:一個可證明的界限
差分隱私(DP)提供了一樣罕見的東西 — 一個最壞情況、可證明的保證。其承諾是:無論是否納入任何單一個人的資料,所釋出的結果出現的機率幾乎相同。隱私預算 ε 衡量該機率被允許相差多少;ε 越小,隱私越強。你以加入經校準的雜訊來換取此保證,其尺度即查詢的敏感度(單一個人最多能改變答案多少)除以 ε。
ε-DP(附鬆弛項 δ):對任兩個僅差一人資料的資料集與任一結果集 S,其輸出分布相差不超過乘性因子 e^ε。
拉普拉斯機制即實現此事:加入與(敏感度除以預算)成正比的雜訊。敏感度越高或 ε 越小,就需要越多雜訊 — 也就越多失真。
神經 DP 中有一個微妙處居於主導:什麼算是「一個人的資料」?是單一試次、整段時段,還是整位受試者?你所保護的單位越寬,就必須加入越多雜訊。誠實地選定這個單位,正是大部分工程 — 以及大部分爭論 — 真正發生之處。
效用與隱私的前緣
至此每一種防禦都在犧牲訊號。用來隱藏私密屬性的雜訊,同時也模糊了本意的指令;一個本已逼近雜訊底限運行的解碼器,幾乎沒有餘裕可讓。誠實的思考方式是一條前緣:在每個隱私水準下,你仍能達到的最佳效用。
沒有單一的萬靈丹
這些技術可以疊加。一套實用的堆疊會把原始資料留在裝置端、以聯邦方式跨使用者學習、以 DP 保護共享模型,並對任何必須傳輸者加密。每一層各自涵蓋不同的攻擊;沒有任何一層能單獨成事。