联邦隐私(federated privacy)
/ FED-uh-ray-tid PRY-vuh-see /
联邦隐私,通常通过「联邦学习」来实现,它把训练模型的常规配方整个翻转过来。它不再把每个人的原始数据都拉到一个中央大堆里、在那里学习,而是把模型派到数据本就所在之处——你的手机、某家医院自己的服务器——让它在本地学习,再只把「学到的东西」(一些小小的数学更新)带回来,原始数据始终不动。想象一位厨师,想从一百个家庭厨房里取经,却从不踏进任何一间:每家各自在自己的厨房里做菜,寄回来的只是他们对菜谱的微调。
从机制上看:一台中央服务器把当前的模型发给成千上万台设备;每台设备用自己的私有例子把模型改进一点点;设备只把它们的参数更新传回来;服务器把这些更新平均成一个更好的共享模型,然后循环往复。你的照片、消息或病历,自始至终不离开你的设备。这正是为什么手机能学会预测你的下一个词,也是为什么那些依法不能共享患者档案的医院,仍可以联合训练出一个诊断模型。
它为何重要:联邦学习把原始数据留在本地,从而绕开了一整类数据泄露,也让本来在法律上无法合作的机构得以协作。但是——这是许多宣传一笔带过、却必须诚实说清的要害——「联邦」并不自动等于「隐私」。模型更新本身就可能泄露出产生它们的那些数据的信息;研究者已经证明,有时仅凭这些更新就能反推出训练样本。所以现实中的系统会把联邦与差分隐私、加密聚合等其他防护手段结合起来。把数据留在设备上,是一个有力的开端,却不是一份完成了的保证。
你手机的键盘发现你经常打出一个它原本不认识的俚语词。某个夜里,趁充电时,它根据你的打字算出一个微小的模型更新,只上传这个更新——而非你的消息。数百万台手机都做着同样的事,于是那个共享的键盘模型悄悄变得更好,与此同时,没有任何一条消息离开过任何一台手机。
「学到的东西」上路了,原始数据却留在家中。(但那「学到的东西」本身仍可能泄露——故需额外的防护。)
常见的夸大:「联邦=隐私」。单凭它自己,并不成立。它的要点是数据留在本地,但上传的更新仍可能把数据泄露出去;而一个心怀恶意或被攻陷的中央服务器,更有许多可乘之机。联邦降低了暴露面,却不会在没有额外技术的情况下将其消除。