学习范式

联邦学习(federated learning)

/ FED-er-ay-tid LER-ning /

设想一群医院,都想要一个更好的诊断模型,却在法律和伦理上被禁止彼此分享病历。联邦学习提供了一条路:与其把所有人的原始数据汇到一处,不如把模型的副本送到每份数据所在的地方,在本地训练,然后只把「学到的东西」汇总回来——数据本身从不外传。

它的循环是这样的。一台中央服务器持有一个共享模型,把它发给众多参与方——手机、医院、银行。每一方都在自己的私有数据上训练这个模型,再传回仅仅是由此得出的参数更新(描述模型如何变化的一组数字),而不是任何原始样本。服务器把所有这些更新平均成一个改进过的全局模型,再发出去。一轮又一轮,模型从每个人的数据里学习,而那些数据始终留在各自的设备或机构里。

它的吸引力在于隐私与务实:那些敏感的、受监管的、或干脆大到搬不动的数据,仍能为一个共享模型出一份力。但它并不自动就既私密又轻松。共享的更新有时能泄露出关于底层数据的信息,所以联邦学习常要配上加密或加噪声之类的额外保护。它也更难训——各参与方的数据各不相同、设备会掉线、通信是个瓶颈——因此它通常是用一些准确度和大量工程复杂度,去换来它所购得的那份隐私。

手机键盘的下一词预测,会从你的打字习惯里学着变好——但你的短信从不离开手机。每天夜里,你的手机用你的输入训练那个共享模型,只上传参数的变化。服务器把来自数百万部手机的更新平均成一个更好的模型。你的私人短信,自始至终都留在你的设备上。

把模型搬到数据那里,而不是把数据搬到模型这里。

把原始数据留在本地,并不等于隐私就有了保障——共享的参数更新可能泄露信息,所以联邦学习通常还需加密或加噪声之类的额外保护,才算真正安全。

又称
联邦学习聯邦學習collaborative learning