← 返回 2026-10-03 简报

迈向可证明隐私保护的联邦数据学习

Toward provably private learning from federated data

语音播报
摘要
事件:Google Research推出基于可信执行环境的新一代联邦学习系统,通过TEE实现可验证的隐私保护并提升训练效率。 要点:利用TEE提供远程证明与机密性,结合公开透明日志记录访问策略,确保数据仅在被授权时间内解密处理。 影响:Gboard已采用该系统,获得显著更快的计算速度及更强隐私保障,为行业建立无需信任服务器的联邦学习新标准。

首页 博客
迈向可证明的联邦数据隐私学习

2026年10月2日

凯瑟琳·达利(Katharine Daly),软件工程师,丹尼尔·拉梅奇(Daniel Ramage),研究总监,Google Research

我们宣布推出一种新的联邦学习系统,该系统在将计算任务转移至服务器以提高训练速度、准确性和设备覆盖率的同时,提供可外部验证的隐私保障。

2017年,谷歌推出了联邦学习(Federated Learning, FL)这一机器学习技术,它能够在去中心化且私有的数据上训练模型。该技术已被用于赋能诸多日常实用功能,包括Gboard上的下词预测和智能撰写、Google Messages中的回复建议以及Android系统中的智能文本选择。

我们的联邦学习系统开发遵循四项核心隐私原则:(1)数据最小化,(2)数据匿名化,(3)透明度与控制权,以及(4)可验证性与可审计性。多年来在匿名化方面的研究与开发,通过矩阵分解DP-FTRL(MF-DP-FTRL)算法以及结合安全聚合的分布式差分隐私(Differential Privacy, DP),为生产环境中的模型带来了强有力的差分隐私保障。2025年,我们引入了一种基于这四项原则的联邦学习演进定义:

联邦学习(FL)是一种机器学习场景,多个实体(客户端)在服务提供者的协调下协作解决机器学习问题。一个完整的联邦学习系统应使客户端能够对其数据、允许访问其数据的负载集合以及这些负载的匿名化属性保持完全的控制权。联邦学习系统应为其数据由联邦学习客户端管理的相关用户提供适当的透明度与控制权。

在《迈向可证明的联邦数据隐私学习》一文中,我们宣布了我们下一代联邦学习系统的发布,该系统利用可信执行环境(Trusted Execution Environments, TEEs)提供完全可验证且可审计的数据匿名化保障。在TEE中运行的逻辑具备远程可证明性(第三方可以验证正在执行的逻辑),同时获得机密性(其内部状态无法被观察)和完整性(逻辑不会被干扰),当然这需以当前一代TEE的限制为前提。我们全新的基于TEE的联邦学习系统建立在TEE在单台机器层面提供的这些特性之上,构建了一个完全可验证的端到端联邦学习系统,实现了更强的隐私保障和更高的准确性。Gboard已经采用了这一新系统,并受益于比我们要之前的联邦学习系统快得多的计算时间。

利用单个TEE构建可验证私有的联邦学习系统

我们的基于TEE的联邦学习系统建立在我们早期在机密联邦分析和可证明隐私洞察方面工作的技术基础之上。

该系统协调四个核心操作概念:

数据上传:客户端设备在本地对训练样本进行加密并上传。这些设备会预先授权一个访问策略,该策略定义了允许处理此数据的可信执行环境(TEE)计算集合,且这些计算仅发布匿名化结果。客户端要求将访问策略发布到公共透明度日志中。

密钥管理与策略验证:由实施 RAFT 共识协议的 TEE 集群组成的密钥管理系统(KMS),仅向与访问策略中的计算相匹配的服务端 TEE 工作负载提供解密密钥。

工作负载执行:一个数据处理 TEE 执行实现训练循环的 Python 程序。这个“根”Tee 将可并行化的子任务委派给一组工作器 TEE 集群。分布式逻辑使用联邦语言(Federated Language)表达,这是一种源自 TensorFlow Federated 的开源、框架无关的编排语言,它曾驱动我们早期的联邦学习系统。训练循环会定期向数据分析师发布匿名化的模型权重。

容错恢复:Python 程序在每轮训练结束时保存由 KMS 加密的恢复状态。这可用于从间歇性的根节点或工作器故障中恢复,而不会泄露任何额外的隐私敏感信息。

该图表展示了数据在系统中的流动过程,以及验证系统上运行的工作负载隐私保证所需的步骤。

有关基于 TEE 的联邦学习系统设计的更多详细信息,请参阅我们的白皮书《迈向可证明隐私保护的联邦数据学习》(Toward provably private learning from federated data)。

基于 TEE 的联邦学习如何加强隐私保护

在早期的联邦学习系统中,设备数据被上传用于即时聚合,但外部观察者无法验证数据是否从未被记录或检查。后来,安全聚合允许通过密码学手段保护上传过程,但它与最先进的中心差分隐私(DP)保证不兼容。我们新的基于 TEE 的系统代表了我们持续努力完全消除对服务器运营商信任的下一个里程碑。

在我们新的基于 TEE 的联邦学习系统中,工作负载运营商只能看到指标和差分隐私模型权重。从设备收集的加密训练数据只能在运行访问策略中表示的 Python 训练程序的 TEE 内部解密和处理,且仅在上传后的有限时间内有效。

公共透明度日志与可重现构建

参与我们新的基于 TEE 的联邦学习系统的设备知道可能访问其上传数据的服务器工作负载的完整集合。代表这些潜在未来服务器工作负载的访问策略被发布到 Rekor(一个公共透明度日志),外部审计员能够观察这些日志,以跟踪设备可能参与的服务器端工作负载的完整集合。

我们联邦学习系统中使用的 KMS 和数据处理二进制文件可以从 Confidential Federated Compute Github 仓库中发布的开源代码进行可重现构建。

带有动态侧载的可验证执行

在早期的联邦学习系统中,运行在服务端的逻辑既无法由设备也无法由审计员验证,因此我们需要被信任以正确地向梯度总和添加随机噪声,从而提供差分隐私保护。

在我们新的基于 TEE 的联邦学习系统中,发布到 Rekor 的访问策略直接描述了表达联邦学习训练逻辑的 Python 程序。为了在保持可审计性的同时保护专有模型架构和数据预处理逻辑,我们的数据处理 TEE 支持在运行时将序列化信息侧载(sideloading)到 Python 程序中。只要所有与隐私相关的逻辑都硬编码在 Python 程序中,这种侧载功能就允许必须保持专有的逻辑在 TEE 中运行,同时仍提供强大的外部可验证隐私保证(关于侧信道观察的讨论见下文)。

Gboard 如何利用基于 TEE 的联邦学习

Gboard 已部署这套基于 TEE 的联邦学习系统,推出了具有更强隐私保障和更高准确性的英语及日语下一个词预测模型。这些改进可归因于新系统设计的几个方面。

缓解昼夜可用性限制

通过在执行服务器端训练工作负载之前收集所有设备上传的数据,我们不再需要担心设备的昼夜可用性波动影响训练进度。在服务器端执行时,我们可以在程序中动态计算最优的设备参与计划,并利用它来调整其他差分隐私(DP)参数。

该图表展示了通过优化设备参与计划,新 TEE 系统能够实现更强的隐私保障和/或更小的噪声乘数。这些曲线是在两个系统上对英语下一个词预测模型进行 5000 轮训练、每轮涉及 6500 台设备群体后得出的。

训练加速

过去,训练这些联邦学习模型每个可能需要 1-2 个月的时间,进度受限于设备可用性、设备端计算能力以及同一组设备资源在多个训练工作负载之间的竞争。在新的基于 TEE 的系统中,瓶颈已转移至服务器,跨多台机器的计算并行化使我们能够实现训练时间的显著加速,目前仅受限于 TEE 资源的可用性。

未来展望?

在我们新的基于 TEE 的联邦学习系统中,客户端梯度的计算被移至服务器端,从而克服了早期系统中与设备端计算资源相关的限制。这为使用联邦学习技术训练越来越大的模型铺平了道路。将 TEE 与加速器集成将在此类用例中发挥重要作用。

上述描述的系统不仅能够以可验证的方式执行联邦学习训练工作负载,还能执行任何可以用 Python 表达的工作负载。我们正在尝试在此基础设施上运行其他类型的工作负载,例如合成数据生成工作负载。另一个探索领域是:使用能够执行任意 Python 的数据处理 TEE,与我们专门用于大语言模型(LLM)推理等功能的其他数据处理 TEE 相结合。

这项工作朝着严格证明服务器端处理保护个人隐私迈出了重要一步。由于外部验证者能够检查我们在 Google 运行的确切代码,因此我们能够提供强有力的保证,即数据在服务器端的处理方式与描述完全一致。我们预计,未来的 TEE 硬件以及针对缓解侧信道观测的持续研究,将为动态加载的工作负载提供更深的防护,抵御恶意服务器端攻击。我们 anticipate(预期)像我们这样的系统未来可能会附带差分隐私算法和系统组件软件实现的完整正确性证明。

致谢

作者感谢为基础设施设计和实施做出贡献的合作者:Arun Ganesh、Brendan McMahan、Brett McLarnon、Chunxiang (Jake) Zheng、Emily Glanz、Maya Spivak、Michael Reneer、Nova Fallen、Stefan Dierauf、Suxin Guo、Timon Van Overveldt、Yu Xiao、Zachary Charles 和 Zachary Garrett。我们还要感谢支持 Gboard 集成的紧密合作伙伴:Haicheng Sun、Heng Su、Jianpeng Hou、Liyang Jiang、Noriyuki Takahashi、Wenzhi Mao、Xiaojuan Fang、Yanxiang Zhang、Yingjie Liu、Yuanbo Zhang 和 Yun Wang。这项工作得到了 Corinna Cortes、Shumin Zhai 和 Yossi Matias 的支持。我们还要感谢 Maysam Moussalem 对本文撰写的反馈。

标签:
移动系统

安全、隐私与滥用预防

软件系统与工程
快速链接
论文
分享
其他相关文章

2026 年 6 月 26 日

通过冻结多令牌预测在 Pixel 上加速 Gemini Nano 模型
机器智能 ·

移动系统 ·

自然语言处理

2026年6月10日

用于审计机器遗忘的新框架
算法与理论 ·

负责任的AI ·

安全、隐私与滥用预防

2026年5月27日

通过零信任聚合实现私有分析
安全、隐私与滥用预防

本条评分 10.6 score-v1
  • 来源权威 8
    注册表 priority=8(Google Research)
  • 时效 2.594
    发布 7.5 小时前,衰减到 2.59/3.0
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)

首次收录 · 2026-10-03 · 10.59 分

原文链接:https://research.google/blog/toward-provably-private-learning-from-federated-data/
来源:Google Research
以上内容由 AI 自动翻译,仅供参考。
← 返回简报