数据流通的两难困境
数据作为新型生产要素,其价值在于流通。但数据流通与隐私保护似乎构成了一对不可调和的矛盾:要么数据孤岛化导致价值湮灭,要么数据汇聚流通带来隐私泄露风险。隐私计算(Privacy-Preserving Computation)试图打破这种两难:在数据不可见的前提下实现数据价值的流通。
多方安全计算MPC
多方安全计算基于密码学协议,允许多方在不泄露各自输入的情况下计算联合函数。其核心思想是将计算分解为若干基本操作(加法和乘法),每个操作都在加密的份额上执行。混淆电路(Garbled Circuit)是MPC的重要协议,通过加密和乱码化布尔电路实现任意安全计算。
MPC的安全性分为半诚实的和恶意的两种安全级别。半诚实安全假设参与方遵循协议但试图从看到的中间结果推断隐私信息;恶意安全还需要防止参与方偏离协议行为。后者代价更高,需要消息认证码和零知识证明等机制。
联邦学习
联邦学习解决了"数据不出域"环境下的跨机构模型训练问题。多方在本地训练模型,仅将加密的模型更新(梯度)发送给聚合服务器,聚合后得到全局模型。联邦学习有三种模式:横向联邦(样本不同特征相同)、纵向联邦(特征不同样本重叠)、以及联邦迁移学习(样本和特征都不同)。
联邦学习面临两个关键挑战:通信效率(梯度压缩、异步聚合)和数据异质性(Non-IID数据导致模型偏离)。FedAvg是目前最常用的聚合算法,但其IID假设在现实中往往不成立,导致性能下降。
可信执行环境TEE
TEE是CPU硬件提供的加密隔离区域(如Intel SGX、AMD SEV、ARM TrustZone),确保代码和数据在加密Enclave中运行,即使操作系统也无法查看。TEE相比纯密码学方案性能高很多,抗物理攻击能力强,但存在Enclave容量限制和侧信道攻击风险。
同态加密与差分隐私
全同态加密允许在加密数据上执行任意计算,结果解密后与明文计算一致。这一"密码学圣杯"已经被Gentry在2009年证明存在,但由于计算开销巨大(百万倍减速),目前主要局限于特定应用场景和Leveled-HE方案。
差分隐私通过在计算结果中添加噪声来保证个体不可识别性。ε(隐私预算)衡量隐私保护程度:越小保护越强但数据效用越低。Apple和Google已在其产品中大规模应用差分隐私技术。
工程实践与应用
隐私计算的工程挑战很大:MPC通信开销巨大、TEE硬件兼容性问题、联邦学习收敛困难。以联邦学习为例,百轮迭代的通信成本在TB级别。当前主流采用分层架构:底层密码学库(MP-SPDZ, SEAL)→ 隐私计算引擎(FATE, secretflow)→ 应用集成。

发表评论 取消回复