1. 投毒攻击的定义与目标

  • 目标:破坏模型性能(如降低准确率)或植入后门(如特定输入触发错误输出)。

  • 攻击者角色:恶意客户端(伪装成合法参与者)或中间人(篡改通信数据)。


2. 攻击发生的阶段

投毒攻击可发生在联邦学习的以下阶段:

(1) 本地训练阶段
  • 方式:恶意客户端在本地数据中注入有毒样本(如错误标签、异常特征)。

  • 影响:本地训练的梯度/参数携带攻击意图,上传至服务器后污染全局模型。

  • 示例:在医疗FL中,恶意客户端将“健康”影像标记为“癌症”,导致模型误诊。

针对本地训练阶段,应该怎么区分客户端是恶意还是好意呢?

(2) 参数上传阶段
  • 方式:攻击者伪造或篡改梯度(如放大特定参数值)。

  • 漏洞利用:服务器无法直接验证原始数据,仅能接收加密/噪声化的参数。

(3) 全局聚合阶段
  • 方式:通过设计恶意梯度,影响聚合结果(如“梯度反转”使模型偏向攻击目标)。

  • 经典攻击

    • Krum攻击:操纵梯度使得鲁棒聚合算法(如Krum)选择恶意参数。

    • 后门插入:通过持续微小调整梯度,在特定输入上植入隐藏行为。


3. 为什么投毒攻击能成功?

投毒攻击利用联邦学习的以下核心漏洞

漏洞类型具体原因
数据不可见性服务器无法检查客户端的原始数据,难以区分恶意样本与合法数据。
模型更新依赖性全局模型依赖客户端上传的梯度,恶意梯度会被聚合算法采纳。
鲁棒聚合的局限性即使使用鲁棒聚合(如Median/Krum),攻击者仍可通过精心设计梯度绕过检测。
差分隐私的副作用DP添加的噪声可能掩盖恶意梯度的异常,反而帮助攻击者隐蔽行为。

4. 典型投毒攻击方法

(1) 标签翻转攻击(Label Flipping)
  • 操作:恶意客户端将本地数据的标签反转(如“猫”→“狗”)。

  • 效果:全局模型在测试时对特定类别准确率暴跌。

(2) 梯度反转攻击(Gradient Inversion)
  • 操作:上传与正常梯度方向相反的参数,抵消合法客户端的贡献。

  • 效果:模型收敛缓慢或完全失效。

(3) 后门攻击(Backdoor Attack)
  • 操作:在特定样本(如带有隐藏图案的医疗影像)上植入错误输出。

  • 特点:不影响整体模型性能,仅在触发时生效,难以检测。

5. 以标签翻转为例展示攻击流程


6. 防御措施

(1) 鲁棒聚合算法
  • 方法:使用Median/Krum/Bulyan等算法过滤异常梯度。

  • 局限:攻击者可能通过协同攻击(多个恶意客户端)绕过。

(2) 差分隐私+检测
  • 方法:在DP添加噪声后,统计梯度分布(如L2范数)检测离群值。

  • 优势:噪声可能增加攻击成本,但需平衡隐私预算与安全性。

(3) 客户端验证
  • 方法:要求客户端提供计算证明(如ZKP),验证梯度与本地数据一致性。

  • 挑战:计算开销大,可能泄露数据特征。

(4) 动态权重调整
  • 方法:根据客户端历史行为动态降低可疑客户端的聚合权重。


7. 图示:投毒攻击与防御


8、以医疗联邦学习(肿瘤诊断)为例:投毒攻击与防御全解析


1. 应用场景

目标:多家医院协作训练一个共享的肿瘤诊断模型,数据保留在本地(如CT影像、病理报告),仅上传模型参数。
参与方

  • 合法医院:提供真实数据,共同改进模型。

  • 攻击者:某恶意医院或渗透的客户端,意图破坏模型或植入后门(如将“良性”误判为“恶性”)。


2. 投毒攻击发生的阶段与具体操作

投毒攻击可发生在以下两个核心阶段:

(1) 本地训练阶段

攻击方式

  • 数据投毒:恶意医院篡改本地数据集:

    • 标签翻转:将“良性肿瘤”样本标记为“恶性肿瘤”,或反之。

    • 样本注入:添加伪造的CT影像(如叠加特定噪声图案触发误判)。

  • 梯度篡改:训练后故意放大特定神经层的权重(如影响肿瘤边缘特征的卷积核)。

攻击效果

  • 上传的梯度携带恶意信息,全局模型在聚合后对特定病例的准确率显著下降或出现后门行为。

示例
恶意医院A将100张健康肺部CT标记为“肺癌”,本地训练后梯度 GAGA​ 偏向“假阳性”,聚合后模型对健康人误诊为癌症。

(2) 参数上传阶段

攻击方式

  • 梯度伪造:直接构造异常梯度(如极端值或反转方向),无需真实数据。

  • 协同攻击:多个恶意客户端上传相似恶意梯度,迫使聚合算法采纳。

攻击效果

  • 即使合法医院的梯度正确,恶意梯度仍可主导聚合结果(如均值聚合被拉偏)。

示例
恶意医院B和C上传梯度 GB=−G正常GB​=−G正常​,导致全局模型权重“震荡”无法收敛。


3. 投毒攻击的底层漏洞
漏洞医疗场景中的风险
数据不可见性医院间无法检查彼此数据,恶意样本(如伪造CT)无法被直接发现。
聚合算法盲区简单均值聚合易受极端梯度影响;鲁棒聚合(如Krum)在协同攻击下可能失效。
DP的副作用为保护隐私添加的噪声可能掩盖恶意梯度的异常,反而帮助攻击者隐蔽。

4. 防御措施与实施方案
(1) 鲁棒聚合算法
  • 方法

    • Krum/Multi-Krum:选择最接近多数梯度的参数,过滤离群值。

    • Median/Bulyan:用中位数或迭代剔除异常值替代均值。

  • 医疗适配

    • 对肿瘤诊断关键参数(如分类层梯度)设置更严格的聚合阈值。

(2) 差分隐私 + 异常检测
  • 方法

    1. 在客户端上传前添加DP噪声(满足隐私预算 ϵϵ)。

    2. 服务器端检测梯度统计量(如L2范数、余弦相似度)。

  • 示例

    • 若某医院梯度范数 > 3倍标准差,触发人工审核。

(3) 客户端认证与行为监控
  • 方法

    • 双向TLS认证:确保只有授权医院设备参与。

    • 历史行为分析:记录各医院梯度更新模式,突变动作为风险信号(如突然频繁提交)。

  • 医疗场景需求

    • 医院需提供机构数字证书,联邦学习平台维护可信名单。

(4) 后门防御专项方案
  • 方法

    • 神经元剪枝:移除模型中对后门触发图案敏感的神经元。

    • 触发样本检测:在聚合前用对抗样本检测工具(如STRIP)扫描梯度。

(5) 数据质量预校验(可选)
  • 方法

    • 要求医院上传数据的元统计信息(如类别分布、影像尺寸),与历史数据对比。

  • 挑战

    • 需平衡隐私泄露风险(如差分隐私处理元数据)。


5. 防御流程图示


6. 医疗场景的特殊考量
  • 误诊容忍度低:需更高强度的鲁棒聚合(如Bulyan)牺牲部分收敛速度换取安全性。

  • 合规性:防御措施需符合HIPAA/GDPR,如DP噪声预算需通过伦理审查。

  • 紧急响应:发现攻击后,需冻结模型并追溯恶意医院的法律责任。


Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐