Skip to main content
QUICK REVIEW

[论文解读] Backdoor Defense in Federated Learning Using Differential Testing and Outlier Detection

Yein Kim, Huili Chen|arXiv (Cornell University)|Feb 21, 2022
Adversarial Robustness in Machine Learning被引用 6
一句话总结

DifFense 是一种用于联邦学习的新型后门防御框架,利用差异测试生成能放大模型行为差异的对抗性输入,并采用两步 MAD 异常检测来识别恶意更新。该方法在无需事先了解攻击模式的情况下,即使在多种攻击场景下,也能实现接近零的误报率,将后门准确率降低至 4% 以下,同时保持与 FedAvg 相当的全局模型准确率。

ABSTRACT

The goal of federated learning (FL) is to train one global model by aggregating model parameters updated independently on edge devices without accessing users' private data. However, FL is susceptible to backdoor attacks where a small fraction of malicious agents inject a targeted misclassification behavior in the global model by uploading polluted model updates to the server. In this work, we propose DifFense, an automated defense framework to protect an FL system from backdoor attacks by leveraging differential testing and two-step MAD outlier detection, without requiring any previous knowledge of attack scenarios or direct access to local model parameters. We empirically show that our detection method prevents a various number of potential attackers while consistently achieving the convergence of the global model comparable to that trained under federated averaging (FedAvg). We further corroborate the effectiveness and generalizability of our method against prior defense techniques, such as Multi-Krum and coordinate-wise median aggregation. Our detection method reduces the average backdoor accuracy of the global model to below 4% and achieves a false negative rate of zero.

研究动机与目标

  • 为解决现有联邦学习防御方法的局限性,这些方法通常需要事先了解攻击场景,或存在较高的误报/漏报率。
  • 开发一种在最小假设下具有泛化能力的防御机制,特别是假设良性客户端数量多于恶意客户端。
  • 实现在不访问本地模型参数或权重的情况下检测后门攻击,提升与加密或隐私保护联邦学习系统之间的兼容性。
  • 在确保检测到所有恶意更新的同时,降低模型更新过滤中的误报率,从而保持全局模型的准确率。
  • 提供一种鲁棒且自动化的防御框架,在不同数量的攻击者和数据分布下均能保持收敛性和性能。

提出的方法

  • 使用差异测试生成合成输入,以放大客户端之间模型预测的差异,基于本地模型输出生成‘测试统计量’。
  • 通过计算这些差异输入上的预测差异,检测指示后门行为的异常。
  • 引入两步 MAD 异常检测:首先,使用改进的 MAD 算法识别潜在异常值;其次,通过精细化阈值处理步骤降低误报率。
  • 该框架在聚合前运行,基于差异测试响应中的统计偏差来过滤恶意更新。
  • 无需访问模型权重或梯度,因此与加密联邦学习系统兼容。
  • 该方法设计为对数据分布和攻击模式无感,从而在非独立同分布(non-IID)和不平衡联邦学习环境中具备更强的泛化能力。

实验结果

研究问题

  • RQ1是否存在一种防御机制,能够在不了解攻击模式或无法访问模型参数的情况下,检测联邦学习中的后门攻击?
  • RQ2差异测试在放大良性与恶意模型行为差异方面,对后门检测的有效性如何?
  • RQ3与标准 MAD 变体相比,两步 MAD 异常检测在联邦学习环境中是否能更有效地降低误报率和漏报率?
  • RQ4DifFense 在不同数量恶意客户端下的性能与 FedAvg、Multi-Krum 和 CooMed 相比如何?
  • RQ5差异图像的数量和类别分布是否会影响检测准确率和模型收敛性?

主要发现

  • DifFense 将全局模型的平均后门准确率降低至 4% 以下,显著优于 FedAvg、Multi-Krum 和 CooMed。
  • 该方法在所有测试场景中均实现零漏报率,确保所有恶意更新都被检测到。
  • 平均误报率低于 7%,即使在多个攻击者存在的情况下,DifFense 仍能保持与 FedAvg 相当的高全局模型准确率。
  • 两步 MAD 异常检测实现零漏报率,并将误报率控制在 7% 以下,优于单步和双步 MAD 变体。
  • 无论差异图像数量或其来源类别数量如何,性能均保持稳定,全局准确率始终高于 89%。
  • 敏感性分析表明,即使仅使用来自单一类别的 20 张差异图像,DifFense 仍能将误报率控制在 9% 以下,且漏报率为零。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。