[论文解读] A Comprehensive Analysis of Information Leakage in Deep Transfer Learning
本文首次对深度迁移学习中的信息泄露问题进行了全面分析,将方法分类为基于模型、基于映射和基于参数的范式。研究证明,这三种范式在针对性攻击下都会无意中泄露成员信息和属性信息,并评估了相应的防御策略以减轻这些隐私风险。
Transfer learning is widely used for transferring knowledge from a source domain to the target domain where the labeled data is scarce. Recently, deep transfer learning has achieved remarkable progress in various applications. However, the source and target datasets usually belong to two different organizations in many real-world scenarios, potential privacy issues in deep transfer learning are posed. In this study, to thoroughly analyze the potential privacy leakage in deep transfer learning, we first divide previous methods into three categories. Based on that, we demonstrate specific threats that lead to unintentional privacy leakage in each category. Additionally, we also provide some solutions to prevent these threats. To the best of our knowledge, our study is the first to provide a thorough analysis of the information leakage issues in deep transfer learning methods and provide potential solutions to the issue. Extensive experiments on two public datasets and an industry dataset are conducted to show the privacy leakage under different deep transfer learning settings and defense solution effectiveness.
研究动机与目标
- 基于源域与目标域之间的交互模式,识别并分类深度迁移学习方法,重点关注隐私泄露风险。
- 研究在每种迁移学习范式中,无意信息泄露(特别是成员信息和属性推理)的发生机制。
- 为每种范式设计并评估针对性的成员信息推理攻击与属性信息推理攻击,以展示现实世界中的隐私威胁。
- 评估梯度裁剪、噪声注入和知识蒸馏等通用防御机制在降低信息泄露方面的有效性。
- 通过识别漏洞并提出缓解策略,为隐私保护型深度迁移学习提供基础框架。
提出的方法
- 将深度迁移学习划分为三种范式:基于模型的(完整模型与参数共享)、基于映射的(特征表示共享)和基于参数的(联合训练期间梯度共享)。
- 针对基于模型的范式设计成员信息推理攻击,利用对源模型的黑盒访问,判断某一样本是否属于训练集。
- 为基于映射和基于参数的范式开发属性信息推理攻击,攻击者通过共享的特征或梯度推断源数据的统计属性。
- 根据范式采用白盒或黑盒攻击设置,利用训练好的攻击分类器,基于模型输出或梯度预测成员身份或属性。
- 评估包括梯度裁剪、噪声注入和知识蒸馏在内的防御机制,以在保持模型效用的同时减少信息泄露。
- 在公开数据集和工业数据集上开展大量实验,验证所有三种范式下攻击的成功率与防御的有效性。
实验结果
研究问题
- RQ1不同深度迁移学习范式——基于模型、基于映射和基于参数——在信息泄露敏感性方面有何差异?
- RQ2在基于模型的深度迁移学习中,成员信息推理攻击在多大程度上会威胁隐私?
- RQ3当隐藏特征或梯度被共享时,属性信息推理攻击是否能揭示源数据集的敏感属性?
- RQ4梯度裁剪和噪声注入等通用防御机制在所有三种范式中缓解信息泄露的有效性如何?
- RQ5在不同泄露场景下,隐私保护与模型性能之间存在何种权衡?
主要发现
- 所有三种深度迁移学习范式——基于模型、基于映射和基于参数——在针对性推理攻击下都会无意泄露成员信息和属性信息。
- 基于模型的方法易受成员信息推理攻击影响,在攻击者可访问模型的某些设置下,攻击成功率超过80%。
- 基于映射和基于参数的范式易受属性信息推理攻击影响,尤其当梯度或特征在未混淆的情况下被共享时。
- 在批量级别共享平均梯度的基于参数的方法,相比共享单个梯度的方法,泄露的属性信息显著更少。
- 梯度裁剪和噪声注入等防御措施可减少信息泄露,但可能降低模型准确率,尤其是在高维或复杂数据集上。
- 知识蒸馏和模型蒸馏技术在保持模型效用的同时减少信息泄露方面表现出潜力,尤其在基于模型的设置中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。