Skip to main content
QUICK REVIEW

[论文解读] Share your Model instead of your Data: Privacy Preserving Mimic Learning for Ranking

Mostafa Dehghani, Hosein Azarbonyad|arXiv (Cornell University)|Jul 24, 2017
Privacy-Preserving Technologies in Data参考文献 14被引用 9
一句话总结

本文提出了一种用于信息检索的隐私保护模仿学习方法,其中在敏感用户数据上训练的教师模型被用于为未标记数据生成标签,从而在不共享原始数据的情况下训练学生神经排序模型。该方法在保护用户隐私的同时实现了具有竞争力的性能(例如,NDCG@10为0.3559),证明了在信息检索研究中,模型共享可以替代数据共享。

ABSTRACT

Deep neural networks have become a primary tool for solving problems in many fields. They are also used for addressing information retrieval problems and show strong performance in several tasks. Training these models requires large, representative datasets and for most IR tasks, such data contains sensitive information from users. Privacy and confidentiality concerns prevent many data owners from sharing the data, thus today the research community can only benefit from research on large-scale datasets in a limited manner. In this paper, we discuss privacy preserving mimic learning, i.e., using predictions from a privacy preserving trained model instead of labels from the original sensitive training data as a supervision signal. We present the results of preliminary experiments in which we apply the idea of mimic learning and privacy preserving mimic learning for the task of document re-ranking as one of the core IR tasks. This research is a step toward laying the ground for enabling researchers from data-rich environments to share knowledge learned from actual users' data, which should facilitate research collaborations.

研究动机与目标

  • 解决由于用户保密性顾虑而导致的大规模隐私敏感信息检索数据集访问受限的问题。
  • 探究模仿学习是否能在不直接访问原始标注数据的情况下有效训练神经排序模型。
  • 研究隐私保护的模仿学习技术是否能在保护敏感训练数据的同时保持模型的实用性。
  • 通过共享训练好的模型而非原始数据,实现产业界向学术界的知识迁移。
  • 为神经信息检索研究中的安全、隐私保护协作奠定基础。

提出的方法

  • 在真实用户交互的敏感标注训练数据上训练一个深度神经网络(教师模型)。
  • 使用训练好的教师模型对大规模未标记文档集合预测相关性得分,生成伪标签。
  • 在伪标注数据上训练一个更小的学生神经排序模型,以模仿教师的排序行为。
  • 应用Papernot等人(2017)提出的隐私保护技术,通过在互不重叠的数据子集上训练多个教师模型,确保差分隐私。
  • 通过加入噪声的平均方法聚合多个教师的预测结果,进一步保护隐私并提升泛化能力。
  • 使用NDCG@10和MAP等指标,在标准信息检索基准上评估学生模型的性能。

实验结果

研究问题

  • RQ1RQ1:在无法访问原始标注数据的情况下,模仿学习是否能有效应用于训练神经排序模型以实现文档重排序?
  • RQ2RQ2:隐私保护的模仿学习技术是否能在保护用户隐私的同时保持信息检索应用中的高性能?
  • RQ3RQ3:在蒸馏标签上训练的学生模型性能与教师模型及基线方法相比如何?
  • RQ4RQ4:数据划分方式、聚合过程中的噪声以及模型架构对模仿学习在排序任务中有效性的影响如何?
  • RQ5RQ5:在信息检索研究合作中,模型共享是否可以作为数据共享的可行且隐私保护的替代方案?

主要发现

  • 由单个教师模型生成的伪标签训练的学生模型在NDCG@10上达到0.3559,接近教师模型的性能。
  • 通过多教师模型的噪声聚合,提升了泛化能力,使学生模型性能优于单一教师模型。
  • 从教师到学生模型的性能下降并非仅由数据划分或噪声引起,也与每个教师的训练数据量减少有关。
  • 在噪声聚合设置下,学生模型的性能甚至超过了教师模型,表明基于集成的蒸馏可增强模型鲁棒性。
  • 采用具有差分隐私保证的集成教师模型进行隐私保护的模仿学习,有效保护了敏感数据,同时保持了具有竞争力的排序性能。
  • 结果表明,与共享原始数据相比,共享训练好的模型是一种可行且隐私保护的协作式信息检索研究路径。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。