Skip to main content
QUICK REVIEW

[论文解读] Privacy-Preserving Spam Filtering using Functional Encryption

Sicong Wang, Naveen Karunanayake|arXiv (Cornell University)|Dec 8, 2020
Spam and Phishing Detection参考文献 25被引用 4
一句话总结

本文提出了一种使用功能性加密的隐私保护垃圾邮件过滤框架,使服务器能够在不访问明文内容的情况下对加密邮件进行分类。通过将二次功能性加密方案与混合神经网络(二次 + 多层感知器)结合,该系统在真实世界数据集上的准确率超过96%,且无需客户端与服务器之间的来回通信,这与基于FHE的方法不同。

ABSTRACT

Traditional spam classification requires the end-user to reveal the content of its received email to the spam classifier which violates the privacy. Spam classification over encrypted emails enables the classifier to classify spam email without accessing the email, hence protects the privacy of email content. In this paper, we construct a spam classification framework that enables the classification of encrypted emails. Our classification model is based on a neural network with a quadratic network part and a multi-layer perception network part. The quadratic network architecture is compatible with the operation of an existing quadratic functional encryption scheme that enables our classification to predict the label of encrypted emails without revealing the associated plain-text email. The evaluation results on real-world spam datasets indicate that our proposed spam classification model achieves an accuracy of over 96%.

研究动机与目标

  • 解决传统垃圾邮件过滤中因邮件内容暴露给服务器或服务提供商而导致的隐私泄露问题。
  • 实现在加密邮件上由服务器进行垃圾邮件分类,且无需终端用户在线或进行来回通信。
  • 将功能性加密与深度学习结合,实现在加密数据上的安全、私密文本分类。
  • 在真实世界垃圾邮件数据集上评估所提出系统的性能与效率。
  • 与现有基于FHE的解决方案相比,从准确率和计算开销两个方面评估所提出的基于功能性加密的方法。

提出的方法

  • 系统采用两部分神经网络:一个与二次功能性加密方案兼容的二次网络组件,用于处理加密输入。
  • 二次网络的输出为明文嵌入向量,随后传递给一个多层感知器(MLP)网络以进行最终的标签预测。
  • 邮件以整数特征的文档-词项矩阵表示,以兼容功能性加密对仅整数输入的要求。
  • 模型权重和偏置被量化为8位整数,以减少计算开销,尽管这会导致轻微的准确率下降。
  • 功能性加密的使用方式为:解密密钥仅允许对加密输入执行特定函数(垃圾邮件预测),而无法获得完整明文访问权限。
  • 系统使用TensorFlow实现,并在多个真实世界垃圾邮件数据集(包括TREC07p)上进行了评估。

实验结果

研究问题

  • RQ1能否基于深度学习构建一个直接在加密邮件数据上运行的垃圾邮件分类器,使用功能性加密?
  • RQ2所提出的隐私保护模型的准确率与传统基于明文的模型相比如何?
  • RQ3所提出的基于功能性加密的系统在预测过程中的计算开销是多少?
  • RQ4与基于FHE的垃圾邮件分类相比,所提出的系统在通信模式和性能方面有何差异?
  • RQ5中间层输出在多大程度上会泄露原始邮件内容的信息?

主要发现

  • 所提出的垃圾邮件分类模型在三个真实世界垃圾邮件数据集上的准确率超过96%,表现出与基于明文的模型相当的强性能。
  • 该系统消除了客户端与服务器之间来回通信的需求,使其适用于异步邮件处理。
  • 平均预测时间在每封邮件22至40秒之间,具体取决于词汇量大小,其中最高开销来自解密过程中的离散对数阶段。
  • 模型的中间层输出会泄露关于词语存在的显著信息,使用私有学习模型可基于输出嵌入实现超过90%的准确率来检测特定词语。
  • 尽管基于FHE的逻辑回归预测速度更快,但功能性加密方法在通信效率方面表现更优,更适合服务器端分类。
  • 将输入向量长度从5,000减少到4,000个特征,可使预测时间减少4秒,且准确率仅下降0.2%至0.5%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。