[论文解读] Privacy-Preserving Classification of Personal Text Messages with Secure Multi-Party Computation: An Application to Hate-Speech Detection
该论文提出了一种首个可证明安全的、基于安全多方计算(SMC)的隐私保护文本分类系统,用于个人消息中的仇恨言论检测。该系统支持逻辑回归和树集成模型的分类,确保双方均不会泄露对方的敏感数据——实现亚秒级分类速度,比以往基于同态加密的方法快两个数量级,且无准确率损失。
Classification of personal text messages has many useful applications in surveillance, e-commerce, and mental health care, to name a few. Giving applications access to personal texts can easily lead to (un)intentional privacy violations. We propose the first privacy-preserving solution for text classification that is provably secure. Our method, which is based on Secure Multiparty Computation (SMC), encompasses both feature extraction from texts, and subsequent classification with logistic regression and tree ensembles. We prove that when using our secure text classification method, the application does not learn anything about the text, and the author of the text does not learn anything about the text classification model used by the application beyond what is given by the classification result itself. We perform end-to-end experiments with an application for detecting hate speech against women and immigrants, demonstrating excellent runtime results without loss of accuracy.
研究动机与目标
- 解决在文本分类中个人消息暴露给应用程序所引发的隐私风险。
- 设计一种可证明安全的解决方案,防止在分类过程中泄露消息内容和模型细节。
- 实现基于SMC的隐私保护文本分类的实用化部署,克服以往方法在性能上的局限。
- 针对SMC环境优化机器学习模型与协议,以确保效率与准确率。
- 通过现实世界的仇恨言论检测用例,证明端到端的可行性。
提出的方法
- 采用安全多方计算(SMC),涉及两个参与方:Alice(消息拥有者)和Bob(模型拥有者),确保任一方均不会知晓对方的私有数据。
- 提出一种新颖的基于SMC的协议,通过分桶化的安全相等性测试,实现从非结构化文本中进行隐私保护的特征提取,从而降低计算成本。
- 对逻辑回归和AdaBoost模型应用优化的安全计算,引入虚拟特征以保持安全性,且不影响模型准确率。
- 使用13位和17位表示独元组和双元组,实验中未观察到哈希冲突。
- 使用Rust实现协议,以提升效率,并将通信与计算成本纳入端到端性能评估。
- 提出一种新型协议,以隐私保护方式在二值特征上使用决策桩集成进行二分类。
实验结果
研究问题
- RQ1能否设计一种可证明安全的基于SMC的系统,实现隐私保护的文本分类,且不损害准确率或性能?
- RQ2在SMC约束下,如何高效实现从非结构化文本中进行安全特征提取?
- RQ3在真实世界的文本分类工作负载中,SMC与同态加密在性能权衡上存在何种差异?
- RQ4标准机器学习模型(如逻辑回归和AdaBoost)在多大程度上可被适配用于安全计算,而不会损失实用性?
- RQ5是否能在实际中实现端到端运行时间低于一秒的隐私分类?
主要发现
- 所提出的基于SMC的系统实现端到端分类仅需数秒,相比以往基于同态加密的解决方案(每条推文需19分钟)提升了两个数量级。
- 系统在与明文分类相比保持了完整准确率,隐私保护转换未造成准确率下降。
- 采用分桶化技术显著减少了所需的安全相等性测试次数,大幅降低计算成本,同时保持安全性。
- 引入虚拟特征以平衡分桶大小,防止信息泄露,且由于其系数或权重为零,对模型输出无任何影响。
- 使用Rust实现的系统展现出实际效率,通信与计算成本均包含在亚秒级运行时间内。
- 本工作首次提供了实证证据,表明可证明安全的、端到端隐私保护的文本分类在实际应用中具备可行性,并具备真实世界性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。