Skip to main content
QUICK REVIEW

[论文解读] TextHide: Tackling Data Privacy in Language Understanding Tasks

Yangsibo Huang, Zhao Song|arXiv (Cornell University)|Oct 12, 2020
Privacy-Preserving Technologies in Data参考文献 62被引用 6
一句话总结

TextHide 是一种用于自然语言理解任务的隐私保护框架,通过一次性密钥加密文本表示,并结合 MixUp 风格的数据增强,能够在仅导致 GLUE 基准平均准确率下降 1.9% 的情况下,有效防御梯度攻击和表示反演攻击,同时基于计算难题提供安全保证。

ABSTRACT

An unsolved challenge in distributed or federated learning is to effectively mitigate privacy risks without slowing down training or reducing accuracy. In this paper, we propose TextHide aiming at addressing this challenge for natural language understanding tasks. It requires all participants to add a simple encryption step to prevent an eavesdropping attacker from recovering private text data. Such an encryption step is efficient and only affects the task performance slightly. In addition, TextHide fits well with the popular framework of fine-tuning pre-trained language models (e.g., BERT) for any sentence or sentence-pair task. We evaluate TextHide on the GLUE benchmark, and our experiments show that TextHide can effectively defend attacks on shared gradients or representations and the averaged accuracy reduction is only $1.9\%$. We also present an analysis of the security of TextHide using a conjecture about the computational intractability of a mathematical problem. Our code is available at https://github.com/Hazelsuko07/TextHide

研究动机与目标

  • 解决在联邦学习或分布式学习环境中保护私有文本数据的挑战,同时不牺牲模型准确率或训练速度。
  • 开发一种实用、高效且安全的方法,以保护模型训练过程中显式和语义信息的文本表示。
  • 将 InstaHide 的原则——最初为计算机视觉设计——扩展至自然语言处理领域,克服离散文本标记带来的独特挑战。
  • 确保即使攻击者能够访问所有通信内容,也无法从共享梯度或表示中恢复原始训练数据。
  • 提供基于计算困难性假设的密码学安全解决方案,避免同态加密或差分隐私带来的性能开销。

提出的方法

  • TextHide 通过在共享前对预训练语言模型(如 BERT)的隐藏表示应用一次性密钥,对输入文本进行加密。
  • 采用 MixUp 风格的数据增强技术,通过随机系数组合多个文本表示,以掩盖原始输入。
  • 每位参与者对隐藏表示应用随机的、基于样本的掩码,确保单个表示无法揭示原始输入。
  • 该方法与句子和句子对任务的标准微调流程兼容,对现有训练工作流仅需极少修改。
  • 安全性基于一种变体 k-向量子集和问题的计算不可解性,该问题被推测需要指数时间才能求解。
  • 加密在表示层面进行,而非原始文本,使其能够无缝集成到现有 NLP 训练框架中。

实验结果

研究问题

  • RQ1能否设计一种轻量级加密机制,在不显著降低模型性能的前提下,保护联邦 NLP 训练中的文本表示?
  • RQ2在现实威胁模型下,TextHide 对梯度反演和表示重构攻击的防御能力如何?
  • RQ3面对能够查询梯度或表示的高级攻击者,TextHide 的安全性在多大程度上依然可靠?
  • RQ4TextHide 的安全性能否基于计算困难性假设进行形式化证明,而非依赖统计或启发式保证?
  • RQ5是否可行将图像领域隐私保护技术(如 InstaHide)适配至自然语言数据的离散、序列化特性?

主要发现

  • TextHide 在 GLUE 基准上仅导致平均准确率下降 1.9%,表明其在提供强隐私保护的同时性能损失极小。
  • 该方法有效缓解了显式和语义信息泄露:即使使用高级逆向工程技术,攻击者也无法从查询表示中重构原始句子。
  • 安全分析表明,破解 TextHide 需要求解一种计算难题(k-向量子集和问题的变体),在指数时间假设下,该问题被推测需要指数时间才能求解。
  • 即使攻击者使用表示相似性搜索(RSS)技术,查询 TextHide 保护的表示时,其表现也仅相当于随机猜测。
  • 与基线方法相比,TextHide 在降低显式泄露(通过余弦相似度衡量)和语义泄露(通过 SBERT 和标签相似度衡量)方面均表现更优。
  • 该框架与 BERT 等预训练语言模型的标准微调兼容,可轻松部署于现实世界 NLP 工作流,仅需极少修改。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。