Skip to main content
QUICK REVIEW

[논문 리뷰] TextHide: Tackling Data Privacy in Language Understanding Tasks

Yangsibo Huang, Zhao Song|arXiv (Cornell University)|2020. 10. 12.
Privacy-Preserving Technologies in Data참고 문헌 62인용 수 6
한 줄 요약

TextHide는 한 번만 사용하는 비밀 키와 MixUp 방식의 데이터 증강을 사용하여 텍스트 표현을 암호화하는 프라이버시 보장 프레임워크로, 기울기 및 표현 역행렬 공격에 효과적으로 대응할 수 있으며, GLUE 벤치마크에서 평균 정확도 저하율이 1.9%에 불과하여 성능 손실가 최소화되면서도 계산적으로 어려운 문제에 기반한 보안 보장을 제공한다.

ABSTRACT

An unsolved challenge in distributed or federated learning is to effectively mitigate privacy risks without slowing down training or reducing accuracy. In this paper, we propose TextHide aiming at addressing this challenge for natural language understanding tasks. It requires all participants to add a simple encryption step to prevent an eavesdropping attacker from recovering private text data. Such an encryption step is efficient and only affects the task performance slightly. In addition, TextHide fits well with the popular framework of fine-tuning pre-trained language models (e.g., BERT) for any sentence or sentence-pair task. We evaluate TextHide on the GLUE benchmark, and our experiments show that TextHide can effectively defend attacks on shared gradients or representations and the averaged accuracy reduction is only $1.9\%$. We also present an analysis of the security of TextHide using a conjecture about the computational intractability of a mathematical problem. Our code is available at https://github.com/Hazelsuko07/TextHide

연구 동기 및 목표

  • 프라이빗 텍스트 데이터를 연합 학습 또는 분산 학습 환경에서 보호하면서도 모델 정확도나 학습 속도를 희생하지 않는 문제를 해결하기 위해.
  • 기존의 텍스트 표현에서 명시적 정보와 의미적 정보를 모두 효과적으로 보호할 수 있는 실용적이고 효율적이며 안전한 방법을 개발하기 위해.
  • 원래는 컴퓨터 비전을 위해 설계된 InstaHide의 원리를 자연어 처리로 확장하여, 이산적인 텍스트 토큰이 지닌 고유한 과제들을 극복하기 위해.
  • 모든 통신에 접근할 수 있는 스파이 공격자도 공유된 기울기나 표현에서 원본 학습 데이터를 복구할 수 없도록 보장하기 위해.
  • 함수형 암호화나 차별적 프라이버시와 같은 성능 저하를 초래하는 기법을 피하고, 계산적 난이도 가정에 기반한 암호학적으로 안전한 솔루션을 제공하기 위해.

제안 방법

  • TextHide는 사전 훈련된 언어 모델(예: BERT)의 은닉 표현에 일회용 비밀 키를 적용하여 입력 텍스트를 암호화한 후 공유한다.
  • 다양한 텍스트 표현을 무작위 계수로 조합하는 MixUp 방식의 데이터 증강 기법을 사용한다.
  • 각 참가자는 각 예제에 대해 무작위 마스크를 은닉 표현에 적용하여, 어떤 단일 표현도 원본 입력을 드러내지 않도록 보장한다.
  • 표준 문장 및 문장 쌍 작업을 위한 피니튜닝 파이프라인과 호환되며, 기존 학습 워크플로우에 최소한의 변경만 필요로 한다.
  • 보안은 k-벡터 부분합 문제의 변형을 해결하는 것이 계산적으로 불가능하다는 데 기반하며, 이는 기하급수적 시간이 소요될 것으로 추측된다.
  • 암호화는 원시 텍스트가 아니라 표현 수준에서 이루어지므로, 기존의 NLP 학습 프레임워크에 원활하게 통합될 수 있다.

실험 결과

연구 질문

  • RQ1성능 저하가 크게 발생하지 않도록 하면서도, 연합 NLP 학습에서 텍스트 표현을 보호할 수 있는 경량 암호화 메커니즘을 설계할 수 있는가?
  • RQ2실제 위협 모델에서 TextHide는 기울기 역행렬 공격 및 표현 복원 공격에 얼마나 효과적으로 대응할 수 있는가?
  • RQ3기울기나 표현을 쿼리할 수 있는 고도로 발전된 공격자에 대해서도 TextHide의 보안 수준은 유지되는가?
  • RQ4통계적 또는 히우리스틱 보장이 아닌, 계산적 난이도 가정에 기반한 형식적 보장을 확보할 수 있는가?
  • RQ5이미지 기반의 프라이버시 기법(예: InstaHide)을 자연어 데이터의 이산적이고 순차적인 특성에 적합하게 적용할 수 있는가?

주요 결과

  • TextHide는 GLUE 벤치마크 전반에서 평균 정확도가 1.9% 감소하여 강력한 프라이버시 보호에도 불구하고 성능 손실가 최소화됨을 보여준다.
  • 이 방법은 명시적 정보와 의미적 정보의 泄露를 효과적으로 억제한다: 공격자는 고도로 발전된 역공학 기법을 사용하더라도, 쿼리한 표현에서 원본 문장을 복원할 수 없다.
  • 보안 분석 결과, TextHide를 해독하기 위해서는 계산적으로 어려운 문제(즉, k-벡터 부분합 문제의 변형)를 해결해야 하며, 이는 기하급수적 시간이 소요될 것으로 추측된다.
  • 심지어 표현 유사도 검색(RSS)을 사용하는 고도로 발전된 공격자도 TextHide로 보호된 표현을 쿼리할 경우 무작위 추측과 동일한 성능을 보인다.
  • TextHide는 코사인 유사도로 측정한 명시적 泄露와 SBERT 및 레이블 유사도로 측정한 의미적 泄露를 모두 기준선 방법보다 효과적으로 감소시킨다.
  • 이 프레임워크는 BERT와 같은 사전 훈련된 언어 모델의 표준 피니튜닝과 호환되어, 최소한의 수정으로 실제 NLP 파이프라인에 구현 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.