Skip to main content
QUICK REVIEW

[논문 리뷰] Text Revealer: Private Text Reconstruction via Model Inversion Attacks against Transformers

Ruisi Zhang, Seira Hidano|arXiv (Cornell University)|2022. 09. 21.
Adversarial Robustness in Machine Learning인용 수 13
한 줄 요약

Text Revealer는 피인자된 트랜스포머 기반 텍스트 분류 모델에서 비공개 텍스트 데이터를 복원하는 최초의 모델 역전공격을 제안한다. 도메인 특화 공개 데이터를 활용해 GPT-2 생성기를 사전 훈련하고, 대상 모델의 피드백을 통해 은닉 상태를 반복적으로 변형함으로써, 기준 데이터셋에서 84.29%의 복원률과 34.22%의 정확도를 기록하며 높은 정밀도로 비공개 훈련 텍스트를 복원한다.

ABSTRACT

Text classification has become widely used in various natural language processing applications like sentiment analysis. Current applications often use large transformer-based language models to classify input texts. However, there is a lack of systematic study on how much private information can be inverted when publishing models. In this paper, we formulate \emph{Text Revealer} -- the first model inversion attack for text reconstruction against text classification with transformers. Our attacks faithfully reconstruct private texts included in training data with access to the target model. We leverage an external dataset and GPT-2 to generate the target domain-like fluent text, and then perturb its hidden state optimally with the feedback from the target model. Our extensive experiments demonstrate that our attacks are effective for datasets with different text lengths and can reconstruct private texts with accuracy.

연구 동기 및 목표

  • 피인자된 트랜스포머 기반 텍스트 분류 모델을 대상으로 모델 역전공격를 통해 얼마나 많은 비공개 정보를 복원할 수 있는지 조사하는 것.
  • 기존 시각 및 표본 데이터 연구에 비해 트랜스포머 분야에서 체계적인 텍스트 모델 역전공격 연구의 격차를 메우는 것.
  • 훈련 데이터에 접근하지 않고도 유창하고 의미 있는 비공개 텍스트를 대상 모델의 예측 결과로부터 복원하는 방법을 개발하는 것.
  • 다양한 텍스트 길이, 모델 아키텍처(BERT, TinyBERT), 그리고 데이터셋(Emotion, Yelp)에서 공격의 효과를 평가하는 것.

제안 방법

  • 비공개 데이터셋과 동일한 도메인의 공개 데이터셋을 수집하여 분포 유사성을 확보한다.
  • 공개 데이터셋에 대해 n-gram 분석을 수행하여 고빈도 어구를 텍스트 생성을 위한 템플릿으로 추출한다.
  • 공개 데이터셋에 대해 GPT-2 언어 모델을 훈련시켜 자연스럽고 도메인에 적합한 텍스트를 생성한다.
  • 대상 모델의 예측 점수 피드백을 활용해 GPT-2 출력의 은닉 상태를 반복적으로 변형한다.
  • 대상 모델의 출력과 원하는 레이블 분포 간의 교차 엔트로피 손실을 최적화하여 변형을 조정한다.
  • 주성분 분석(PCA)을 사용해 복원된 텍스트와 진짜 텍스트의 의미적 유사도를 시각화하고 비교한다.

실험 결과

연구 질문

  • RQ1백박스 접근 없이 대상 모델의 예측 결과에만 접근할 때, 피인자된 트랜스포머 모델에서 비공개 훈련 텍스트를 얼마나 잘 복원할 수 있는가?
  • RQ2생성된 템플릿의 길이가 복원된 비공개 텍스트의 품질과 정확도에 어떤 영향을 미치는가?
  • RQ3다양한 트랜스포머 아키텍처(BERT 대비 TinyBERT 등)와 텍스트 분류 데이터셋에서 공격의 효과는 어떠한가?
  • RQ4복원된 텍스트가 원본 비공개 훈련 데이터의 의미적 및 분포적 성질과 얼마나 유사한가?
  • RQ5공개 데이터셋이 비공개 데이터셋과 유사할 경우, 성공적인 복원을 가능하게 하는 데 어떤 역할을 하는가?

주요 결과

  • Text Revealer는 BERT와 TinyBERT를 대상 모델로 사용하여 Emotion 및 Yelp 데이터셋에서 복원률(RR) 84.29%와 정확도(Acc) 34.22%를 달성한다.
  • 공격 성능은 다양한 텍스트 길이에서 높은 수준을 유지하며, 템플릿 길이가 짧아질수록 복원 정확도가 감소한다—더 긴 템플릿이 더 좋은 결과를 낳는다.
  • 공개 및 비공개 데이터셋 간 킬리안 타우 거리 분석에서 상위 10개 토큰에 대해 강한 토큰 빈도 상관관계(0.99)를 보이며, 공개 데이터를 템플릿 생성에 활용할 수 있음을 뒷받침한다.
  • 피인자된 모델은 공개 데이터셋 대비 비공개 데이터셋에서 뚜렷한 정확도 격차를 보이며(예: BERT는 비공개 데이터셋에서 99.66%, 공개 데이터셋에서 91.25%), 훈련 데이터의 기억 현상이 확인된다.
  • 공격로 복원된 예시는 의미적으로 유창하고 진짜 텍스트에 가깝게 유지되며, 표본 5의 PCA 시각화 및 문장 수준 비교를 통해 이를 확인할 수 있다.
  • Gumbel 소프트맥스 및 수정된 엔트로피 손실과 같은 대체 손실 함수에 비해 복원률과 정확도 모두에서 본 방법이 뛰어난 성능을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.