Skip to main content
QUICK REVIEW

[논문 리뷰] ER-AE: Differentially Private Text Generation for Authorship Anonymization

Haohan Bo, Steven H. H. Ding|arXiv (Cornell University)|2019. 07. 20.
Authorship Attribution and Profiling참고 문헌 48인용 수 7
한 줄 요약

ER-AE는 두 집합의 지수 기반 메커니즘과 REINFORCE 기반 임bedding 보상 함수를 사용하여 의미를 유지하면서도 인간이 읽을 수 있는 텍스트를 생성함으로써 저자 신원을 익명화하는 차별적 보장이 있는 텍스트 생성 모델이다. 이 모델은 개인정보 보호와 의미 유지 측면에서 최신 기법들을 능가하며, Yelp 및 동료 평가 데이터셋에서 각각 0.75와 0.74의 유용성 점수를 기록했고, 저자 재식별 성공률을 10% 이하로 낮추었다.

ABSTRACT

Most of privacy protection studies for textual data focus on removing explicit sensitive identifiers. However, personal writing style, as a strong indicator of the authorship, is often neglected. Recent studies, such as SynTF, have shown promising results on privacy-preserving text mining. However, their anonymization algorithm can only output numeric term vectors which are difficult for the recipients to interpret. We propose a novel text generation model with a two-set exponential mechanism for authorship anonymization. By augmenting the semantic information through a REINFORCE training reward function, the model can generate differentially private text that has a close semantic and similar grammatical structure to the original text while removing personal traits of the writing style. It does not assume any conditioned labels or paralleled text data for training. We evaluate the performance of the proposed model on the real-life peer reviews dataset and the Yelp review dataset. The result suggests that our model outperforms the state-of-the-art on semantic preservation, authorship obfuscation, and stylometric transformation.

연구 동기 및 목표

  • 개인적 글쓰기 스타일을 보호하는 개인정보 보존 텍스트 생성 기술의 부족을 보완하기 위해.
  • 수치 벡터가 아닌 이해하기 쉬운 자연어 텍스트를 생성함으로써 실제 데이터 공개에 실용적으로 적용 가능한 모델을 개발하기 위해.
  • 라벨링된 저자 신원 정보나 병렬 학습 데이터가 필요 없이 강력한 개인정보 보호 보장을 확보하기 위해.
  • 기존 방법에서 관찰된 의미 손실을 방지하고 익명화 과정에서 의미 유지와 문법적 정확성을 향상시키기 위해.
  • 가장 악성인 대안적 재식별 공격에 대비해 강건한 차별적 보장 프레임워크를 제공하기 위해.

제안 방법

  • ER-AE는 두 집합의 지수 기반 메커니즘에 기반한 차별적 보장이 있는 디코딩 프로세스를 갖춘 시퀀스-투-시퀀스 오토인코더 아키텍처를 사용한다.
  • 모델은 사전 학습된 단어 임베딩을 활용하여 토큰 치환을 의미적으로 유사한 대체어로 이끌어내는 새로운 REINFORCE 기반 보상 함수를 도입한다.
  • 두 집합의 지수 기반 메커니즘은 어휘를 두 집합으로 분할한다: 상위-k 의미적으로 유사한 토큰과 나머지 토큰으로, 이는 샘플링 효율성과 의미 있는 출력 생성을 향상시킨다.
  • 차별적 보장은 지수 기반 메커니즘을 통해 구현되며, 이는 의미 유사성을 유지하는 출력에 더 높은 확률을 할당하고 원본 저자의 신원을 구분할 수 없도록 보장한다.
  • 입력 텍스트와 생성된 텍스트 간의 의미 유사성을 최대화하기 위해 임베딩 보상 함수를 사용하여 강화학습 기반으로 생성기 전체를 엔드 투 엔드로 학습한다.
  • 병렬 데이터나 라벨링된 저자 신원 정보가 필요 없어 실제 익명화 시나리오에 적용 가능하다.

실험 결과

연구 질문

  • RQ1차별적 보장이 있는 텍스트 생성 모델이 인간이 읽을 수 있고 의미적으로 일관된 텍스트를 생성하면서도 효과적으로 저자 스타일을 은폐할 수 있는가?
  • RQ2대규모 어휘 설정에서 기존의 지수 기반 메커니즘과 비교해 본다면, 제안된 두 집합의 지수 기반 메커니즘이 샘플링 효율성과 의미 있는 출력 생성에 어떻게 기여하는가?
  • RQ3임베딩 보상 함수가 기존 기준 대비 토큰 치환 과정에서 의미 유지에 얼마나 기여하는가?
  • RQ4ER-AE는 개인정보 보호, 의미 유용성, 문법 정확성 측면에서 최신 기법들과 비교해 어떻게 성능을 내는가?
  • RQ5라벨링된 데이터나 병렬 텍스트 쌍에 의존하지 않으면서도 모델이 강력한 개인정보 보장을 유지할 수 있는가?

주요 결과

  • ER-AE는 Yelp 리뷰 데이터셋에서 0.75, 동료 평가 데이터셋에서 0.74의 유용성 점수를 기록하여, AE-DP, SynTF, Random-R보다 의미 유지 측면에서 뚜렷한 승리를 거두었다.
  • ER-AE는 Yelp 데이터셋에서 저자 재식별 공격의 성공률을 10% 이하로 낮추었고, 동료 평가 데이터셋에서는 스타일로스픽 특성의 변동성을 10 이상으로 유도하였다.
  • 두 집합의 지수 기반 메커니즘이 동일한 개인정보 보호 예산 하에서 의미 있는 토큰을 샘플링할 확률을 0.01%에서 약 70%로 높여, 생성 품질을 크게 향상시켰다.
  • 임베딩 보상 함수는 의미적으로 관련된 토큰에 대해 더 부드러운 확률 분포를 제공하여, AE-DP가 원본 토큰을 선호하는 경향을 보이는 것과는 달리 더 유창하고 맥락에 부합하는 치환을 가능하게 하였다.
  • ER-AE는 SynTF가 수치형 단어 벡터만 출력하는 것과 달리 인간이 읽을 수 있고 문법적으로 올바른 텍스트를 생성한다.
  • 짧은 텍스트에서는 뛰어난 성능를 보였지만, 장문의 텍스트 생성에서는 개인정보 보호 예산 할당 방식의 문제로 인해 도전 과제를 겪었으며, 향후 연구에서는 개선된 예산 할당 전략이 필요하다는 점을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.