Skip to main content
QUICK REVIEW

[논문 리뷰] dpUGC: Learn Differentially Private Representation for User Generated Contents

Xuan-Son Vu, Son N. Tran|arXiv (Cornell University)|2019. 03. 25.
Privacy-Preserving Technologies in Data참고 문헌 28인용 수 6
한 줄 요약

이 논문은 사용자 생성 콘텐츠(UGC)에서 미세한 개인 정보 보호 보장을 제공하는 새로운 프레임워크인 dpUGC를 제안한다. 학습 중 사용자 수준에서 노이즈 주입을 적용함으로써 강력한 프라이버시 보호를 달성하면서도, 회귀와 같은 후행 NLP 작업에서 높은 유틸리티를 유지한다. 일부 문자 수준의 의미 검색 작업에서는 비공개 기반선을 능가한다.

ABSTRACT

This paper firstly proposes a simple yet efficient generalized approach to apply differential privacy to text representation (i.e., word embedding). Based on it, we propose a user-level approach to learn personalized differentially private word embedding model on user generated contents (UGC). To our best knowledge, this is the first work of learning user-level differentially private word embedding model from text for sharing. The proposed approaches protect the privacy of the individual from re-identification, especially provide better trade-off of privacy and data utility on UGC data for sharing. The experimental results show that the trained embedding models are applicable for the classic text analysis tasks (e.g., regression). Moreover, the proposed approaches of learning differentially private embedding models are both framework- and data- independent, which facilitates the deployment and sharing. The source code is available at https://github.com/sonvx/dpText.

연구 동기 및 목표

  • 민감한 사용자 생성 콘텐츠(UGC)를 기반으로 훈련된 사전 학습된 단어 임베딩에서 재식별 위험을 해결하기 위해.
  • 특히 UGC 데이터를 위한 프라이버시 보장을 공식적으로 제공하는 프레임워크를 개발하여 비공개 단어 임베딩의 공유를 가능하게 하기 위해.
  • 텍스트 표현 학습에서 프라이버시(차별적 프라이버시를 통해)와 데이터 유틸리티 사이의 더 나은 트레이드오프를 달성하기 위해.
  • 프레임워크 및 데이터에 종속되지 않는 솔루션을 제공하여, 다양한 NLP 응용 분야에서 차별적 프라이버시 보장이 된 단어 임베딩의 배포 및 공유를 가능하게 하기 위해.
  • 표준 NLP 작업(예: 회귀)에서 차별적 프라이버시 임베딩의 유틸리티를 경험적으로 검증하기 위해.

제안 방법

  • 모든 단어 임베딩 프레임워크에 적용 가능한 일반화되고 미분 가능한 방법을 제안하여, 단어 임베딩 훈련에 노이즈를 주입함으로써 차별적 프라이버시를 달성한다.
  • 사용자 기반 차별적 프라이버시를 적용하기 위해, 각 사용자별로 기울기를 그룹화하고 개별 기여도를 보호하기 위해 보정된 노이즈를 추가한다.
  • 스토하스틱 경사 하강법 중 모델 파라미터에 노이즈를 주입하기 위해 라플라스 메커니즘을 사용하며, 프라이버시 예산(ε, δ)을 철저히 제어한다.
  • 모델 표현력을 유지하면서도 프라이버시 보장을 보장하는, 미분 가능한 노이즈 주입 프로세스를 활용한다.
  • 트윗과 같은 UGC 데이터에서 모델을 훈련하고, 의미 유사도 및 회귀 작업을 통해 유틸리티를 평가한다.
  • 프레임워크 및 데이터에 종속되지 않는 배포를 지원하여, 다양한 NLP 응용 분야에서 비공개 임베딩의 광범위한 공유를 가능하게 한다.

실험 결과

연구 질문

  • RQ1사용자 생성 콘텐츠에서 단어 임베딩 훈련에 차별적 프라이버시를 효과적으로 적용하여 재식별을 방지할 수 있는가?
  • RQ2문서 수준 또는 단어 수준 접근 방식에 비해 사용자 수준의 차별적 프라이버시가 프라이버시와 유틸리티 사이의 트레이드오프를 더 잘 개선하는가?
  • RQ3차별적 프라이버시 보장이 된 단어 임베딩가 후행 NLP 작업(예: 회귀)에 충분한 유틸리티를 유지할 수 있는가?
  • RQ4노이즈 주입이 단어 수준 성능을 악화시킬 수는 있지만, 임베딩 공간에서의 노이즈 주입이 문자 수준의 의미 검색을 향상시키는가?
  • RQ5민감한 텍스트 데이터(예: 비밀번호 패tern, 사회적 낙인을 받는 건강 주제 등)에 대한 연구를 위해 사전 학습된 차별적 프라이버시 보장이 된 단어 임베딩을 안전하게 공유할 수 있는가?

주요 결과

  • 제안된 dpUGC 프레임워크는 (ε, δ) = (0.125, 0.0184) 및 (0.125, 0.0197)에서 회귀 작업에서 최적 성능을 보이며, 프라이버시와 유틸리티 사이의 유리한 트레이드오프를 달성한다.
  • 단어 수준의 의미 검색 성능(MAP-Word)은 낮아졌지만, 차별적 프라이버시 모델은 비공개 기반선보다 문자 수준의 의미 검색(MAP-Char)에서 뛰어난 성능을 보이며, 노이즈가 문자 수준에서의 강건성을 향상시킬 수 있음을 시사한다.
  • 회귀 작업에서 dpUGC 모델의 RMSE는 비공개 기반선과 유사하거나 약간 우수하여, 높은 데이터 유틸리티 유지 능력을 보여준다.
  • 모델은 골드 표준 모델과 합리적인 의미 유사도를 유지하며, 차별적 프라이버시 적용 시에도 MAP 점수의 중간 정도의 감소만을 보인다.
  • 이 프레임워크는 프레임워크 및 데이터에 종속되지 않아 다양한 NLP 응용 분야에서 비공개 임베딩의 광범위한 배포 및 공유를 가능하게 한다.
  • 이 접근 방식은 개인의 재식별 위험이 없는 민감한 UGC 데이터(예: 비밀번호 패턴, 사회적 낙인을 받는 건강 주제 등)에 대한 연구를 안전하게 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.