Skip to main content
QUICK REVIEW

[논문 리뷰] On a Utilitarian Approach to Privacy Preserving Text Generation

Zekun Xu, Abhinav Aggarwal|arXiv (Cornell University)|2021. 04. 23.
Privacy-Preserving Technologies in Data참고 문헌 37인용 수 8
한 줄 요약

이 논문은 소음이 추가된 단어 임베딩의 k개 이웃 중에서 확률적으로 선택하는 방식으로, 제2위 입찰자가 공개되는 제2차입찰 경매에서 영감을 얻어 두 번째로 가까운 이웃에 초점을 맞춘, 차별적 보장이 있는 텍스트 생성을 위한 새로운 방법인 비크리프 메커니즘을 제안한다. 이 방법은 동일한 경험적 비밀 보장 조건 하에서 기존 최고 수준의 방법들보다 최대 50% 높은 유틸리티를 달성한다.

ABSTRACT

Differentially-private mechanisms for text generation typically add carefully calibrated noise to input words and use the nearest neighbor to the noised input as the output word. When the noise is small in magnitude, these mechanisms are susceptible to reconstruction of the original sensitive text. This is because the nearest neighbor to the noised input is likely to be the original input. To mitigate this empirical privacy risk, we propose a novel class of differentially private mechanisms that parameterizes the nearest neighbor selection criterion in traditional mechanisms. Motivated by Vickrey auction, where only the second highest price is revealed and the highest price is kept private, we balance the choice between the first and the second nearest neighbors in the proposed class of mechanisms using a tuning parameter. This parameter is selected by empirically solving a constrained optimization problem for maximizing utility, while maintaining the desired privacy guarantees. We argue that this empirical measurement framework can be used to align different mechanisms along a common benchmark for their privacy-utility tradeoff, particularly when different distance metrics are used to calibrate the amount of noise added. Our experiments on real text classification datasets show up to 50% improvement in utility compared to the existing state-of-the-art with the same empirical privacy guarantee.

연구 동기 및 목표

  • 기존의 차별적 보장 텍스트 생성 메커니즘에서 작은 소음이 원본 단어의 재구성 가능성을 높이는 경험적 비밀 위험을 해결하기 위해.
  • 메트릭-DP 텍스트 생성에서 비밀 보장과 유틸리티의 상호 균형을 최적화할 수 있는 조절 가능한 메커니즘을 개발하기 위해.
  • 다양한 거리 척도와 메커니즘 간의 비밀-유틸리티 균형을 비교하기 위한 통합 경험 기반 벤치마크를 제공하기 위해.
  • 첫 번째 이웃을 초월하여 k ≥ 2개의 근접 이웃으로의 선택을 일반화하기 위한 확률적 프레임워크를 제안하기 위해.
  • 실세계 텍스트 분류 데이터셋에서 메커니즘을 경험적으로 검증하고, 기존 최고 수준의 접근 방식들보다 뛰어난 성능을 입증하기 위해.

제안 방법

  • 소음이 추가된 단어 임베딩의 k개 이웃에서 출력 단어를 선택하는 방식으로 파arameterized된 새로운 종류의 차별적 보장 메커니즘인 비크리프 메커니즘을 제안한다.
  • 첫 번째 및 두 번째 이웃 간의 선택 균형을 조절하기 위한 조절 파라미터를 사용하며, 이는 제2차입찰 경매 메커니즘에서 두 번째로 높은 입찰만 공개되는 것에서 영감을 받았다.
  • k개의 근접 이웃에 대해 확률 분포를 적용하며, 선택 가능성은 소음이 추가된 임베딩에서의 거리에 반비례한다. 이때 조절 파라미터는 제약 최적화를 통해 최적화된다.
  • 사전 훈련된 임베딩 공간(GloVe, FastText 등)에서 단어 임베딩 간의 거리로 비밀 보장을 조정하는 메트릭-DP 프레임워크를 사용한다.
  • 선택 범위를 k ≥ 2개의 근접 이웃으로 확장하는 일반화된 비크리프 메커니즘을 도입하며, 출력 확률은 역거리의 지수 함수와 조절 파라미터에 비례한다.
  • 재구성 위험을 비밀 보장 지표로, 유틸리티 손실을 유틸리티 지표로 사용하여 비밀-유틸리티 균형을 경험적으로 평가하며, 고정된 유틸리티 허용 오차 내에서 조절 파라미터를 최적화한다.

실험 결과

연구 질문

  • RQ1첫 번째 근접 이웃 선택을 초월함으로써, 경험적 비밀 보장 조건을 유지하면서 유틸리티를 향상시킬 수 있는 차별적 보장 텍스트 생성 메커니즘이 존재하는가?
  • RQ2첫 번째가 아닌 두 번째 근접 이웃을 선택할 경우, 텍스트 생성에서 경험적 비밀-유틸리티 균형에 어떤 영향을 미치는가?
  • RQ3여러 근접 이웃에 대한 확률적 선택 메커니즘은 유틸리티를 떨어뜨리지 않으면서 비밀 보장을 얼마나 향상시킬 수 있는가?
  • RQ4다양한 거리 척도(GloVe vs. FastText 등)는 제안된 메커니즘의 비밀 보장 및 유틸리티 성능에 어떤 영향을 미치는가?
  • RQ5다양한 거리 척도를 사용하는 메트릭-DP 메커니즘 간의 비밀-유틸리티 균형을 비교하기 위한 통합 경험 기반 벤치마크를 구축할 수 있는가?

주요 결과

  • 제안된 비크리프 메커니즘은 실세계 텍스트 분류 데이터셋에서 동일한 경험적 비밀 보장 조건 하에서 기존 최고 수준의 방법들보다 최대 50% 높은 유틸리티를 달성한다.
  • 소음의 크기가 작을수록 두 번째 근접 이웃 선택이 첫 번째 근접 이웃 메커니즘보다 재구성 위험을 크게 감소시킨다.
  • 세 번째 근접 이웃으로의 선택 확장은 약간의 개선을 가져오지만, 네 번째 및 다섯 번째 이웃으로의 확장은 유틸리티나 비밀 보장 측면에서 유의미한 개선을 제공하지 못한다.
  • 다양한 임베딩 모델에 대해 강건성을 보이며, 특히 단어 간 거리가 더 작은 FastText에서는 더 나은 비밀-유틸리티 균형을 보였다.
  • 경험적 비밀 보장 지표인 재구성 위험은 이론적 DP 파라미터만으로는 완전히 반영되지 않는 실제 세계의 비밀 위험을 효과적으로 캡처한다.
  • 제약 최적화 프레임워크는 유틸리티 손실을 사전에 설정된 허용 오차 내에 유지하면서 비밀 보장을 극대화하는 최적의 조절 파라미터를 성공적으로 식별했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.