Skip to main content
QUICK REVIEW

[논문 리뷰] Application-driven Privacy-preserving Data Publishing with Correlated Attributes

Aria Rezaei, Chaowei Xiao|arXiv (Cornell University)|2018. 12. 26.
Privacy-Preserving Technologies in Data참고 문헌 50인용 수 6
한 줄 요약

이 논문은 생성적 적대적 네트워크를 사용하여 센서 데이터를 자동으로 왜곡시켜 민감한 속성(예: 신원)을 숨기면서도 목표 응용 프로그램을 위한 유용성을 유지하는, 새로운 프라이버시 보장 데이터 공개 프레임워크인 PR-GAN을 제안한다. 목표 속성과 민감한 속성 간의 상관관계를 모델링함으로써 푸퍼피시 프레임워크 하에서 강력한 프라이버시 보장을 달성하며, 새로운 그룹으로의 전이 시 성능 저하가 최소화되어 기존 방법에 비해 추론 및 학습 유용성 측면에서 뛰어난 성능을 발휘한다.

ABSTRACT

Recent advances in computing have allowed for the possibility to collect large amounts of data on personal activities and private living spaces. To address the privacy concerns of users in this environment, we propose a novel framework called PR-GAN that offers privacy-preserving mechanism using generative adversarial networks. Given a target application, PR-GAN automatically modifies the data to hide sensitive attributes -- which may be hidden and can be inferred by machine learning algorithms -- while preserving the data utility in the target application. Unlike prior works, the public's possible knowledge of the correlation between the target application and sensitive attributes is built into our modeling. We formulate our problem as an optimization problem, show that an optimal solution exists and use generative adversarial networks (GAN) to create perturbations. We further show that our method provides privacy guarantees under the Pufferfish framework, an elegant generalization of the differential privacy that allows for the modeling of prior knowledge on data and correlations. Through experiments, we show that our method outperforms conventional methods in effectively hiding the sensitive attributes while guaranteeing high performance in the target application, for both property inference and training purposes. Finally, we demonstrate through further experiments that once our model learns a privacy-preserving task, such as hiding subjects' identity, on a group of individuals, it can perform the same task on a separate group with minimal performance drops.

연구 동기 및 목표

  • 기계 학습을 통해 추론 가능한 민감한 속성(예: 신원, 위치)이 포함된 비정형 센서 데이터에서의 프라이버시 泄露 문제를 해결하기 위해.
  • 민감한 속성과 관련된 속성과 관련된 데이터 유용성을 유지하면서 효과적으로 민감한 속성을 숨기는 프레임워크를 개발하기 위해.
  • 목표 속성과 민감한 속성 간의 상관관계를 사전 지식으로 가진 적대자에 대비하여 상관관계를 모델링하고 방어하기 위해.
  • 신뢰할 수 있는 제3자에 의존하지 않고도 IoT 및 분산 센싱 환경에서 프라이버시 보장 데이터 공개를 가능하게 하기 위해.
  • 중앙 집중식 학습에서 얻은 모델이 다양한 사용자 그룹 간 일반화되어도 성능 저하 없이 적용 가능하도록 보장하기 위해.

제안 방법

  • 목표 함수의 유용성과 민감한 속성의 프라이버시를 균형 잡는 최적화 문제로 프라이버시 보장 데이터 공개 문제를 수립하기 위해.
  • 목표 응용 프로그램에 대한 유용성 손실를 최소화하면서 민감한 속성의 프라이버시를 극대화하는 데이터 왜곡을 학습하기 위해 생성적 적대적 네트워크(GAN)를 사용하기 위해.
  • 민감한 속성과 목표 속성 간의 상관관계 및 사전 지식을 모델링하기 위해 푸퍼피시 프라이버시 프레임워크를 통합하여 공식적인 프라이버시 보장을 확보하기 위해.
  • 목표 작업(예: 층 수식별, 신원 분류)에 대해 높은 정확도를 유지하면서 민감한 속성 추론 정확도를 낮추기 위해 생성기의 왜곡 생성을 학습하기 위해.
  • GAN이 응용 프로그램 인식 왜곡을 생성할 수 있도록 학습 중 목표 응용 프로그램의 레이블을 활용하기 위해.
  • 한 그룹에서 학습한 왜곡 모델을 새로운, 알려지지 않은 그룹에 배포할 때 성능 저하가 최소화되도록 이식성을 확보하기 위해.

실험 결과

연구 질문

  • RQ1GAN 기반 프레임워크는 목표 응용 프로그램에 대한 높은 유용성을 유지하면서 센서 신호의 민감한 속성을 효과적으로 숨길 수 있는가?
  • RQ2목표 속성과 민감한 속성 간의 상관관계를 모델링할 경우, 이를 忽시하는 것에 비해 프라이버시 보호가 얼마나 향상되는가?
  • RQ3한 그룹의 개인에서 학습한 프라이버시 보장 왜곡 모델이 완전히 다른 그룹에 대해 얼마나 잘 적용될 수 있는가?
  • RQ4기존 방법(DP, AP 등)과 비교했을 때, 제안된 방법은 프라이버시-유용성 트레이드오프 측면에서 어떤가?
  • RQ5왜곡된 데이터는 청소된 데이터에서 잘 일반화되는 새로운 모델을 훈련하는 데 효과적으로 사용될 수 있는가?

주요 결과

  • PR-GAN은 새로운 그룹에서 민감한 속성 추론 정확도를 3.71%로 낮혀 강력한 프라이버시 보장을 입증하였다.
  • 새로운 그룹에서 왜곡된 데이터를 사용한 추론 시 목표 응용 프로그램 정확도는 86.9%로 유지되어 유용성 손실가 최소화됨을 보여주었다.
  • WiFi 데이터셋에서 PR-GAN은 DP, AP 및 기준 GAN 방법보다 프라이버시-유용성 트레이드오프 측면에서 일관되게 뛰어난 성능을 보였으며, 특히 높은 유용성 예산에서 두드러졌다.
  • 훈련에 사용되었을 때, 왜곡된 데이터는 MNIST에서 96.72%, PubFig에서 98.84%, WiFi에서 72.06%, OccuTherm에서 99.73%의 정확도를 달성하여 청소된 데이터의 성능에 매우 가까웠다.
  • 왜곡 모델이 학습 그룹에서 완전히 다른, 알려지지 않은 개인 그룹으로 이식되어도 높은 유용성과 강력한 프라이버시 보장을 유지하였다.
  • 프레임워크는 푸퍼피시 모델 하에서 공식적인 프라이버시 보장을 제공하며, 사전 지식과 속성 간 상관관계를 고려하여 지능형 적대자에 대한 방어력을 강화하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.