Skip to main content
QUICK REVIEW

[논문 리뷰] AnomiGAN: Generative adversarial networks for anonymizing private medical data

Ho Bae, Dahuin Jung|arXiv (Cornell University)|2019. 01. 31.
Privacy-Preserving Technologies in Data참고 문헌 28인용 수 4
한 줄 요약

AnomiGAN은 생성적 적대 신경망 아키텍처를 활용하여 기존 데이터와 구분되지 않는 합성 데이터를 생성함으로써 개인 정보를 보호하는 프레임워크이다. 이는 하류 예측 작업에 필요한 유틸리티를 유지하면서도, 동일한 개인정보 보호 보장을 제공하는 비용 기반 개인정보 보호 기법보다 더 뛰어난 예측 성능을 달성한다. 이는 개인정보 보호와 모델 정확도 사이의 유리한 트레이드오프를 보여준다.

ABSTRACT

Typical personal medical data contains sensitive information about individuals. Storing or sharing the personal medical data is thus often risky. For example, a short DNA sequence can provide information that can not only identify an individual, but also his or her relatives. Nonetheless, most countries and researchers agree on the necessity of collecting personal medical data. This stems from the fact that medical data, including genomic data, are an indispensable resource for further research and development regarding disease prevention and treatment. To prevent personal medical data from being misused, techniques to reliably preserve sensitive information should be developed for real world application. In this paper, we propose a framework called anonymized generative adversarial networks (AnomiGAN), to improve the maintenance of privacy of personal medical data, while also maintaining high prediction performance. We compared our method to state-of-the-art techniques and observed that our method preserves the same level of privacy as differential privacy (DP), but had better prediction results. We also observed that there is a trade-off between privacy and performance results depending on the degree of preservation of the original data. Here, we provide a mathematical overview of our proposed model and demonstrate its validation using UCI machine learning repository datasets in order to highlight its utility in practice. Experimentally, our approach delivers a better performance compared to that of the DP approach.

연구 동기 및 목표

  • 개인의 개인정보를 훼손하지 않고도 민감한 의료 데이터, 특히 유전 정보를 공유하는 문제를 해결하기 위해.
  • 기계 학습 모델에 대한 높은 유틸리티를 유지하면서도 개인정보를 보호하는 데이터 익명화 방법을 개발하기 위해.
  • 기존 기법들, 예를 들어 비용 기반 개인정보 보호 기법과 비교해 개인정보 보호 및 예측 성능 양면에서 뛰어나지 않기 위해.
  • 통계적 또는 암호 기반 익명화 기법의 대안으로서 확장 가능하고 딥 러닝 기반의 대체 기법을 제공하기 위해.
  • 온라인 의료 서비스 및 기계 학습 as a service (MLaaS) 플랫폼에서 안전한 데이터 공유를 가능하게 하기 위해.

제안 방법

  • AnomiGAN은 조건부 GAN 아키텍처를 사용하며, 생성자는 랜덤 노이즈를 기반으로 목표 분류기의 조건에 따라 익명화된 의료 데이터를 생성하도록 학습된다.
  • 판별자는 사전 학습된 목표 분류기로 대체되며, 이는 생성자가 높은 예측 성능을 유지하는 데이터를 생성하도록 유도한다.
  • 개인정보 보호 정규화 항목은 개인정보 보호 파라미터 λₑ를 통해 도입되며, 원본 데이터와 생성된 데이터 간 유클리드 거리의 조절을 통해 데이터 유틸리티와 개인정보 보호 간의 트레이드오프를 제어한다.
  • 학습 중 계층별 분산 주입을 사용하여 다양한 데이터 분포에 대한 강건성과 일반화 능력을 향상시킨다.
  • 재구성 손실, 적대적 손실, 개인정보 인식 정규화 항목을 조합한 훈련 목표 함수를 사용하여 신뢰성, 개인정보 보호, 유틸리티의 균형을 맞춘다.
  • 모델은 데이터 유사성과 분류기 성능 최적화를 동시에 고려한 복합 손실 함수를 사용해 엔드 투 엔드로 훈련된다.

실험 결과

연구 질문

  • RQ1GAN 기반 프레임워크는 하류 기계 학습 작업에 필요한 유틸리티를 유지하면서도 민감한 의료 데이터를 효과적으로 익명화할 수 있는가?
  • RQ2동일한 개인정보 보호 제약 조건 하에서 AnomiGAN의 예측 정확도와 AUC는 비용 기반 개인정보 보호 기법과 비교해 어떻게 성능을 내는가?
  • RQ3개인정보 보호 파라미터 λₑ를 변화시킬 경우, 데이터 유틸리티와 개인정보 보호 간의 트레이드오프에 어떤 영향을 미치는가?
  • RQ4계층별 분산 주입은 익명화된 데이터의 강건성과 일반화 능력을 향상시키는가?
  • RQ5제안된 방법은 배경 인구에 대한 가정 없이 실제 의료 데이터셋에 적용 가능한가?

주요 결과

  • AnomiGAN은 비용 기반 개인정보 보호 기법과 동일한 개인정보 보호 보장을 제공하지만, 유방암 및 만성 신장질환 데이터셋에서 예측 정확도와 AUC가 유의미하게 뛰어나다.
  • 개인정보 보호 파라미터 λₑ가 증가함에 따라 원본 데이터와 익명화된 데이터 간 상관관계가 높게 유지되어 데이터 무결성이 높음을 시사한다.
  • λₑ가 증가함에 따라 하류 분류기의 평균 정확도와 AUC는 안정되거나 향상되어 개인정보 보호 제약 조건에 대한 강건성을 입증한다.
  • 계층별 분산 주입은 상관관계에 대해 제한적이지만 측정 가능한 영향을 미치며, 정확도와 AUC에 대한 열악한 영향을 최소화하여 네트워크 계층 전반에서 안정적인 성능을 유지함을 시사한다.
  • AnomiGAN의 훈련 시간은 효율적이며, 유방암 데이터셋의 경우 최적의 하이퍼파라미터 설정으로 2시간 이내, 만성 신장질환 데이터셋의 경우 1시간 이내에 완료된다.
  • 이 방법은 개인정보-유틸리티 트레이드오프와 예측 성능 면에서 비용 기반 개인정보 보호 기법을 능가하여 실제 의료 데이터 공유에 실용적인 대안이 될 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.