Skip to main content
QUICK REVIEW

[논문 리뷰] NeuraCrypt: Hiding Private Health Data via Random Neural Networks for Public Training

Adam Yala, Homa Esfahanizadeh|arXiv (Cornell University)|2021. 06. 04.
Privacy-Preserving Technologies in Data인용 수 9
한 줄 요약

NeuraCrypt는 비밀스러운 건강 데이터를 익명화된 표현으로 변환하기 위해 무작위로 초기화된 딥 네ural 네트워크를 사용하는 프라이버시 보장 데이터 인코딩 프레임워크입니다. 이는 환자 개인정보를 유출하지 않으면서도 공개적으로 데이터를 공유할 수 있도록 하며, 예측 모델의 유효성도 유지합니다. 실증적으로, 흉부 X-ray 작업에서 경쟁적인 진단 정확도를 달성하고, 여러 기관이 독립적인 인코더를 사용해 공동으로 모델을 훈련시켜도 공격에 강건함을 입증했습니다.

ABSTRACT

Balancing the needs of data privacy and predictive utility is a central challenge for machine learning in healthcare. In particular, privacy concerns have led to a dearth of public datasets, complicated the construction of multi-hospital cohorts and limited the utilization of external machine learning resources. To remedy this, new methods are required to enable data owners, such as hospitals, to share their datasets publicly, while preserving both patient privacy and modeling utility. We propose NeuraCrypt, a private encoding scheme based on random deep neural networks. NeuraCrypt encodes raw patient data using a randomly constructed neural network known only to the data-owner, and publishes both the encoded data and associated labels publicly. From a theoretical perspective, we demonstrate that sampling from a sufficiently rich family of encoding functions offers a well-defined and meaningful notion of privacy against a computationally unbounded adversary with full knowledge of the underlying data-distribution. We propose to approximate this family of encoding functions through random deep neural networks. Empirically, we demonstrate the robustness of our encoding to a suite of adversarial attacks and show that NeuraCrypt achieves competitive accuracy to non-private baselines on a variety of x-ray tasks. Moreover, we demonstrate that multiple hospitals, using independent private encoders, can collaborate to train improved x-ray models. Finally, we release a challenge dataset to encourage the development of new attacks on NeuraCrypt.

연구 동기 및 목표

  • HIPAA 및 GDPR과 같은 엄격한 프라이버시 규정으로 인해 의료 데이터셋에 대한 공개 접근성이 제한되는 데 기인한 핵심 과제를 해결하기 위해.
  • 병원 및 데이터 소유자가 환자 수준의 프라이버시를 보장하면서도 원시 환자 데이터를 공개적으로 공유할 수 있도록 하기 위해.
  • 공유된 인코딩된 데이터로 훈련된 기계학습 모델의 높은 예측 유효성을 유지하기 위해.
  • 개인 정보를 드러내지 않고도 데이터를 중앙집중식으로 통합하지 않고도 다기관 협업을 가능하게 하기 위해.
  • 공개 챌린지 데이터셋을 통해 새로운 공격 기법과 개선 사항의 개발을 장려하기 위해.

제안 방법

  • 이 방법은 데이터 소유자만이 알고 있는 비밀 인코더로, 무작위로 구성된 딥 네럴 네트워크를 사용하여 원시 환자 데이터를 인코딩된 표현으로 변환합니다.
  • 인코딩 함수는 풍부한 무작위 함수의 가족에서 추출되며, 이론적으로 동일한 레이블을 가진 샘플들 사이에서 익명성을 보장합니다.
  • 함수의 복합을 통해 인코딩 함수의 가족을 반복적으로 풍부화시키며, 최적의 이항 함수 가족을 근사합니다.
  • 인코딩된 데이터와 공개 레이블을 공개적으로 공유함으로써 제3자가 익명화된 데이터로 모델을 훈련시킬 수 있습니다.
  • 다기관 환경에서는 각 기관이 독립적인 비밀 인코더를 사용하여 공유된 특징 공간에서 공동으로 훈련할 수 있습니다.
  • 공격에 대한 강건성은 MMD 기반 및 전이 학습 공격과 같은 적대적 공격을 통해 평가되며, 선형 인코딩 및 비공개 기반 모델과 비교됩니다.

실험 결과

연구 질문

  • RQ1계산적으로 효율적인 인코딩 체계가 개인 건강 데이터에 대해 의미 있는 프라이버시 보장을 제공하면서도 모델링 유효성을 유지할 수 있는가?
  • RQ2무작위 딥 네럴 네트워크가 프라이버시를 위한 이론적 최적의 인코딩 함수 가족을 효과적으로 근사할 수 있는가?
  • RQ3NeuraCrypt는 원시 데이터로 훈련된 모델과 비교해 진단 정확도에서 어떻게 성능을 내는가?
  • RQ4독립적인 인코더를 사용하는 다수의 기관이 개인 정보를暴露하지 않고도 더 정확한 모델을 공동으로 훈련시킬 수 있는가?
  • RQ5NeuraCrypt는 개인 인코더나 민감한 속성을 복원하고자 하는 적대적 공격에 얼마나 강건한가?

주요 결과

  • NeuraCrypt -ViT는 MIMIC-CXR에서 평균 AUC 80, CheXpert에서 평균 AUC 79를 기록하여 비공개 ViT 기반 모델과 동일한 성능을 달성했습니다.
  • 통합 데이터셋 설정에서 NeuraCrypt -ViT는 Combined-Clear에서 평균 AUC 83, Combined-Private에서 평균 AUC 82를 기록하여 비공개 협업으로 인한 성능 저하가 거의 없음을 보여주었습니다.
  • Combined-Private 데이터로 훈련한 모델은 MIMIC-CXR와 CheXpert 각각을 별도로 훈련한 경우보다 평균 AUC에서 각각 2점, 3점 향상되었습니다.
  • NeuraCrypt에 대한 적대적 공격은 평균 기반 모델을 뛰어넘지 못했으며, 깊이 2와 깊이 7 인코더에 대해 각각 MMD 공격 MSE 비율이 7.97과 4.44였습니다.
  • NeuraCrypt에 대한 전이 학습 공격은 AUC 84 ± 1을 기록했고, 이는 선형 인코딩에서의 89 ± 1보다 유의미하게 낮아 강력한 강건성을 입증했습니다.
  • 적대적 인코더 출력으로 훈련된 Edema 분류기는 진짜 NeuraCrypt 인코딩으로의 일반화에 실패했으며, AUC는 무작위 성능(52 ± 4) 수준이었고, 이는 전이 공격에 대한 저항성을 확인했습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.