Skip to main content
QUICK REVIEW

[논문 리뷰] Homomorphic Encryption and Federated Learning based Privacy-Preserving CNN Training: COVID-19 Detection Use-Case

Febrianti Wibawa, Ferhat Özgür Çatak|arXiv (Cornell University)|2022. 04. 16.
Privacy-Preserving Technologies in Data인용 수 5
한 줄 요약

이 논문은 컨volution 신경망(CNNs)을 사용한 코로나19 감지에 대해 프라이버시 보장 연합 학습 프레임워크를 제안한다. 이는 동형 암호화(HE)와 보안 다자간 계산을 조합하여 학습 중 데이터와 모델을 모두 보호한다. 방법은 암호화 오버헤드로 인해 실행 시간이 크게 증가하지만, 일반 텍스트 학습과 유사한 성능(정확도 ~84%)을 달성함으로써 프라이버시를 보장한다.

ABSTRACT

Medical data is often highly sensitive in terms of data privacy and security concerns. Federated learning, one type of machine learning techniques, has been started to use for the improvement of the privacy and security of medical data. In the federated learning, the training data is distributed across multiple machines, and the learning process is performed in a collaborative manner. There are several privacy attacks on deep learning (DL) models to get the sensitive information by attackers. Therefore, the DL model itself should be protected from the adversarial attack, especially for applications using medical data. One of the solutions for this problem is homomorphic encryption-based model protection from the adversary collaborator. This paper proposes a privacy-preserving federated learning algorithm for medical data using homomorphic encryption. The proposed algorithm uses a secure multi-party computation protocol to protect the deep learning model from the adversaries. In this study, the proposed algorithm using a real-world medical dataset is evaluated in terms of the model performance.

연구 동기 및 목표

  • 민감한 건강 데이터를 포함한 의료 AI 학습에서 발생하는 프라이버시 및 보안 위험을 해결하기 위해.
  • 특히 기울기 기반의 멤버십 공격 및 역공격을 포함한 딥러닝 모델의 프라이버시 공격을 완화하기 위해.
  • 다중 기관 환경에서 종단 간 프라이버시 보호를 위한 연합 학습에 동형 암호화를 통합하기 위해.
  • 실세계 의료 영상 데이터 기반으로 암호화된 학습의 성능 희생을 평가하기 위해.
  • 의료 응용 분야에서 안전하고 프라이버시 보장된 CNN 학습의 실현 가능성을 입증하기 위해.

제안 방법

  • 데이터가 여러 클라이언트(2~7명)에 국한되어 중앙 집중화되지 않는 연합 학습 설정을 사용한다.
  • 학습 중 모델 가중치와 기울기를 암호화하기 위해 다소 동형 암호화(SHE)를 적용하여 암호화된 데이터에서의 계산을 가능하게 한다.
  • 악성 협력자로부터 모델 파라미터를 보호하기 위해 보안 다자간 계산 프rotocol를 활용한다.
  • 실세계 코로나19 흉부 X-ray 데이터셋을 클라이언트 간에 분할하여 CNN을 학습시키며, 보안 수준을 확보하기 위해 암호문 모듈러스 값으로 128과 192를 사용한다.
  • 정확도, F1, 정밀도, 재현율과 같은 표준 지표를 사용하여 일반 모드와 암호화 모드에서의 모델 성능을 비교한다.
  • 동형 암호화 연산을 위해 HElib 라이브러리를 사용하며, 다양한 클라이언트 수와 보안 수준에서 실행 시간을 평가한다.

실험 결과

연구 질문

  • RQ1의료 영상 분류에 대해 동형 암호화를 연합 학습에 효과적으로 통합할 수 있는가? 이는 모델 성능 저하 없이 가능할 수 있는가?
  • RQ2다중 클라이언트 연합 환경에서 동형 암호화의 포함 여부가 학습 및 추론 실행 시간에 어떤 영향을 미치는가?
  • RQ3암호문 모듈러스를 128비트에서 192비트로 변경할 경우, 모델 정확도와 계산 오버헤드에 어떤 영향을 미치는가?
  • RQ4다양한 클라이언트 수에서 암호화 도메인의 모델 성능이 일반 텍스트 기반 기준과 비교해 어떻게 되는가?
  • RQ5제안된 방법이 협업 학습 환경에서 모델 역공격 및 멤버십 추론 공격에 얼마나 효과적으로 대응하는가?

주요 결과

  • 제안된 방법은 일반 도메인에서 84.5%의 정확도를 달성했고, 2~7명의 클라이언트에서 암호화 도메인에서는 83.75~85.25%의 정확도를 기록하여 성능 저하가 최소한이었다.
  • 모든 구성에서 F1 점수는 약 0.83~0.85 수준에서 안정적으로 유지되었으며, 7명의 클라이언트와 192비트 암호화에서 F1 점수는 일반 도메인의 0.868924와 암호화 도메인의 0.869584로 최고 성능 기록을 달성했다.
  • 암호화 도메인에서는 실행 시간이 크게 증가했으며, 특히 클라이언트 수가 많아질수록 동형 연산의 계산 비용으로 인해 뚜렷한 증가가 있었다. 다만, 소규모 클라이언트 수에서는 128비트와 192비트 모듈러스 간 차이가 미미했다.
  • 일부 구성, 예를 들어 5명의 클라이언트에서 일반 모델이 모든 지표에서 다소 뛰어난 성능을 보였으며, 이는 프라이버시 향상을 위해 성능을 희생하는 흐름을 반영한다.
  • 클라이언트 수의 변동에 관계없이 일관된 성능을 유지하여, 연합 학습 환경에서 클라이언트 수의 변동에 대한 강건성을 입증했다.
  • 결과적으로, HE 기반 연합 학습을 통한 프라이버시 보장 학습은 의료 영상 분야에서 실현 가능하며, 높은 정확도를 달성하면서도 민감한 데이터와 모델 파라미터를 보호할 수 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.