Skip to main content
QUICK REVIEW

[논문 리뷰] COVID-19 Imaging Data Privacy by Federated Learning Design: A Theoretical Framework

Anwaar Ulhaq, Oliver Burmeister|arXiv (Cornell University)|2020. 10. 13.
Privacy-Preserving Technologies in Data참고 문헌 31인용 수 15
한 줄 요약

이 논문은 코로나19 의료 영상에 대한 피어드 페더레이티드 러닝 시스템의 개인정보 보호를 향상시키기 위해 이론적 프레임워크인 차별적 프라이버시 디자인(dPbD)을 제안한다. 설계 수명 주기 전반에 걸쳐 차별적 프라이버시를 통합함으로써, 원시 데이터를 공유하지 않으면서도 확장성 있고 강건하며 개인정보 보호 기능을 갖춘 협업을 보장하며, 모델의 유용성을 유지하면서도 환자의 기밀성을 보호한다.

ABSTRACT

To address COVID-19 healthcare challenges, we need frequent sharing of health data, knowledge and resources at a global scale. However, in this digital age, data privacy is a big concern that requires the secure embedding of privacy assurance into the design of all technological solutions that use health data. In this paper, we introduce differential privacy by design (dPbD) framework and discuss its embedding into the federated machine learning system. To limit the scope of our paper, we focus on the problem scenario of COVID-19 imaging data privacy for disease diagnosis by computer vision and deep learning approaches. We discuss the evaluation of the proposed design of federated machine learning systems and discuss how differential privacy by design (dPbD) framework can enhance data privacy in federated learning systems with scalability and robustness. We argue that scalable differentially private federated learning design is a promising solution for building a secure, private and collaborative machine learning model such as required to combat COVID19 challenge.

연구 동기 및 목표

  • 글로벌 코로나19 연구에서 의료 영상 데이터를 활용한 안전하고 개인정보 보호 기능을 갖춘 협업의 증가하는 수요를 해결하기 위해.
  • 기존 페더레이티드 러닝 시스템이 개인정보 보호 보장에서 충분한 확장성과 강건성을 확보하지 못하는 한계를 극복하기 위해.
  • 후행적으로 추가하는 것이 아니라, 초기 설계 단계부터 차별적 프라이버시를 핵심 설계 원칙으로 통합하기 위해.
  • 의료 분야의 페더레이티드 러닝에서 개인정보, 유용성, 시스템 내성의 균형을 이루는 종합적인 이론적 프레임워크를 제공하기 위해.
  • 데이터 泄露 없이도 기관 간에 분산된 방식으로 민감한 코로나19 영상 데이터를 기반으로 한 AI 모델을 안전하게 훈련시킬 수 있도록 하기 위해.

제안 방법

  • 모든 페더레이티드 러닝 시스템 개발 단계에 개인정보 보호를 통합하는 이론적 프레임워크인 차별적 프라이버시 디자인(dPbD)을 제안한다.
  • 초기 설계 단계부터 최종 구현까지 차별적 프라이버시를 내재화한 프라이버시 디자인 접근 방식을 채택한다.
  • 개별 데이터 기여를 은폐하기 위해 모델 파라미터 집계 이전에 클라이언트 수준에서 노이즈를 주입한다.
  • 원시 데이터를 공유하지 않고도 모델 업데이트를 집계할 수 있도록 페더럴 평균 기법을 사용하여 데이터 국지성과 기밀성을 유지한다.
  • 데이터 변형이나 모델 역전환 공격에 강건하기 위해 저(global) 감도 함수를 설계한다.
  • 엔드 투 엔드 익명화, 확장성, 개인정보-유용성 트레이드오프 최적화 등의 원칙을 시스템 수명 주기 전반에 걸쳐 통합한다.

실험 결과

연구 질문

  • RQ1확장성 있고 강건한 차별적 프라이버시를 갖춘 페더럴 러닝 시스템 설계를 뒷받침할 수 있는 이론적 프레임워크는 어떻게 개발할 수 있는가?
  • RQ2모델 정확도나 시스템 성능을 저하시키지 않으면서도 차별적 프라이버시를 페더럴 러닝에 어떻게 통합할 수 있는가?
  • RQ3클라이언트 추가/제거 및 모델 업데이트를 포함한 페더럴 러닝 수명 주기 전반에서 데이터 기밀성을 보장하는 설계 원칙은 무엇인가?
  • RQ4시스템 확장, 비동기 훈련, 클라이언트 참여도 변화 상황에서도 개인정보 보장이 유지될 수 있는가?
  • RQ5의료 영상 응용 분야에서 글로벌 모델의 유용성이 손상되지 않도록 개인정보 보장이 유지되는 메커니즘은 무엇인가?

주요 결과

  • dPbD 프레임워크는 초기 단계부터 차별적 프라이버시를 통합하는 종합적이고 이론적으로 탄탄한 접근 방식을 제공한다.
  • 프레임워크는 원시 환자 영상 데이터가 한 번도 공유되지 않도록 보장하며, 오직 모델 파라미터 또는 노이즈 보호된 업데이트만 전송된다.
  • 저감도 함수와 내성적인 집계 전략을 통해 확장성과 강건성이 유지된다.
  • 클라이언트가 시스템에 추가되거나 제거되거나, 모델 아키텍처가 변경되더라도 개인정보 보호가 유지된다.
  • 통제된 노이즈 주입과 최적화된 시스템 파rameter를 통해 균형 잡힌 개인정보-유용성 트레이드오프가 달성된다.
  • 프레임워크는 코로나19 영상 외의 분야에도 적용 가능하며, 페더럴 러닝에서 다른 민감한 데이터 영역으로도 확장 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.