Skip to main content
QUICK REVIEW

[논문 리뷰] Machine Learning in Precision Medicine to Preserve Privacy via Encryption

William Briguglio, Parisa Moghaddam|arXiv (Cornell University)|2021. 02. 05.
Cancer Genomics and Diagnostics참고 문헌 15인용 수 23
한 줄 요약

이 논문은 MSK-IMPACT 데이터셋의 유전체 데이터를 대상으로 동형 암호화를 사용하여 개인정보 보호 기능을 갖춘 암 예측을 가능하게 하는 기계학습 암호화(MLE) 프레임워크를 제안한다. 프레임워크는 암호화된 데이터에서 모델을 훈련하여 77.47%의 정확도를 달성했으며, 이는 이전 연구보다 略히 높은 성능이다. 모든 코드와 클라우드 배포 서비스는 공개적으로 제공된다.

ABSTRACT

Precision medicine is an emerging approach for disease treatment and prevention that delivers personalized care to individual patients by considering their genetic makeups, medical histories, environments, and lifestyles. Despite the rapid advancement of precision medicine and its considerable promise, several underlying technological challenges remain unsolved. One such challenge of great importance is the security and privacy of precision health-related data, such as genomic data and electronic health records, which stifle collaboration and hamper the full potential of machine-learning (ML) algorithms. To preserve data privacy while providing ML solutions, this article makes three contributions. First, we propose a generic machine learning with encryption (MLE) framework, which we used to build an ML model that predicts cancer from one of the most recent comprehensive genomics datasets in the field. Second, our framework's prediction accuracy is slightly higher than that of the most recent studies conducted on the same dataset, yet it maintains the privacy of the patients' genomic data. Third, to facilitate the validation, reproduction, and extension of this work, we provide an open-source repository that contains the design and implementation of the framework, all the ML experiments and code, and the final predictive model deployed to a free cloud service.

연구 동기 및 목표

  • 민감한 유전체 및 전자 건강 기록 데이터를 공유할 때 발생하는 개인정보 泄露 문제를 해결하기 위한 것.
  • 원시 환자 정보를 폭 드러내지 않고도 암호화된 데이터에서 모델 훈련과 추론을 수행할 수 있는 기계학습 프레임워크를 개발하기 위한 것.
  • MSK-IMPACT 유전체 데이터셋을 활용하여 암 위험 예측 정확도를 향상시키면서도 데이터 프라이버시를 유지하기 위한 것.
  • 오픈소스 코드, 시스템 설계 및 무료 클라우드 기반 예측 서비스를 공개하여 재현 가능성과 커뮤니티의 확장성을 촉진하기 위한 것.

제안 방법

  • MLE 프레임워크는 Microsoft SEAL에서 제공하는 BFV 스킴을 사용한 동형 암호화(HE)를 통합하여 암호화된 유전체 특징에서 계산을 수행한다.
  • 특징 전처리에는 표준화, 로그 변환, 상호정보량 또는 카이제곱 검정을 통한 특징 선택이 포함되어 모델 성능을 최적화한다.
  • 선형 모델(로지스틱 회귀 및 SVM)이 동형 연산과 호환성이 높아 HE에 적합한 분류기로 선택되었다.
  • 모델은 동형 덧셈과 곱셈을 사용하여 암호화된 선형 점수를 계산하고, 최종적으로 암호화된 점수만 클라이언트로 전송하여 복호화 및 결정을 내린다.
  • 특징 전처리 및 분류기의 다양한 구성 설정을 지원하며, MSK-IMPACT 데이터셋에서 총 2,240개의 조합을 테스트하였다.
  • 의료 종사자가 원시 데이터 폭 드러내지 않고도 사례를 업로드하고 암호화된 예측 결과를 얻을 수 있도록 무료 클라우드 서비스를 구축하였다.

실험 결과

연구 질문

  • RQ1암호화된 유전체 데이터에서 모델을 훈련하고 배포함으로써 환자 개인정보 보호를 유지하면서도 높은 예측 정확도를 확보할 수 있는가?
  • RQ2동일한 MSK-IMPACT 데이터셋에서 동형 암호화 기반 모델의 성능은 비암호화 모델과 비교해 어떻게 되는가?
  • RQ3정확도와 예측 시간 측면에서 동형 암호화의 다양한 매개변수 설정에 따른 계산적 트레이드오프는 어떠한가?
  • RQ4의료, 머신러닝, 소프트웨어 엔지니어링 분야의 커뮤니티가 개인정보 보호 기반 기계학습을 쉽게 접근하고 재현할 수 있도록 하는 방법은 무엇인가?
  • RQ5MLE 프레임워크는 향후 더 복잡한 모델의 통합을 지원하면서도 데이터 프라이버시를 유지할 수 있는가?

주요 결과

  • MLE 프레임워크는 MSK-IMPACT 데이터셋에서 77.47%의 예측 정확도를 달성하여, 동일한 데이터셋에 대해 가장 최근에 발표된 연구보다 뛰어난 성능을 보였다.
  • 다양한 정밀도 수준에서도 모델 성능이 안정되었으며, 승수 10^3에서 10^9 사이에서는 정확도가 77.41%로 안정화되었다.
  • 최적의 설정은 표준화와 카이제곱 특징 선택을 사용한 로지스틱 회귀 분류기를 활용하여 77.47%의 정확도를 달성했다.
  • 프레임워크의 암호화 시간은 매개변수 설정에 따라 크게 달라졌으며, 최적 설정에서는 표준 기계에서 샘플당 평균 예측 시간이 약 3456초였다.
  • 정밀도 수준 10^6 이상에서 점수 순위가 100% 일치하여 상대적 위험 순서 정렬의 높은 일관성을 보였다.
  • 오픈소스 레포지터리가 공개되었으며, 전체 코드, 모델 배포 및 의료 종사자가 개인 사례를 안전하게 테스트할 수 있는 무료 클라우드 서비스가 포함되어 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.