Skip to main content
QUICK REVIEW

[논문 리뷰] Privacy-Preserving Collaborative Prediction using Random Forests

Irene Giacomelli, Somesh Jha|PubMed|2018. 11. 21.
Privacy-Preserving Technologies in Data참고 문헌 28인용 수 9
한 줄 요약

이 논문은 랜덤 포레스트를 위한 기밀성 보장 협업 예측 프레임워크를 제안하며, 여러 데이터 제공자가 원시 데이터를 공유하지 않고도 독립적으로 국지 모델을 훈련하고 클라우드에서 암호화된 모델을 사용해 예측을 안전하게 통합할 수 있도록 한다. 이 방법은 훈련 단계에서의 고비용 암호화 기법을 피하고, 비밀 공유와 무작위 평가를 통해 강력한 기밀성 보장을 확보하면서도 높은 효율성을 달성한다. 실험 결과, 실제 전자 건강 기록(EHR) 데이터에서 경쟁력 있는 정확도를 보였다.

ABSTRACT

We study the problem of privacy-preserving machine learning (PPML) for ensemble methods, focusing our effort on random forests. In collaborative analysis, PPML attempts to solve the conflict between the need for data sharing and privacy. This is especially important in privacy sensitive applications such as learning predictive models for clinical decision support from EHR data from different clinics, where each clinic has a responsibility for its patients' privacy. We propose a new approach for ensemble methods: each entity learns a model, from its own data, and then when a client asks the prediction for a new private instance, the answers from all the locally trained models are used to compute the prediction in such a way that no extra information is revealed. We implement this approach for random forests and we demonstrate its high efficiency and potential accuracy benefit via experiments on real-world datasets, including actual EHR data.

연구 동기 및 목표

  • 의료 및 유사 도메인에서 모델 정확도 향상을 위해 데이터 공유가 필요함과 동시에 철저한 기밀성 요구사항 간의 갈등을 해결하기 위해.
  • 모델 훈련 중에 보안 다자간 계산을 필요로 하지 않도록 하여 학습 과정을 국지적 사일로로 이동시키기 위해.
  • 독립적으로 훈련된 국지 랜덤 포레스트의 예측을 안전하고 효율적이며 확장 가능한 방식으로 통합하기 위한 시스템을 설계하기 위해.
  • 예측 단계에서 기밀성을 보장하기 위해 모델 또는 입력 데이터 泄露를 방지하는 암호 기법을 사용하기 위해.
  • 전자 건강 기록을 포함한 실제 데이터셋을 대상으로 본 연구 방법을 평가하여 실용적 타당성과 성능을 입증하기 위해.

제안 방법

  • 각 데이터 제공자는 자체 데이터를 기반으로 국지 랜덤 포레스트 모델을 훈련하며 원시 데이터를 공유하지 않는다.
  • 훈련된 모델들은 암호화되어 무신뢰성 클라우드 서버에 업로드되며, 암호화된 형태로 저장된다.
  • 새로운 비공개 입력을 위해 사용자는 서버에 암호화된 쿼리를 전송하며, 서버는 비밀 공유와 무작위 다항식 평가를 사용해 안전하게 앙상블 예측을 계산한다.
  • 통합 함수는 입력 및 모델의 기밀성을 유지하면서도 사전 정의된 집계 전략을 사용해 모든 국지 모델의 예측을 통합한다.
  • 프로토콜은 양자 암호 회로와 무작위 전송을 활용해 안전한 이중자 간 계산을 구현하며, 정직하지만 호기심 있는 모델에서 보안을 확보한다.
  • 시스템은 수평적 데이터 분할을 지원하며, 오프라인 제공자와 온라인 서버를 갖춘 클라우드 배포를 고려해 설계되어 있다.

실험 결과

연구 질문

  • RQ1원시 훈련 데이터를 공유하지 않고도 랜덤 포레스트를 사용해 안전한 협업 예측을 달성할 수 있는가?
  • RQ2국지에서 훈련된 암호화된 모델 통합 방식이 기존의 기밀성 보장 훈련 기법에 비해 효율성과 확장성 측면에서 뛰어나다고 할 수 있는가?
  • RQ3제안된 방법의 정확도는 통합된 데이터로 훈련된 중심화된 모델과 비교해 어떻게 되는가?
  • RQ4모델 초모수와 특성 수가 시스템 성능 및 통신 오버헤드에 어떤 영향을 미치는가?
  • RQ5이 방법은 특히 손상된 서버를 포함한 악성 공격자도 지원하도록 확장될 수 있는가?

주요 결과

  • 제안된 방법은 전자 건강 기록을 포함한 실제 데이터셋에서 경쟁력 있는 예측 정확도를 달성하며, 데이터셋의 특성과 분포에 따라 성능이 달라진다.
  • 시스템은 높은 효율성을 보이며, 기존의 기밀성 보장 훈련 프로토콜에 비해 통신 및 계산 비용이 크게 낮다.
  • 성능은 특성 수와 포레스트 초모수에 영향을 받으며, 이는 효율성을 최적화하기 위해 조정 가능하다.
  • 모델 학습 단계에서의 암호화 오버헤드를 제거하기 위해 모델 학습을 분산화함으로써 더 빠르고 확장 가능한 배포가 가능하다.
  • 정직하지만 호기심 있는 위협 모델 하에서 시스템은 기밀성이 보장되며, 예측 과정에서 모델 파rameter나 입력 데이터의 泄露가 없다.
  • 이 방법은 비밀성 보장의 다른 기법과 수직적(orthogonal)이며, 공격자가 배경 지식을 가질 수 있는 위협 모델에서 더 강력한 보장을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.