Skip to main content
QUICK REVIEW

[논문 리뷰] Privacy-Preserving Training of Tree Ensembles over Continuous Data

Samuel S. Adams, Chaitali Choudhary|arXiv (Cornell University)|2021. 06. 05.
Cryptography and Data Security참고 문헌 42인용 수 5
한 줄 요약

이 논문은 보안 다자간 계산(MPC)을 사용하여 연속 데이터에 대해 트리 앙상블을 훈련하는 프라이버시 보장 프로토콜을 제안한다. 두 당사자가 원시 데이터를 드러내지 않고 공동으로 결정 트리를 훈련할 수 있도록 하며, 비밀 분할과 동형 암호화를 활용하여 최소/최대 값과 분할 결정을 안전하게 계산함으로써, 증명 가능하고 안전한 보장을 갖춘 효율적인 프라이버시 보장 모델 훈련을 실현한다.

ABSTRACT

Most existing Secure Multi-Party Computation (MPC) protocols for privacy-preserving training of decision trees over distributed data assume that the features are categorical. In real-life applications, features are often numerical. The standard ``in the clear'' algorithm to grow decision trees on data with continuous values requires sorting of training examples for each feature in the quest for an optimal cut-point in the range of feature values in each node. Sorting is an expensive operation in MPC, hence finding secure protocols that avoid such an expensive step is a relevant problem in privacy-preserving machine learning. In this paper we propose three more efficient alternatives for secure training of decision tree based models on data with continuous features, namely: (1) secure discretization of the data, followed by secure training of a decision tree over the discretized data; (2) secure discretization of the data, followed by secure training of a random forest over the discretized data; and (3) secure training of extremely randomized trees (``extra-trees'') on the original data. Approaches (2) and (3) both involve randomizing feature choices. In addition, in approach (3) cut-points are chosen randomly as well, thereby alleviating the need to sort or to discretize the data up front. We implemented all proposed solutions in the semi-honest setting with additive secret sharing based MPC. In addition to mathematically proving that all proposed approaches are correct and secure, we experimentally evaluated and compared them in terms of classification accuracy and runtime. We privately train tree ensembles over data sets with 1000s of instances or features in a few minutes, with accuracies that are at par with those obtained in the clear. This makes our solution orders of magnitude more efficient than the existing approaches, which are based on oblivious sorting.

연구 동기 및 목표

  • 민감한 입력 값이 드러나지 않는 방식으로 연속 데이터에 대해 트리 앙상블의 안전한 공동 훈련을 가능하게 하기.
  • 특히 신뢰할 수 없는 다수의 당사자가 참여하는 환경에서 결정 트리 훈련 중 데이터 프라이버시를 유지하는 데 도전하는 문제를 해결하기.
  • 비밀 분할과 동형 암호화를 활용하여 최소/최대 값과 분할 조건을 안전하게 계산하는 효율적인 프로토콜을 설계하기.
  • 대규모 데이터에 대해 계산 효율성을 유지하면서도 어느 당사자도 상대방의 원시 데이터를 알 수 없도록 보장하기.
  • 분산 환경에서 프라이버시 보장 머신러닝을 위한 증명 가능하고 통신 효율적인 솔루션 제공하기.

제안 방법

  • 데이터 값을 표현하기 위해 비밀 분할을 사용하여, 어느 한 당사자도 원시 입력을 유추할 수 없도록 보장한다.
  • 두 당사자 간의 비교 프로토콜을 통해 '이상 또는 같다'(≥) 검사를 수행함으로써 데이터 포인트 간 최소 및 최대 값을 안전하게 계산한다.
  • 각 신규 데이터 포인트에 대해 비교 결과에 기반한 조건부 업데이트를 통해 현재 최소 및 최대 값을 안전하게 갱신한다.
  • 비밀 분할된 값으로 사용할 수 있도록 비교 결과를 매핑하는 변환 함수 π₂toQ를 활용한다.
  • 비밀 분할된 값으로 비교 연산(예: ≥)을 평가하기 위해 동형 암호화 기반 원리를 활용하여 전체 과정에서 프라이버시를 유지한다.
  • 알고리즘은 각 데이터 포인트를 반복적으로 처리하며, 현재 최소 및 최대 값의 비밀 분할 표현을 안전하게 유지한다.

실험 결과

연구 질문

  • RQ1두 당사자가 개별 입력을 드러내지 않고 연속 데이터의 최소 및 최대 값을 안전하게 계산하는 방법은 무엇인가?
  • RQ2공유된 데이터 위에서 결정 트리의 분할 점을 효율적이고 프라이버시를 보장하는 방식으로 결정하는 방법은 무엇인가?
  • RQ3보안 다자간 계산을 사용하여 연속 특성에 대해 트리 앙상블을 훈련하면서 통신 및 계산 오버헤드를 최소화할 수 있는가?
  • RQ4분산 환경에서 비교 및 조건부 업데이트를 안전하게 수행하는 데에 필요한 암호 기법은 무엇인가?
  • RQ5모델 훈련 과정에서 어느 당사자도 상대방의 데이터에 대해 필요한 이상의 정보를 얻지 못하도록 프로토콜이 어떻게 보장할 수 있는가?

주요 결과

  • 비밀 분할과 안전한 비교 프로토콜을 활용하여 연속 데이터에 대해 트리 앙상블의 안전한 공동 훈련이 가능하다.
  • 반복적인 안전한 업데이트를 통해 최소 및 최대 값 계산을 효율적으로 수행함으로써 고비용 암호 연산의 필요성을 줄였다.
  • π₂toQ 및 π_GEQ의 사용으로 비교 결과가 이후 처리에 적합한 비밀 분할 형태로 정확히 인코딩된다.
  • 모든 단계에서 상대 당사자의 원시 값 정보를 알 수 없도록 하여 프라이버시를 유지한다.
  • 알고리즘의 반복적이고 모듈러한 설계 덕분에 통신 효율적이며 대규모 데이터에 적합하다.
  • 기본적인 보안 다자간 계산 가정 하에 증명 가능한 보안 보장을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.