Skip to main content
QUICK REVIEW

[논문 리뷰] Privacy-Preserving Feature Selection with Secure Multiparty Computation

Xiling Li, Rafael Dowsley|arXiv (Cornell University)|2021. 02. 06.
Privacy-Preserving Technologies in Data참고 문헌 32인용 수 20
한 줄 요약

이 논문은 필터 방법을 사용한 프라이버시 보장 특성 선택을 위한 첫 번째 MPC 기반 프로토콜을 제안한다. 특히 보안적인 지니 불순도 스코어링 메커니즘을 활용한다. 이 프로토콜을 통해 다수의 당사자가 원시 데이터나 특성 식별자를 드러내지 않은 채 공동으로 상위-k개의 특성을 선택할 수 있으며, 반복 학습 및 악성 위협 모델 모두에서 정확도를 향상시키면서도 프라이버시를 유지한다. 런타임은 데이터 크기와 보안 설정에 따라 몇 초에서 약 1시간까지 다양하다.

ABSTRACT

Existing work on privacy-preserving machine learning with Secure Multiparty Computation (MPC) is almost exclusively focused on model training and on inference with trained models, thereby overlooking the important data pre-processing stage. In this work, we propose the first MPC based protocol for private feature selection based on the filter method, which is independent of model training, and can be used in combination with any MPC protocol to rank features. We propose an efficient feature scoring protocol based on Gini impurity to this end. To demonstrate the feasibility of our approach for practical data science, we perform experiments with the proposed MPC protocols for feature selection in a commonly used machine-learning-as-a-service configuration where computations are outsourced to multiple servers, with semi-honest and with malicious adversaries. Regarding effectiveness, we show that secure feature selection with the proposed protocols improves the accuracy of classifiers on a variety of real-world data sets, without leaking information about the feature values or even which features were selected. Regarding efficiency, we document runtimes ranging from several seconds to an hour for our protocols to finish, depending on the size of the data set and the security settings.

연구 동기 및 목표

  • 기계 학습의 프라이버시 보장(PPML) 분야에서 데이터 사전 처리 단계로의 보안 계산의 확장을 통해 격차를 해소하기 위해.
  • 원시 특성 값이나 선택 결과를 드러내지 않는 비공개 특성 순위 매기기 기능을 제공하는 보안적이고 효율적인 MPC 프로토콜을 설계하기 위해.
  • 실제 데이터 과학 시나리오에서의 실현 가능성과 효과성을 입증하기 위해.
  • 모델에 종속되지 않는 필터 기반 접근 방식을 사용하여 어떤 후속 기계 학습 모델과도 통합 가능하도록 하기 위해.
  • 향후 기계 학습 사전 처리 작업(예: 하이퍼파rameter 튜닝, 이방치 탐지, 결측치 처리 등)을 대상으로 한 PPML 프로토콜의 기초를 다지기 위해.

제안 방법

  • MPC를 기반으로 한 보안적 특성 스코어링 프로토콜을 제안하며, 이를 통해 분산된 당사자들 간에 특성 관련성 스코어를 비공개로 계산할 수 있도록 한다.
  • Z_q에서 q=2^64를 기반으로 하며, 3PC 또는 4PC의 신뢰성 있는 다수 모드에서 작동하는 필터 기반 특성 선택을 위한 MPC 프로토콜 π_GINI-FS를 설계한다.
  • 개별 데이터 포인트나 특성 값이 드러나지 않도록 보안적 변형된 지니 불순도 계산인 MS-GINI를 사용하여 특성 중요도를 계산한다.
  • MP-SPDZ를 사용하여 프로토콜를 구현하고 벤치마킹하여 반복 학습 및 악성 공격자 모델 모두에서 정확성과 보안성을 확보한다.
  • 서브 프로토콜로 구성된 프로토콜: π_MS-GINI는 보안적 지니 계산을 담당하고, π_FILTER-FS는 특성 순위 매기기 및 선택을 담당한다.
  • 공동 위치한 Azure 가상 머신을 사용한 분산 환경에서 프로토콜를 실행하며, 계산 및 통신 오버헤드를 측정한다.

실험 결과

연구 질문

  • RQ1기계 학습에서 특성 선택에 대해 보안적 다자간 계산(MPC)을 효과적으로 적용할 수 있는가? 이는 모델 학습과 독립적으로 이루어질 수 있는가?
  • RQ2다자 환경에서 지니 불순도를 어떻게 보안적으로 계산할 수 있는가? 이를 통해 원시 데이터를 드러내지 않은 채 특성 스코어링을 수행할 수 있는가?
  • RQ3실제 데이터 과학 워크로드에서 MPC를 사용한 비공개 특성 선택의 성능 오버헤드는 어느 정도인가?
  • RQ4MPC를 사용한 비공개 특성 선택은 프라이버시를 훼손하지 않으면서 후속 모델 정확도를 향상시키는가?
  • RQ5보안 모델(반복 학습 대 비공격적)이 프로토콜의 효율성과 확장성에 어떤 영향을 미치는가?

주요 결과

  • 제안된 MPC 기반 특성 선택 프로토콜은 인지 부하 감지, LSVT 음성 재활, 속도 데이팅 등의 다양한 실세계 데이터셋에서 로지스틱 회귀 모델의 정확도를 향상시킨다.
  • 보안적 MS-GINI 방법을 사용한 특성 선택은 피어슨 상관계수나 상호정보량과 같은 전통적인 비공개 특성 선택 기법과 비교해 유사한 정확도를 달성한다.
  • 프로토콜의 런타임은 데이터셋 크기와 보안 모델에 따라 몇 초에서 약 1시간까지 다양하며, 액티브(악성) 설정은 패assive(반복 학습) 설정보다 더 오래 걸린다.
  • 주요 성능 저하 요인은 지니 계산에서의 행렬 곱셈으로, 이는 인스턴스 수(m), 특성 수(p), 선택된 특성 수(k)에 따라 비례한다.
  • 프로토콜는 프라이버시를 성공적으로 유지한다: 원시 특성 값이나 선택된 특성에 대한 정보가 어느 당사자에게도 泄露되지 않았다.
  • MP-SPDZ에서의 구현은 다수의 신뢰할 수 없는 서버가 있는 표준 기계 학습 서비스 파이프라인에 비공개 특성 선택을 통합할 수 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.