[논문 리뷰] Secret Sharing based Secure Regressions with Applications
이 논문은 선형 및 로지스틱 회귀를 위한 비밀 분할 기반의 안전한 다자간 회귀 프로토콜을 제안하여 데이터 소유자 간의 기밀 유지 협업을 가능하게 한다. 모델 훈련을 안전한 행렬 합산과 이인간 행렬 곱셈으로 줄임으로써, 선형적으로 증가하는 통신 및 계산 비용을 가지면서도 기존의 평문 모델과 동일한 정확도를 달성한다. 이는 대규모 데이터셋에서의 확장성과 금융 리스크 제어 분야에서의 실제 응용을 입증한다.
Nowadays, the utilization of the ever expanding amount of data has made a huge impact on web technologies while also causing various types of security concerns. On one hand, potential gains are highly anticipated if different organizations could somehow collaboratively share their data for technological improvements. On the other hand, data security concerns may arise for both data holders and data providers due to commercial or sociological concerns. To make a balance between technical improvements and security limitations, we implement secure and scalable protocols for multiple data holders to train linear regression and logistic regression models. We build our protocols based on the secret sharing scheme, which is scalable and efficient in applications. Moreover, our proposed paradigm can be generalized to any secure multiparty training scenarios where only matrix summation and matrix multiplications are used. We demonstrate our approach by experiments which shows the scalability and efficiency of our proposed protocols, and finally present its real-world applications.
연구 동기 및 목표
- 여러 데이터 소유자 간의 협업 기계 학습을 가능하게 하면서도 데이터 기밀성을 유지하는 데 도전 과제를 해결하기 위해.
- 원시 데이터를 폭 lộ하지 않고도 선형 및 로지스틱 회귀 모델을 훈련하기 위한 효율적이고 확장 가능한 프로토콜을 개발하기 위해.
- 이전의 안전한 다자간 계산 방법이 다수의 참가자에게 일반화되지 못하는 한계를 극복하기 위해.
- 리스크 제어 및 지능형 대출과 같은 실생활 응용 분야에서 안전한 회귀의 실용적 구현을 가능하게 하기 위해.
- 안전한 훈련이 평문 훈련과 동일한 모델 성능을 달성할 수 있으며, 오직 선형적으로 증가하는 오버헤드만을 수반한다는 것을 입증하기 위해.
제안 방법
- 비밀 분할을 사용하여 다자간 회귀 훈련을 안전한 다자간 행렬 합산과 안전한 이인간 행렬 곱셈으로 환원한다.
- 계산 중 데이터 입력, 모델 파라미터, 레이블을 비밀 분할로 보호하여 어느 한 당사자도 민감한 정보를 유출하지 못하도록 보장한다.
- 안전한 이인간 행렬 곱셈을 블랙박스 프로토콜로 간주하여, 합산과 곱셈에 의존하는 모든 훈련 과정으로의 일반화를 가능하게 한다.
- 시그모이드와 같은 비선형 함수를 처리하기 위해 다항식 근사(3차)를 적용하여 비밀 분할에 호환되는 연산으로 변환한다.
- 신뢰할 수 있는 초기화자(Trusted Initializer)가 있는지 없는지에 따라 두 가지 변형을 구현하여 다양한 구현 환경을 지원한다.
- 기밀성 제약 조건 하에서 모델 최적화를 위해 미니배치 경량 하강법과 적응형 학습률 탐색을 적용한다.
실험 결과
연구 질문
- RQ1최소한의 계산 및 통신 오버헤드를 가지면서도 데이터 기밀성을 유지하는 다자간 안전한 회귀를 달성할 수 있는가?
- RQ2비밀 분할 기반의 회귀 성능이 정확도 및 효율성 측면에서 평문 회귀와 비교해 어떻게 되는가?
- RQ3제안된 프로토콜이 수평적 및 수직적 데이터 분할 환경 모두에서 데이터 크기가 증가함에 따라 선형적으로 확장 가능한가?
- RQ4신뢰할 수 있는 초기화자가 안전한 회귀의 통신 및 계산 비용에 어떤 영향을 미치는가?
- RQ5선형 및 로지스틱 회귀를 초월하여 행렬 연산에 의존하는 다른 기계 학습 모델로 프로토콜을 일반화할 수 있는가?
주요 결과
- 제안된 안전한 선형 및 로지스틱 회귀 프로토콜은 모든 벤치마크 데이터셋에서 평문 모델과 동일한 성능(RMSE 및 AUC)을 달성한다.
- 안전 모델의 실행 시간은 데이터 크기와 선형적으로 증가하여, 대규모 데이터셋에 대한 확장성의 가능성을 확인한다.
- 뉴스 데이터셋에서 Sec-LiRe-OTI-H는 평문 선형 회귀의 32.41초 대비 78.52초를 소요하여 2.4배의 증가를 보였으며, 기밀 보장의 관점에서 수용 가능한 수준이다.
- APS 데이터셋에서 로지스틱 회귀의 경우 Sec-LoRe-OTI-H는 평문 LoRe 대비 1,374.45초를 소요하여 9.06배의 증가를 보였는데, 이는 다항식 근사를 위한 추가 라운드로 인한 것이다.
- 신뢰할 수 있는 초기화자(TI)를 사용한 프로토콜은 수직 분할 환경에서 특성 공유를 방지함으로써 통신 비용을 감소시켜 효율성을 향상시켰다.
- 이 방법은 CDFinance 및 Ant Financial의 온라인 리스크 제어 및 자동 대출 응용 분야에서 성공적으로 실전에 도입되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.