Skip to main content
QUICK REVIEW

[논문 리뷰] Differential Private Stack Generalization with an Application to Diabetes Prediction

Quanming Yao, Xiawei Guo|arXiv (Cornell University)|2018. 11. 23.
Privacy-Preserving Technologies in Data참고 문헌 33인용 수 4
한 줄 요약

이 논문은 표본 또는 특징 기반의 데이터 분할을 통해 앙상블 학습을 활용하여 프라이버시 보장 로지스틱 회귀를 향상시키기 위해 차등적 프라이버시 스태킹(PST)을 제안한다. 이론적 및 실증적으로 특징 기반 분할이 표본 복잡도를 감소시키고 예측 성능을 햖थ하며, 특히 특징 중요도를 통합할 경우, 프라이버시를 유지하면서도 교차 조직 간 당뇨병 예측에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

To meet the standard of differential privacy, noise is usually added into the original data, which inevitably deteriorates the predicting performance of subsequent learning algorithms. In this paper, motivated by the success of improving predicting performance by ensemble learning, we propose to enhance privacy-preserving logistic regression by stacking. We show that this can be done either by sample-based or feature-based partitioning. However, we prove that when privacy-budgets are the same, feature-based partitioning requires fewer samples than sample-based one, and thus likely has better empirical performance. As transfer learning is difficult to be integrated with a differential privacy guarantee, we further combine the proposed method with hypothesis transfer learning to address the problem of learning across different organizations. Finally, we not only demonstrate the effectiveness of our method on two benchmark data sets, i.e., MNIST and NEWS20, but also apply it into a real application of cross-organizational diabetes prediction from RUIJIN data set, where privacy is of significant concern.

연구 동기 및 목표

  • 차등적 프라이버시에서 노이즈 주입으로 인한 프라이버시 보장 기계 학습의 성능 저하 문제를 해결하기 위해.
  • 앙상블 스태킹을 통해 차등적 프라이버시 로지스틱 회귀를 향상시켜 프라이버시를 훼손하지 않으면서도 예측 정확도를 높이기 위해.
  • 차등적 프라이버시 제약 하에서 표본 기반 및 특징 기반 분할 전략을 스태킹에서 비교하기 위해.
  • 특히 의료 데이터 환경에서 교차 조직 학습을 위해 가설 전이 학습을 차등적 프라이버시와 통합하기 위해.
  • 기준 데이터셋과 실세계의 RUIJIN 데이터셋을 사용한 당뇨병 예측 응용에서 방법을 검증하기 위해.

제안 방법

  • 학습 데이터를 표본 또는 특징 기반으로 분할하여 다수의 저수준 모델을 훈련하는 차등적 프라이버시 스태킹(PST) 프레임워크를 제안한다.
  • 저수준 모델의 예측을 조합하기 위해 고수준 로지스틱 회귀 모델을 사용하며, 엔드 투 엔드 차등적 프라이버시를 보장한다.
  • 특징 중요도 기반으로 특징을 그룹화하는 특징 기반 분할을 도입하여 표본 기반 분할보다 표본 복잡도를 감소시킨다.
  • 전이 학습에서 소스 도메인과 타겟 도메인 간에 프라이버시 예산 할당 전략을 적용하며, 양쪽 모두 ε = 1.0을 사용한다.
  • 도메인 전문가가 제공한 특징 중요도 점수를 활용해 특징 기반 PST에서 그룹화를 가중치화하여 모델 성능을 향상시킨다.
  • ε-차등적 프라이버시에 맞게 校정된 노이즈 주입 메커니즘을 적용하여 이론적 프라이버시 보장을 확보한다.

실험 결과

연구 질문

  • RQ1차등적 프라이버시 스태킹에서 특징 기반 분할이 표본 기반 분할보다 더 낮은 표본 복잡도를 보이는가?
  • RQ2특징 중요도를 분할 과정에 통합하면 차등적 프라이버시 하에서 예측 성능을 추가로 향상시킬 수 있는가?
  • RQ3제안된 PST 방법은 교차 조직 학습에서 표준 프라이버시 보장 로지스틱 회귀(PLR) 및 전이 학습 베이스라인과 비교해 어떻게 성능을 내는가?
  • RQ4제안된 방법은 환자 프라이버시를 유지하면서 실세계 의료 예측에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ5노이즈 주입이 모델 성능에 미치는 영향은 무엇이며, 스태킹은 이러한 성능 저하를 효과적으로 완화할 수 있는가?

주요 결과

  • PST에서 특징 기반 분할은 동일한 프라이버시 예산 하에서 표본 기반 분할보다 더 적은 표본 수가 필요하며, 더 낮은 표본 복잡도와 더 나은 실증 성능을 보였다.
  • 전문가가 제공한 특징 중요도를 사용한 PST-F(W)는 NEWS20 데이터셋에서 다른 방법들보다 높은 AUC(0.932)를 기록했다.
  • RUIJIN 당뇨병 데이터셋에서 PST-F(W)는 PLR(target) 및 PPHTL를 초월하여 교차 조직 학습에서 최고의 예측 성능을 달성했다.
  • 기준 데이터셋에서 제안된 방법은 표준 PLR 대비 최대 0.035의 AUC 향상을 보이며 뚜렷한 성능 향상을 입증했다.
  • 실증 결과는 특징 중요도 통합이 특히 저자료 환경 및 교차 조직 설정에서 성능 향상에 기여함을 확인했다.
  • 모든 실험에서 ε-차등적 프라이버시(ε = 1.0)를 유지하여 강력한 프라이버시 보장을 확보했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.