Skip to main content
QUICK REVIEW

[논문 리뷰] Privacy-Preserving Tree-Based Inference with TFHE

Jordan Fréry, Andrei Stoian|arXiv (Cornell University)|2023. 02. 13.
Privacy-Preserving Technologies in Data인용 수 4
한 줄 요약

이 논문은 TFHE 완전호모모르픽 암호화 기법을 사용하여 트리 기반 기계학습 모델을 위한 프라이버시 보장 추론 프레임워크를 제안한다. 최적화된 정수 표현 방식과 프로그래머블 부트스트랩 기법을 활용하여, 클리어 데이터 추론과 거의 동일한 정확도를 달성하면서도 경쟁 가능한 지연 시간을 확보함으로써 암호화된 데이터 상에서 의사결정 트리, 랜덤 포레스트, 기울기 부스팅 트리의 안전한 구현을 가능하게 한다.

ABSTRACT

Privacy enhancing technologies (PETs) have been proposed as a way to protect the privacy of data while still allowing for data analysis. In this work, we focus on Fully Homomorphic Encryption (FHE), a powerful tool that allows for arbitrary computations to be performed on encrypted data. FHE has received lots of attention in the past few years and has reached realistic execution times and correctness. More precisely, we explain in this paper how we apply FHE to tree-based models and get state-of-the-art solutions over encrypted tabular data. We show that our method is applicable to a wide range of tree-based models, including decision trees, random forests, and gradient boosted trees, and has been implemented within the Concrete-ML library, which is open-source at https://github.com/zama-ai/concrete-ml. With a selected set of use-cases, we demonstrate that our FHE version is very close to the unprotected version in terms of accuracy.

연구 동기 및 목표

  • 민감한 입력을 폭 드러내지 않고도 암호화된 데이터 상에서 트리 기반 모델의 안전한 추론을 가능하게 하기 위해.
  • 기존 FHE 기반 트리 추론 방법에서의 높은 지연 시간과 정확도 손실 문제를 해결하기 위해.
  • 단일 의사결정 트리와 앙상블 모델(랜덤 포레스트, XGBoost) 모두를 최소한의 정확도 저하로 지원하기 위해.
  • 정밀도, 속도, 오류 내성 간 최적의 트레이드오프를 달성하기 위해 암호시스템 파라미터 선택을 자동화하기 위해.
  • FHE 기반 추론이 클리어 데이터 성능에 1% 이내로 정확도를 유지하면서도 실세계 구현에 실용적일 수 있음을 입증하기 위해.

제안 방법

  • 비선형 결정 함수(예: 비교 연산)를 동형적으로 평가하기 위해 TFHE의 프로그래머블 부트스트랩(PBS)을 활용하여 암호화된 데이터 상에서도 정확한 트리 탐색이 가능하도록 한다.
  • 메시지 공간 크기를 제어하고 동형 연산 중 노이즈 증가를 줄이기 위해 특징을 양자화된 정수로 표현한다.
  • 다중 트리 노드를 거쳐 암호문의 누적을 지원하도록 FHE 기법을 파arameter화하여 단계적 동형 계산을 가능하게 한다.
  • 모델 구조와 허용 가능한 오류 수준에 기반하여 최적의 FHE 파라미터(예: 보안 수준, 정밀도)를 결정하는 자동 최적화 파이프라인을 구현한다.
  • 의사결정 트리, 랜덤 포레스트, 기울기 부스팅 트리 전반에 걸쳐 분류 및 회귀 작업 모두를 지원한다.
  • 구현은 오픈소스 Concrete-ML 라이브러리에 통합되어 종단 간 프라이버시 보장 추론을 가능하게 한다.
Figure 1: TFHE operations representing algorithm 2 . The $\Sigma$ nodes represent leveled accumulation and $T[x]$ nodes represent table look-up operations implemented with PBS
Figure 1: TFHE operations representing algorithm 2 . The $\Sigma$ nodes represent leveled accumulation and $T[x]$ nodes represent table look-up operations implemented with PBS

실험 결과

연구 질문

  • RQ1TFHE 기반 동형 암호화는 암호화된 표본형 데이터 상에서 트리 기반 모델의 정확하고 효율적인 추론을 가능하게 할 수 있는가?
  • RQ2프로그래머블 부트스트랩의 사용이 FHE에서 비선형 결정 함수 평가의 실현 가능성에 어떻게 기여하는가?
  • RQ3프라이버시 보장 추론에서 정밀도의 양자화 수준, FHE 실행 지연 시간, 모델 정확도 간의 상호 트레이드오프는 어떠한가?
  • RQ4이 방법은 클리어 데이터 실행과 비교해 정확도가 유사한 결과를 달성하면서도 강력한 보안 보장을 유지할 수 있는가?
  • RQ5PBS 오류 확률의 선택이 실세계 구현에서 성능과 정확도에 어떻게 영향을 미치는가?

주요 결과

  • FHE 기반 추론은 성인, 와인, 스틸, 심장질환 등 테스트된 모든 데이터셋에서 클리어 데이터 추론과 1% 이내의 정확도를 달성했다.
  • FHE 추론의 지연 시간은 wdbc의 경우 1.18초에서 심장질환 데이터셋의 경우 81.94초까지 다양했으며, FP32 모델 대비 중앙값 기준 약 10,000배의 속도 향상을 기록했다.
  • PBS 오류 확률을 0.05로 설정함으로써 지연 시간을 최대 8배까지 줄일 수 있었고, 정확도 손실 없이 생산 환경에 실용적인 트레이드오프를 제공함을 입증했다.
  • 와인 데이터셋에서 랜덤 포레스트를 적용한 결과 98.5%의 정확도를 달성했으며, 클리어 데이터 모델의 98.1% 정확도와 유사한 성능을 보였다.
  • 스틸 데이터셋의 경우 FHE-XGBoost가 100% 정확도를 기록했고, FP32 기준 베이스라인과 동일한 성능을 보였으며, 지연 시간은 8.78초였다.
  • 자동화된 파라미터 선택 프로세스를 통해 각 모델에 최적의 FHE 파라미터 설정을 가능하게 하여 수동 튜닝을 최소화했다.
Figure 2: Experiment reporting the f1-score and average precision with varying precision on the spambase dataset.
Figure 2: Experiment reporting the f1-score and average precision with varying precision on the spambase dataset.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.