[논문 리뷰] Split Ways: Privacy-Preserving Training of Encrypted Data Using Split Learning
이 논문은 모델 학습 중 클라이언트 데이터를 보호하기 위해 스플릿 학습과 허밀토닉 암호화(HE)를 결합한 프라이버시 보장 기계학습 프레임워크를 제안한다. 클라이언트는 서버로 전송하기 전에 활성화 맵을 HE로 암호화하여 암호화된 데이터에서의 안전한 계산을 가능하게 하며, 평문 학습 대비 정확도 하락률이 2.65%에 불과하면서도 데이터 프라이버시를 완전히 유지한다.
Split Learning (SL) is a new collaborative learning technique that allows participants, e.g. a client and a server, to train machine learning models without the client sharing raw data. In this setting, the client initially applies its part of the machine learning model on the raw data to generate activation maps and then sends them to the server to continue the training process. Previous works in the field demonstrated that reconstructing activation maps could result in privacy leakage of client data. In addition to that, existing mitigation techniques that overcome the privacy leakage of SL prove to be significantly worse in terms of accuracy. In this paper, we improve upon previous works by constructing a protocol based on U-shaped SL that can operate on homomorphically encrypted data. More precisely, in our approach, the client applies Homomorphic Encryption (HE) on the activation maps before sending them to the server, thus protecting user privacy. This is an important improvement that reduces privacy leakage in comparison to other SL-based works. Finally, our results show that, with the optimum set of parameters, training with HE data in the U-shaped SL setting only reduces accuracy by 2.65% compared to training on plaintext. In addition, raw training data privacy is preserved.
연구 동기 및 목표
- 활성화 맵이 원본 클라이언트 데이터를 재구성하는 데 악용될 수 있는 스플릿 학습에서의 프라이버시 泄露 문제를 해결하기 위해.
- 모델 정확도에 영향을 주지 않으면서 활성화 맵을 보호하기 위해 허밀토닉 암호화(HE)를 스플릿 학습에 통합하기 위해.
- 프라이버시 보장 환경에서 HE 파라미터 설정과 학습 효율성, 모델 성능 간의 상호 상충 관계를 평가하기 위해.
- 암호화된 활성화 맵을 사용한 스플릿 학습이 높은 모델 정확도를 유지하면서도 데이터 기밀성을 확보할 수 있는지 입증하기 위해.
- 의료 AI와 같은 민감한 응용 분야에 적합한 실용적이고 안전한 기존 스플릿 학습의 대안을 제공하기 위해.
제안 방법
- 클라이언트는 원본 데이터에서 1D U-형태의 컨volutional 네트워크를 학습하고, 활성화 맵을 계산한 후 서버로 전송한다.
- 활성화 맵은 전송 전에 클라이언트 측에서 완전한 허밀토닉 암호화(FHE)를 사용하여 암호화된다.
- 서버는 암호화된 활성화 맵에서 역전파 및 기울기 갱신을 수행하여 복호화 없이도 계산을 수행할 수 있다.
- 모델은 스플릿 학습에서 통신량을 줄이고 특징 표현을 향상시키기 위해 U-형태 아키텍처를 사용한다.
- 정확도, 학습 시간, 통신 비용 간의 균형을 맞추기 위해 다항식 모듈러스(P), 계수 모듈러스(C), 스케일링 인자(Δ)를 변화시킨 5종의 다른 HE 파라미터 조합을 평가하였다.
- 학습 및 평가 작업은 평문 및 허밀토닉 암호화된 활성화 맵을 사용하여 MIT-BIH 심 arrhythmia 데이터셋에서 수행되었다.

실험 결과
연구 질문
- RQ1허밀토닉 암호화가 스플릿 학습에 효과적으로 통합되어 활성화 맵에서 발생하는 프라이버시 泄露를 방지할 수 있는가?
- RQ2다양한 HE 파라미터 설정이 스플릿 학습에서 모델 정확도, 학습 시간, 통신 오버헤드에 어떤 영향을 미치는가?
- RQ3암호화된 활성화 맵을 사용해 학습한 모델의 정확도는 평문 기반 학습과 비교해 어떻게 되는가?
- RQ4스플릿 학습에서 HE를 사용함으로써 데이터 프라이버시를 유지하면서도 만족스러운 모델 성능을 확보할 수 있는가?
- RQ5U-형태의 1D CNN 아키텍처가 암호화된 데이터를 사용하는 스플릿 학습에서 프라이버시와 성능을 향상시킬 수 있는가?
주요 결과
- 최적의 HE 파라미터 조합(P=4096, C=[40,20,20], Δ=2^21)은 테스트 정확도 85.41%를 달성하였으며, 평문 학습(88.06%) 대비 정확도 하락률은 2.65%에 그쳤다.
- P=8192 파라미터로 학습한 경우 정확도는 85.31%를 기록했지만, 최적의 P=4096 설정 대비 학습 시간은 3.67배 길었고, 통신 비용은 8.43배 높았다.
- 가장 작은 HE 파라미터 조합(P=2048, C=[18,18,18], Δ=2^16)은 학습 시간(5,018초)과 통신량(0.58 Tb)이 가장 적었지만, 정확도는 22.65%로 크게 하락하였다.
- U-형태의 스플릿 학습 아키텍처는 원래의 방법과 비교해 원시 입력과 레이블을 서버와 공유할 필요가 없어져 프라이버시 泄露를 감소시켰다.
- 시각적 분석 결과, 평문 활성화 맵은 원본 입력 데이터와 높은 유사성을 보이며 심각한 프라이버시 泄露를 시사했으나, 제안된 방법에서는 암호화로 이 문제를 완화하였다.
- 결과적으로 최적의 HE 파라미터를 사용할 경우 HE 기반 스플릿 학습이 프라이버시 보장 학습에 실현 가능하며, 정확도 하락률이 최소 2.65%에 그치는 것으로 확인되었다.
![Figure 3: Results when training locally on the plaintext MIT-BIH dataset with activation maps of size $[\text{batch size},256]$ .](https://ar5iv.labs.arxiv.org/html/2301.08778/assets/figures/local_training_plaintext_256.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.