[논문 리뷰] Mitigating Leakage in Federated Learning with Trusted Hardware
이 논문은 동형 암호화를 사용함에도 불구하고 피처 값의 부분 순서가 주도 파티에게 泄露되는 연립학습(federated learning) 환경에서의 정보 泄露를 완화하기 위해 신뢰 실행 환경(TEE) 기반의 SecureBoost 보안 변형 두 가지를 제안한다. 제안된 N-TEE 및 1-TEE 프로토콜은 이와 같은 泄露를 완전히 제거하며, SecureBoost 대비 1.2–5.4× 빠른 계산 속도와 5–49× 감소된 통신량을 달성한다. 또한 약간의 가정 하에 고정밀도 데이터 복원 공격이 가능함을 보여주며, 개인정보 보호 시스템에서 미세한 정보 泄露의 위험성을 입증한다.
In federated learning, multiple parties collaborate in order to train a global model over their respective datasets. Even though cryptographic primitives (e.g., homomorphic encryption) can help achieve data privacy in this setting, some partial information may still be leaked across parties if this is done non-judiciously. In this work, we study the federated learning framework of SecureBoost [Cheng et al., FL@IJCAI'19] as a specific such example, demonstrate a leakage-abuse attack based on its leakage profile, and experimentally evaluate the effectiveness of our attack. We then propose two secure versions relying on trusted execution environments. We implement and benchmark our protocols to demonstrate that they are 1.2-5.4X faster in computation and need 5-49X less communication than SecureBoost.
연구 동기 및 목표
- SecureBoost, 동형 암호화를 사용하는 개인정보 보호 연립학습 시스템에서 발생하는 미세한 정보 泄露를 식별하고 악용하는 것.
- 이러한 泄露가 정밀한 데이터 복원 공격을 가능하게 하여 민감한 데이터 값을 높은 정확도로 재구성할 수 있음을 입증하는 것.
- 이러한 泄露를 제거하면서 성능을 향상시키는 두 가지 TEE 기반 보안 프로토콜(N-TEE 및 1-TEE)을 설계하고 구현하는 것.
- 실제 금융 데이터를 사용하여 제안된 프로토콜의 성능 및 보안성을 SecureBoost와 비교 평가하는 것.
제안 방법
- 공격은 Paillier 동형 암호화를 통해 SecureBoost의 분할 찾기 과정에서 드러나는 피처를 따라 피벗 파티의 데이터 샘플에 대한 부분 순서 정보를 악용한다.
- 정보 泄露 악용 공격은 유추된 부분 순서와 근사적인 데이터 분포(예: 10% 단위 증가)를 사용하여 샘플에 값을 할당함으로써 랜덤 추측보다 정확도를 향상시킨다.
- N-TEE는 모든 당사자에 TEE 가용성을 가정하여, Paillier 암호화의 오버헤드를 피하기 위해 효율적인 대칭 암호화 및 에이전스 내에서의 안전한 계산을 가능하게 한다.
- 1-TEE는 주도 파티에만 TEE가 필요하도록 하여 신뢰 가정을 줄이며, 대칭 암호화 및 안전한 키 교환을 사용해 피벗 파티의 데이터를 보호한다.
- 양 프로토콜은 Intel SGX 에이전스를 사용하여 격리 실행, 봉인, 원격 확인을 통해 무결성과 기밀성 보장을 보장한다.
- 프로토콜은 FATE 프레임워크에 통합되어 구현되었으며, 효율성을 위해 Paillier 대신 AES와 일회용 패드를 사용한다.
실험 결과
연구 질문
- RQ1SecureBoost에서 분할 찾기 과정에서 동형 암호화를 사용함으로써 발생하는 부분 정보 泄露가 민감한 데이터 값을 재구성하는 데 이용될 수 있는가?
- RQ2공격자가 데이터 분포에 대해 근사적인 지식(예: 10% 단위 증가)만을 가진다면, 이러한 泄露 악용 공격의 정확도는 어느 정도인가?
- RQ3신뢰 실행 환경(TEE)을 사용하여 이러한 泄露를 제거하면서도 기존 암호 기반 접근 방식보다 성능을 향상시킬 수 있는가?
- RQ4TEE 기반 프로토콜의 성능 특성(계산 시간 및 통신 크기)은 SecureBoost와 비교해 어떻게 다른가?
- RQ5TEE 기반 연립학습 프로토콜에서 보안, 성능, 신뢰 가정 간의 상호 트레이드오프는 어떠한가?
주요 결과
- 근사적인 데이터 분포(예: 10% 단위 증가)를 가정할 경우, 泄露 악용 공격은 연령과 급여 값에 대해 각각 ±5년 이내 및 ±2000달러 이내에서 99% 이상의 정확도를 달성했다.
- 최소-최대 범위만을 사용한 공격은 랜덤 추측 대비 최대 35% 높은 정확도를 보였지만, 추가적인 분포 지식이 없으면 높은 정밀도를 확보하지 못했다.
- N-TEE 및 1-TEE는 분할 찾기 과정에서 발생하는 모든 泄露를 제거하여 민감한 데이터 값의 복원을 완전히 방지했다.
- N-TEE는 SecureBoost 대비 1.2–5.4× 빠른 계산 속도와 32–49× 감소된 통신량을 기록했으며, 10^5개 샘플 기준으로 각각 314초 및 9MB였다.
- 1-TEE는 SecureBoost 대비 1.2–5.4× 빠른 계산 속도와 5–10× 감소된 통신량을 기록했으며, 10^5개 샘플 기준으로 각각 323초 및 33MB였다.
- 성능 향상은 TEE 기반 프로토콜에서 Paillier 동형 암호화를 효율적인 AES 및 일회용 패드 암호화로 대체함으로써 기인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.