[논문 리뷰] Privacy-Preserving Credit Card Fraud Detection using Homomorphic Encryption
이 논문은 암호화된 거래 데이터에서 민감한 정보를暴露하지 않고도 안전한 추론을 가능하게 하는 히든 엔트로피 암호화(HE)를 사용한 개인정보 보호형 신용카드 사기 탐지 시스템을 제안한다. HE 암호화된 XGBoost와 피드포워드 신경망 모델을 구현하고 비교한 결과, XGBoost는 강력한 탐지 성능을 유지하면서도 훨씬 빠른 추론 속도(6ms 대비 296ms)를 기록하여 실제 환경에 구현 가능한 개인정보 보호 보장을 갖춘 타당성을 입증한다.
Credit card fraud is a problem continuously faced by financial institutions and their customers, which is mitigated by fraud detection systems. However, these systems require the use of sensitive customer transaction data, which introduces both a lack of privacy for the customer and a data breach vulnerability to the card provider. This paper proposes a system for private fraud detection on encrypted transactions using homomorphic encryption. Two models, XGBoost and a feedforward classifier neural network, are trained as fraud detectors on plaintext data. They are then converted to models which use homomorphic encryption for private inference. Latency, storage, and detection results are discussed, along with use cases and feasibility of deployment. The XGBoost model has better performance, with an encrypted inference as low as 6ms, compared to 296ms for the neural network. However, the neural network implementation may still be preferred, as it is simpler to deploy securely. A codebase for the system is also provided, for simulation and further development.
연구 동기 및 목표
- 기존의 민감한 고객 거래 데이터를 평문으로 처리하는 신용카드 사기 탐지 시스템에서 발생하는 개인정보 유출 및 보안 위험을 해결하기 위해.
- 암호화된 거래 데이터에서의 안전한 추론을 가능하게 하는 히든 엔트로피 암호화(HE)를 활용한 사기 탐지 시스템 설계 및 구현을 위해.
- 실제 사기 탐지 환경에서 HE 암호화된 XGBoost 및 신경망 모델의 성능, 지연 시간, 실용성에 대한 평가를 위해.
- 시뮬레이션 및 개인정보 보호형 사기 탐지 시스템의 후속 개발을 위한 공개된 코드베이스 제공을 위해.
제안 방법
- 표준 머신러닝 파이프라인을 사용하여 ULB 및 Vesta 데이터셋의 평문 신용카드 거래 데이터를 기반으로 XGBoost와 피드포워드 신경망 모델을 훈련시켰다.
- CKKS 및 Paillier 방식을 사용하여 훈련된 모델을 히든 엔트로피 암호화 호환 버전으로 변환하여 암호화된 입력에서의 계산을 가능하게 하였다.
- PyTorch 호환 HE 라이브러리인 TenSEAL을 활용하여 두 모델의 암호화된 추론을 구현하고 벤치마킹하였다.
- XGBoost 트리 비교를 위해 순서 유지 암호화(OPE)를, 신경망 레이어를 위해 CKKS를 사용하여 히든 엔트로피 연산을 지원하였다.
- 클라이언트-호스트 아키텍처를 사용하여 시스템을 시뮬레이션하였으며, 클라이언트가 거래를 암호화하고 호스트는 평문 데이터에 접근하지 않고 추론을 수행하였다.
- 표준 사기 탐지 메트릭(ROC-AUC, F1, 정밀도, 재현율)을 사용하여 모델 성능을 평가하였고, 암호화된 데이터의 지연 시간과 스토리지 오버헤드를 벤치마킹하였다.
실험 결과
연구 질문
- RQ1히든 엔트로피 암호화를 효과적으로 활용하여 모델 성능을 저하시키지 않고도 개인정보 보호형 추론을 위한 신용카드 사기 탐지가 가능할 수 있는가?
- RQ2실제 사기 탐지 환경에서 HE 암호화된 XGBoost와 신경망 모델의 지연 시간과 스토리지 오버헤드는 어떻게 비교되는가?
- RQ3실제 거래 데이터에서 HE 암호화된 XGBoost와 신경망을 사용할 경우 탐지 정확도와 추론 속도 사이의 트레이드오프는 어떠한가?
- RQ4특히 OPE 기반 비교로 인해 HE 암호화된 XGBoost에서 정보 泄露 위험이 발생하는가? 그리고 이를 어떻게 관리할 수 있는가?
- RQ5생산 환경에서 확장 가능한 HE 기반 사기 탐지 시스템의 실제 구현 과제와 잠재적 최적화 방법은 무엇인가?
주요 결과
- HE 암호화된 XGBoost 모델은 최소 6ms의 추론 지연 시간을 기록하여, HE 암호화된 신경망 모델(296ms)에 비해 뚜렷이 빠른 성능을 보였다.
- ULB 데이터셋에서 XGBoost 모델은 F1 스코어 0.87과 AUC 0.92를 기록하여 강력한 탐지 성능을 입증하였다.
- 신경망 모델은 암호화된 가중치와 중간 활성값을 저장해야 하여 더 높은 스토리지 오버헤드를 보였지만, 더 단순한 배포 모델을 제공하였다.
- ULB 및 Vesta 데이터셋 양측에서 XGBoost 모델이 신경망 모델보다 더 뛰어난 탐지 성능을 보였으며, 특히 가짜 음성(false negatives)을 줄이는 데 유리하였다.
- 더 높은 지연 시간에도 불구하고, 단순하고 더 안전한 배포 파이프라인 덕분에 실무에서는 신경망 구현이 선호될 수 있다.
- OPE 기반 비교로 인한 잠재적 정보 泄露 위험이 HE-XGBoost에서 확인되었으며, 이는 안전한 훈련 또는 모델 오버헬딩의 필요성을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.