[논문 리뷰] Training DNN Model with Secret Key for Model Protection
이 논문은 학습 전에 비밀 키를 사용한 블록 단위 픽셀 재배열을 전처리 단계로 활용하는 키 기반 DNN 모델 보호 방법을 제안한다. 올바른 키를 사용할 경우 보호된 모델은 기준 성능에 가까운 정확도를 유지하지만, 잘못된 키 또는 그대로의 입력을 사용할 경우 성능이 급격히 떨어지며, 학습 또는 추론 오버헤드 없이 피지컬 트레이닝 공격에 저항한다.
In this paper, we propose a model protection method by using block-wise pixel shuffling with a secret key as a preprocessing technique to input images for the first time. The protected model is built by training with such preprocessed images. Experiment results show that the performance of the protected model is close to that of non-protected models when the key is correct, while the accuracy is severely dropped when an incorrect key is given, and the proposed model protection is robust against not only brute-force attacks but also fine-tuning attacks, while maintaining almost the same performance accuracy as that of using a non-protected model.
연구 동기 및 목표
- 학습된 DNN 모델이 소유권 확인이 가능하더라도 도용 및 오용에 취약한 점을 해결하기 위해.
- 소유권 식별을 넘어서 도난당한 모델의 무단 사용을 방지하는 모델 보호 메커니즘을 개발하기 위해.
- 네트워크 아키텍처를 변경하거나 계산 오버헤드를 추가하지 않는 경량이며 비침습적인 방법을 설계하기 위해.
- 올바른 키를 사용할 경우 높은 모델 정확도를 유지하면서도 브루트 포스 공격 및 피지컬 트레이닝 공격에 강력한 저항성을 확보하기 위해.
- 기존의 패ass포트 기반 또는 워터마킹 기반 기법에 비해 추가 네트워크 레이어를 추가하거나 복잡한 키 관리가 필요로 하는 기법들에 비해 키 관리의 단순화를 위해.
제안 방법
- 학습 및 추론 전에 비밀 키를 사용한 블록 단위 픽셀 재배열을 입력 이미지에 적용하는 전처리 단계를 수행한다.
- 학습 및 추론 단계 모두에 동일한 키를 적용하여 모델 동작의 일관성을 확보한다.
- 입력 이미지 전역에 걸쳐 겹치지 않는 블록 단위로 픽셀을 재배열하기 위해 고정된 블록 크기(M ∈ {2, 4, 8})를 사용한다.
- 재배열 작업은 올바른 키가 없이선 복원이 불가능한 결정론적이고 가역적인 방식으로 수행되어, 잘못된 키는 모델 성능을 심각하게 저하시킨다.
- 네트워크 아키텍처나 최적화기 설정을 수정하지 않고도 ResNet-18을 사용해 전처리된 이미지로 DNN을 학습시킨다.
- 이 방법은 데이터 증강, 혼합 정밀도 학습, 순환 학습률과 같은 표준 학습 기법과 호환된다.
실험 결과
연구 질문
- RQ1비밀 키를 입력 전처리 단계에 통합함으로써 DNN 모델을 무단 사용으로부터 보호할 수 있는가?
- RQ2올바른 키를 사용할 경우 제안된 방법이 비보호 기준 모델에 비해 높은 정확도를 유지하는가?
- RQ3잘못된 키를 사용하거나 그대로의 이미지를 입력했을 경우 모델 성능이 얼마나 떨어지는가?
- RQ4어떤 공격자가 위조된 키로 모델을 재학습시키는 피지컬 트레이닝 공격에 대해 보호된 모델이 저항력이 있는가?
- RQ5기존의 키 기반 또는 워터마킹 기반 모델 보호 기법과 비교해 성능 및 오버헤드 측면에서 제안된 방법은 어떠한가?
주요 결과
- 올바른 키를 사용할 경우 CIFAR-10에서 보호된 모델은 94.70%의 정확도를 기록했으며, 기준 모델의 95.45%에 매우 가까운 성능을 보였다.
- 잘못된 키를 사용한 테스트에서 M=2일 경우 정확도가 25.84%로 떨어졌고, M=4일 경우 20.01%, M=8일 경우 14.98%로 떨어져 강력한 키 의존성을 입증했다.
- 전처리되지 않은(원본) 이미지를 사용했을 경우 성능이 심각하게 떨어졌으며, 이는 적절한 전처리 없이 모델을 사용할 수 없음을 확인했다.
- 피지컬 트레이닝 공격에 대해서도 방법이 강력하게 유지되었으며, 학습 세트에서 1000개의 이미지를 사용해도 위조 키로 달성한 최고 정확도는 45.46%에 불과했고, 올바른 키 성능에 비해 훨씬 낮았다.
- 추가 네트워크 레이어나 복잡한 키 관리가 필요로 하는 기존의 패스포트 기반 기법 [3]에 비해 사용성과 효율성 측면에서 뛰어나며, 추가적인 네트워크 변경 없이도 유사한 정확도를 달성했다.
- 학습 또는 추론 시 오버헤드가 전혀 없으며, 네트워크를 수정하지 않고 경량 전처리 단계만 추가하기 때문이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.