Skip to main content
QUICK REVIEW

[논문 리뷰] Who Leaked the Model? Tracking IP Infringers in Accountable Federated Learning

Shuyang Yu, Junyuan Hong|arXiv (Cornell University)|2023. 12. 06.
Privacy-Preserving Technologies in Data인용 수 4
한 줄 요약

이 논문은 백도어 기반 주입을 사용하여 글로벌 모델에 클라이언트 고유 워터마크를 임bedding하는 책임 있는 피어드레이티드 러닝을 위한 Decodable Unique Watermarking (DUW)을 제안한다. 이는 IP 침해자의 정확한 추적을 가능하게 한다. DUW는 이질적인 FL 환경에서 CIFAR-10, CIFAR-100, Digits 데이터셋 전반에 걸쳐 99% 이상의 워터마크 성공률과 침해자 식별 정확도 100%를 달성하며, 일반적인 워터마크 제거 공격에도 불구하고 안정성을 유지한다.

ABSTRACT

Federated learning (FL) emerges as an effective collaborative learning framework to coordinate data and computation resources from massive and distributed clients in training. Such collaboration results in non-trivial intellectual property (IP) represented by the model parameters that should be protected and shared by the whole party rather than an individual user. Meanwhile, the distributed nature of FL endorses a malicious client the convenience to compromise IP through illegal model leakage to unauthorized third parties. To block such IP leakage, it is essential to make the IP identifiable in the shared model and locate the anonymous infringer who first leaks it. The collective challenges call for \emph{accountable federated learning}, which requires verifiable ownership of the model and is capable of revealing the infringer's identity upon leakage. In this paper, we propose Decodable Unique Watermarking (DUW) for complying with the requirements of accountable FL. Specifically, before a global model is sent to a client in an FL round, DUW encodes a client-unique key into the model by leveraging a backdoor-based watermark injection. To identify the infringer of a leaked model, DUW examines the model and checks if the triggers can be decoded as the corresponding keys. Extensive empirical results show that DUW is highly effective and robust, achieving over $99\%$ watermark success rate for Digits, CIFAR-10, and CIFAR-100 datasets under heterogeneous FL settings, and identifying the IP infringer with $100\%$ accuracy even after common watermark removal attempts.

연구 동기 및 목표

  • 피어드레이티드 러닝(FL) 시스템에서 고가치 글로벌 모델을 泄露하는 악성 클라이언트를 식별하는 데 있어 핵심적인 과제를 해결한다.
  • 모델 IP의 검증 가능한 소유권과 개인 클라이언트로의 추적 가능성을 보장함으로써 책임 있는 FL를 실현한다.
  • 기존 워터마킹 기법들이 클라이언트별 추적 기능이 없거나 파ameter 노출을 요구한다는 한계를 극복한다.
  • 워터마킹 제거 및 적대적 공격에 대한 강건성을 확보하면서도 높은 모델 유틸리티를 유지한다.
  • 기존 FL 파이프라인에 최소한의 수정으로 통합 가능한 경량이며 모델 독립적인 솔루션을 제공한다.

제안 방법

  • 각 클라이언트의 고유 키를 외부 분포(Out-of-distribution, OoD) 데이터에서 생성된 트리거 세트를 통해 인코딩하는 백도어 기반 기법을 사용해 글로벌 모델에 클라이언트 고유 워터마크를 주입한다.
  • USPS, GTSRB, 무작위 노이즈, 조합 이미지 등의 OoD 데이터셋을 사용해 사전 학습된 인코더를 통해 클라이언트별 트리거 세트를 생성한다.
  • 표준 정확도를 유지하는 목적 함수를 사용하여 원본 학습 데이터와 트리거 세트를 함께 사용해 글로벌 모델을 피나이팅함으로써 워터마크를 통합한다.
  • 검증 단계에서 디코더를 배포하여, 모든 트리거 세트에 대해 의심스러운 모델을 테스트하고 워터마크 성공률(WSR)이 가장 높은 클라이언트를 식별함으로써 워터마크를 복호화한다.
  • 워터마크 충돌로 인한 오진을 방지하기 위해 디코더를 사용함으로써 강건성을 확보하고 추적 신뢰도를 향상시킨다.
  • 기존의 블랙박스 통합 워터마킹과 결합하여 하이브리드 배포를 지원함으로써 이중 탐지 및 클라이언트 수준의 추적 기능을 가능하게 한다.

실험 결과

연구 질문

  • RQ1분산 환경에서 글로벌 FL 모델을 泄露한 클라이언트를 고유하게 식별할 수 있는 워터마킹 기법이 가능한가?
  • RQ2클라이언트 고유 워터마크를 임베딩하면서도 모델 유틸리티를 얼마나 잘 유지하는가?
  • RQ3일반적인 워터마킹 제거 및 모델 피나이팅 공격에 대해 워터마크의 강건성은 어느 정도인가?
  • RQ4OoD 데이터셋의 선택이 모델 정확도와 워터마크 탐지 성능 간의 트레이드오프에 어떤 영향을 미치는가?
  • RQ5클라이언트 수가 많아질 경우 추적 정확도나 워터마크 탐지 신뢰도가 떨어지지 않고도 스케일링이 가능한가?

주요 결과

  • 이질적인 FL 환경에서 Digits, CIFAR-10, CIFAR-100 데이터셋에서 DUW는 99% 이상의 워터마크 성공률(WSR)을 달성한다.
  • 일반적인 워터마킹 제거 시도와 모델 피나이팅 이후에도 침해자 식별 정확도가 100% 유지된다.
  • 무작위 노이즈 또는 조합 이미지 OoD 데이터셋을 사용할 경우 정확도 저하가 1% 미만이며, 높은 WSR 유지를 유지하고 정확도 회복도 빠르게 이루어진다.
  • 600명의 클라이언트를 대상으로도 DUW는 73.37%의 WSR과 100%의 추적 정확도(TAcc)를 유지하여 강력한 확장성을 입증한다.
  • 디코더를 통해 오진을 감소시켜 추적 정확도를 100%로 향상시키고 충돌 위험을 최소화함으로써 추적 신뢰도를 제고한다.
  • 통합 블랙박스 워터마킹과의 하이브리드 워터마킹은 DUW의 효과성을 유지하며, WSR은 0.72% 감소하고 통합 워터마킹 성공률는 98.82%를 기록한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.