Skip to main content
QUICK REVIEW

[논문 리뷰] Increasing the Cost of Model Extraction with Calibrated Proof of Work

Adam Dziedzic, Muhammad Ahmad Kaleem|arXiv (Cornell University)|2022. 01. 23.
Adversarial Robustness in Machine Learning인용 수 7
한 줄 요약

이 논문은 기계학습 모델 추출 공격에 대비한 사전 방어 기법을 제안한다. 이 기법은 공격자에게는 계산 비용을 증가시키지만 정상 사용자에게는 최소한의 오버헤드를 유발하는 校정된 작업 증명(Proof-of-Work, PoW) 메커니즘을 도입한다. 각 쿼리당 정보 泄露를 측정하기 위해 미분적 비밀유지 예산을 활용함으로써, PoW의 난이도를 동적으로 조정함으로써 모델 도용 위험을 감소시키며, 정상 사용자의 모델 정확도나 유용성에 영향을 주지 않는다.

ABSTRACT

In model extraction attacks, adversaries can steal a machine learning model exposed via a public API by repeatedly querying it and adjusting their own model based on obtained predictions. To prevent model stealing, existing defenses focus on detecting malicious queries, truncating, or distorting outputs, thus necessarily introducing a tradeoff between robustness and model utility for legitimate users. Instead, we propose to impede model extraction by requiring users to complete a proof-of-work before they can read the model's predictions. This deters attackers by greatly increasing (even up to 100x) the computational effort needed to leverage query access for model extraction. Since we calibrate the effort required to complete the proof-of-work to each query, this only introduces a slight overhead for regular users (up to 2x). To achieve this, our calibration applies tools from differential privacy to measure the information revealed by a query. Our method requires no modification of the victim model and can be applied by machine learning practitioners to guard their publicly exposed models against being easily stolen.

연구 동기 및 목표

  • 모델 추출 공격의 증가하는 위협으로 인한 지적 재산권 침해와 악성 공격 유도 문제를 해결하기 위해.
  • 워터마킹이나 학습 증명과 같은 반응형 기법들과는 달리, 도용이 발생하기 전에 사전에 방지하는 사전 방어 기법을 개발하기 위해.
  • 공격자에게는 계산 비용을 크게 증가시키면서도 정상 사용자의 모델 정확도와 유용성은 그대로 유지하기 위해.
  • 각 쿼리당 정보 泄露를 기반으로 하여, 미분적 비밀유지 메트릭을 활용해 작업 증명 난이도를 교정하기 위해.
  • 피해 모델의 수정 없이 적용 가능한 실용적이고 모델에 종속되지 않는 방어 기법을 제공하기 위해.

제안 방법

  • 방어 기법은 모델 예측을 작업 증명(PoW) 퍼즐로 감싸, 클라이언트가 응답을 받기 전에 이를 해결하도록 한다.
  • 각 PoW의 난이도는 미분적 비밀유지 예산을 활용해 쿼리당 추정된 정보 泄露에 따라 교정된다.
  • 정보 泄露는 모델 예측이 입력 쿼리에 대해 얼마나 민감한지 측정함으로써, 미분적 비밀유지 도구를 활용한다.
  • PoW 서버는 사용자별로 누적된 쿼리 비용을 유지하고, 이를 바탕으로 퍼즐 난이도를 조정한다.
  • 클라이언트-서버 아키텍처를 사용하며, 클라이언트는 PoW 해결책을 제출하고, 검증된 해결책이야말로 모델 추론을 유도한다.
  • 이 방법은 추론 후에 적용되므로, 피해 모델의 아키텍처나 학습 과정에 대한 수정이 필요하지 않다.

실험 결과

연구 질문

  • RQ1각 쿼리의 정보 泄露에 맞춰 조정된 작업 증명 메커니즘이, 모델 유용성에 영향을 주지 않으면서도 모델 추출 공격을 효과적으로 억제할 수 있는가?
  • RQ2어떻게 하면 미분적 비밀유지 메트릭을 활용해 개별 쿼리의 개인정보 비용을 정확하고 효율적으로 추정할 수 있는가?
  • RQ3교정된 PoW 방어 기법은 공격자에게 계산 비용을 얼마나 증가시키며, 정상 사용자에게는 얼마나 낮은 오버헤드를 유발하는가?
  • RQ4이 방어 기법은 모델 아키텍처나 데이터셋에 종속되지 않고 다양한 환경에 일반적으로 적용될 수 있는가?
  • RQ5기존의 능동형 및 반응형 방어 기법과 비교했을 때, 교정된 PoW는 강건성과 실용성 측면에서 어떤가?

주요 결과

  • 교정된 PoW 방어 기법은 공격자의 모델 추출 비용을 최대 100배로 증가시켜 대규모 쿼리 기반 공격을 크게 억제한다.
  • 정상 사용자는 최소한의 성능 오버헤드를 경험하며, 쿼리 비용이 최대 2배로 증가할 뿐이므로 사용성이 유지된다.
  • 이 방법은 출력의 흐림이나 잘라내기 조작을 가하지 않기 때문에 원본 모델의 정확도와 예측 품질을 그대로 유지한다.
  • 이 방어 기법은 네 가지 다양한 데이터셋과 여덟 가지의 다른 모델 추출 공격 변형에 대해 효과적이며, 광범위한 적용 가능성을 입증한다.
  • 미분적 비밀유지 기반의 비용 추정을 통해 데이터 및 아키텍처에 종속되지 않는 접근 방식을 실현하였으며, 실용적이고 이론적으로 타당하다.
  • 이 방어 기법은 사전 방어이므로 도용이 발생하기 전에 방지하지만, 워터마킹이나 학습 증명과 같은 반응형 기법들은 도용 후 탐지가 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.