Skip to main content
QUICK REVIEW

[논문 리뷰] An Attack on InstaHide: Is Private Learning Possible with Instance Encoding?

Nicholas Carlini, Samuel Deng|arXiv (Cornell University)|2020. 11. 10.
Privacy-Preserving Technologies in Data참고 문헌 10인용 수 20
한 줄 요약

이 논문은 인스턴스 인코딩을 사용하는 개인정보 보호 학습 방법인 InstaHide의 보안을 뛰어넘는 실용적인 복원 공격을 제시한다. 이 공격은 인코딩된 입력에서 시각적으로 식별 가능한 이미지를 복원한다. 저자들은 CIFAR-10, CIFAR-100 및 InstaHide 챌린지에서 이 공격의 효과성을 입증하고, 어떤 인스턴스 인코딩 프로토콜을 사용하더라도 구분 불가능성 기반의 개인정보 보호를 달성하는 데 근본적인 장벽이 있음을 증명한다.

ABSTRACT

A learning algorithm is private if the produced model does not reveal (too much) about its training set. InstaHide [Huang, Song, Li, Arora, ICML'20] is a recent proposal that claims to preserve privacy by an encoding mechanism that modifies the inputs before being processed by the normal learner. We present a reconstruction attack on InstaHide that is able to use the encoded images to recover visually recognizable versions of the original images. Our attack is effective and efficient, and empirically breaks InstaHide on CIFAR-10, CIFAR-100, and the recently released InstaHide Challenge. We further formalize various privacy notions of learning through instance encoding and investigate the possibility of achieving these notions. We prove barriers against achieving (indistinguishability based notions of) privacy through any learning protocol that uses instance encoding.

연구 동기 및 목표

  • InstaHide의 보안을 조사하기 위해 입력 인코딩을 통해 기밀성을 주장하는 학습 알고리즘의 보안성을 검토한다.
  • 인스턴스 인코딩이 기계 학습 모델에서 의미 있는 기밀성을 달성할 수 있는지 평가한다.
  • 인스턴스 인코딩을 통한 학습 프로토콜에 기반한 구분 불가능성 기반의 기밀성 개념을 체계화한다.
  • 인스턴스 인코딩 프로토콜을 사용할 경우 기밀 학습이 본질적으로 불가능한지 여부를 규명한다.

제안 방법

  • 인코딩된 이미지를 활용하여 원래 입력을 시각적으로 식별 가능한 형태로 복원하는 복원 공격을 설계한다.
  • 표준 벤치마크에 공격를 적용: CIFAR-10, CIFAR-100 및 InstaHide 챌린지 데이터셋.
  • 학습 프로토콜에서 인스턴스 인코딩에 기반한 구분 불가능성 기반의 기밀성 개념을 체계화한다.
  • 모든 인스턴스 인코딩 프로토콜이 구분 불가능성 기반 기밀성을 달성할 수 없음을 보여주는 이론적 장벽을 증명한다.
  • 다양한 데이터셋과 모델 아키텍처를 대상으로 공격 성공 여부를 실증적으로 평가한다.

실험 결과

연구 질문

  • RQ1복원 공격는 InstaHide 인코딩된 입력에서 시각적으로 식별 가능한 이미지를 복원할 수 있는가?
  • RQ2인스턴스 인코딩은 기계 학습 모델에서 어느 정도의 기밀성을 제공하는가?
  • RQ3인스턴스 인코딩을 통해 구분 불가능성 기반 기밀성을 달성하는 데 근본적인 이론적 제약가 존재하는가?
  • RQ4인스턴스 인코딩을 사용하는 어떤 학습 프로토콜이라도 강력한 기밀 보장을 만족시킬 수 있는가?

주요 결과

  • 복원 공격는 CIFAR-10 및 CIFAR-100에서 InstaHide 인코딩된 입력으로부터 시각적으로 식별 가능한 이미지를 성공적으로 복원했다.
  • 공격는 최근 공개된 InstaHide 챌린지 데이터셋에서 InstaHide의 기밀성 주장에 실패했다.
  • 저자들은 인스턴스 인코딩을 사용하는 어떤 학습 프로토콜도 구분 불가능성 기반 기밀성을 달성할 수 없다는 것을 증명했다.
  • 이론적 장벽은 인코딩 메커니즘 또는 모델 아키텍처의 종류에 관계없이 항상 유지된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.