[논문 리뷰] Hiding Faces in Plain Sight: Disrupting AI Face Synthesis with Adversarial Perturbations
이 논문은 인공지능으로 생성된 위조 얼굴에 대비해 DNN 기반 얼굴 검출기의 작동을 방해하기 위해 눈에 띄지 않는 적대적 편향을 사용하는 사전 방어 기법을 제안한다. 이러한 편향을 통해 학습 데이터를 오염시켜 얼굴 검출 결과의 질을 떨어뜨림으로써, 위조 얼굴 합성 시스템의 성능을 크게 저하시키며, 벤치마크 데이터셋에서 화이트박스, GRAYBOX, 블랙박스 설정 전반에서 뛰어난 성능을 발휘한다.
Recent years have seen fast development in synthesizing realistic human faces using AI technologies. Such fake faces can be weaponized to cause negative personal and social impact. In this work, we develop technologies to defend individuals from becoming victims of recent AI synthesized fake videos by sabotaging would-be training data. This is achieved by disrupting deep neural network (DNN) based face detection method with specially designed imperceptible adversarial perturbations to reduce the quality of the detected faces. We describe attacking schemes under white-box, gray-box and black-box settings, each with decreasing information about the DNN based face detectors. We empirically show the effectiveness of our methods in disrupting state-of-the-art DNN based face detectors on several datasets.
연구 동기 및 목표
- 얼굴 검출의 전처리 단계를 공격하여 개인과 사회에 해를 끼칠 수 있는 인공지능 기반 위조 얼굴의 증가하는 위협을 해결한다.
- 개인 이미지가 위조 얼굴 합성 모델 학습에 대량으로 재사용되는 것을 방지하기 위한 사전 방어 메커니즘을 개발한다.
- 눈에 띄지 않는 적대적 노이즈를 도입하여 최신 DNN 기반 얼굴 검출기의 검출 품질을 떨어뜨림으로써 그 기능을 방해한다.
- JPEG 압축, 노이즈, 흐림과 같은 일반적인 이미지 처리 작업에 대해 공격의 강건성을 확보한다.
- 최소한의 모델 정보로도 화이트박스, GRAYBOX, 블랙박스 공격 설정을 지원함으로써 실제 환경 적용 가능성을 확보한다.
제안 방법
- 모든 진짜 얼굴을 놓치고, 진짜가 아닌 것을 얼굴으로 잘못 식별하는 것을 동시에 최대화하기 위해, 적대적 편향 생성을 제약 조건이 있는 최적화 문제로 수식화한다.
- 화이트박스 설정에서는 DNN 얼굴 검출기의 아키텍처와 파라미터를 완전히 알고 있는 조건에서 기울기 기반 역전파를 사용해 편향을 최적화한다.
- 정확한 모델 파라미터에 의존도를 줄이기 위해 무작위 기울기 업데이트를 도입하여, GRAYBOX 설정에서도 효과적인 공격을 가능하게 한다.
- 이식성(transferability)을 활용하여 일반적으로 사용되는 기본 네트워크 아키텍처(예: ResNet, MobileNet)에서 편향을 생성함으로써, 블랙박스 설정에서 알려지지 않은 DNN 검출기에게 복합 공격을 가한다.
- 이미지에 편향을 적용하여 AI 얼굴 합성 모델 학습에 사용되는 얼굴 세트를 오염시킴으로써 합성된 얼굴의 품질을 떨어뜨린다.
- L-∞ 노름을 사용해 편향의 크기를 제약함으로써 눈에 띄지 않음을 확보하고, 시각적 품질은 유지하면서도 검출 성능 저하를 극대화한다.
실험 결과
연구 질문
- RQ1다양한 모델 접근 수준(화이트박스, GRAYBOX, 블랙박스)에서 적대적 편향이 DNN 기반 얼굴 검출기를 효과적으로 방해할 수 있는가?
- RQ2제안된 방법은 AI 얼굴 합성에 사용되는 자동으로 검출된 얼굴 세트의 데이터 유용성 품질(DUQ)을 얼마나 줄이는가?
- RQ3JPEG 압축, 추가 노이즈, 흐림과 같은 일반적인 이미지 처리 작업에 대해 적대적 편향이 얼마나 강건한가?
- RQ4표준 기반 모델에서 생성된 이식 가능한 적대적 편향이 알려지지 않은 DNN 기반 얼굴 검출기의 검출 성능을 성공적으로 떨어뜨릴 수 있는가?
- RQ5이 방법은 후행적 포렌식 검출 기법보다 뛰어난 성능을 보이는 실질적인 사전 방어 메커니즘을 제공하는가?
주요 결과
- 제안된 방법은 Fr101, Pr50, Fv16, Sv16와 같은 최신 얼굴 검출기 여러 종류에서 데이터 유용성 품질(DUQ)을 크게 감소시키며, 음수의 DUQ 점수는 진짜 양성보다 더 많은 오진 감지가 발생했음을 나타낸다.
- 블랙박스 설정에서, 기준 대비 더 많은 오진 감지를 유도함으로써 AI 얼굴 합성 모델 학습에 사용되는 얼굴 세트의 품질이 떨어지므로, 기존 방법보다 우수한 성능을 발휘한다.
- JPEG 압축 조건에서도 적대적 편향이 효과를 유지하며, Fv16와 Sv16는 Fr101과 Pr50보다 공격 성능 저하가 느리게 나타나 더 높은 강건성을 보인다.
- 추가 노이즈에 대한 저항성은 백색 가우시안 노이즈에 대해 DUQ 성능이 노이즈 강도가 증가함에 따라 서서히 회복됨을 보이며, 노이즈 공격에 강건함을 입증한다.
- σ_blur > 2인 블러링은 공격 효과를 심각하게 떨어뜨리며, 고주파 편향이 스무딩 연산에 취약함을 시사한다.
- 시각적 결과는 편향이 얼굴 검출기를 성공적으로 혼란스럽게 하여 진짜 얼굴을 놓치고 비얼굴을 얼굴로 잘못 식별하게 하며, 학습 데이터 세트의 신뢰성 저하를 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.