[논문 리뷰] Adv-watermark: A Novel Watermark Perturbation for Adversarial Examples
이 논문은 깊이 신경망을 속이는 데 효과적인 실재적이고 의미 있는 광고 물결을 사용하는 새로운 블랙박스 적대적 공격인 Adv-watermark을 제안한다. 로고나 텍스트와 같은 의미 있는 시각적 워터마크를 편향으로 삼아 현실감 있는, 의미 있는 적대적 예제를 생성한다. 공격를 전역 최적화 문제로 공식화하고, 베이식 히프팅 엣볼루션(Basin Hopping Evolution, BHE) 알고리즘을 적용하여, 최소한의 쿼리로도 높은 공격 성공률을 달성하며, ImageNet 및 CASIA-WebFace 데이터셋에서 이미지 변환 방어 기법에 대해 뛰어난 강건성을 보여준다.
Recent research has demonstrated that adding some imperceptible perturbations to original images can fool deep learning models. However, the current adversarial perturbations are usually shown in the form of noises, and thus have no practical meaning. Image watermark is a technique widely used for copyright protection. We can regard image watermark as a king of meaningful noises and adding it to the original image will not affect people's understanding of the image content, and will not arouse people's suspicion. Therefore, it will be interesting to generate adversarial examples using watermarks. In this paper, we propose a novel watermark perturbation for adversarial examples (Adv-watermark) which combines image watermarking techniques and adversarial example algorithms. Adding a meaningful watermark to the clean images can attack the DNN models. Specifically, we propose a novel optimization algorithm, which is called Basin Hopping Evolution (BHE), to generate adversarial watermarks in the black-box attack mode. Thanks to the BHE, Adv-watermark only requires a few queries from the threat models to finish the attacks. A series of experiments conducted on ImageNet and CASIA-WebFace datasets show that the proposed method can efficiently generate adversarial examples, and outperforms the state-of-the-art attack methods. Moreover, Adv-watermark is more robust against image transformation defense methods.
연구 동기 및 목표
- 기존의 눈에 띄지 않는 노이즈에 의존하는 전통적 적대적 공격의 한계를 해결하기 위해, 실세계적 의미와 실용성을 갖춘 공격을 개발하고자 한다.
- 일반적으로 저작권 보호에 사용되는 의미 있는 시각적 워터마크가 적대적 편향으로도 효과적으로 기능할 수 있는지 탐색하고자 한다.
- 최소한의 쿼리 접근을 필요로 하며, 의미 있는 정보를 유지하면서도 높은 공격 성공률을 유지하는 블랙박스 공격 방법을 개발하고자 한다.
- 일반적인 방어 기법인 이미지 변환 및 적대적 훈련에 대한 강건성을 향상시키고자 한다.
- 저작권 보호와 적대적 공격의 이중 기능을 실현하여, 실제 응용 상황에서의 실용성을 높이고자 한다.
제안 방법
- 청결한 이미지에 알파 블렌딩을 통해 제어 가능한 투명도를 가진 시각적 워터마크(예: 로고, 텍스트)를 삽입하여 적대적 편향으로 사용하는 새로운 적대적 공격 프레임워크인 Adv-watermark를 제안한다.
- 히프팅 엣볼루션 기반의 전역 최적화 알고리즘인 베이식 히프팅 엣볼루션(Basin Hopping Evolution, BHE)을 도입하며, 다수의 시작점과 교차 연산을 통합하여 局부 최적해에서 벗어나 전역 최적해에 수렴하는 능력을 향상시킨다.
- 워터마크 공격 문제를 전역 최적화 과제로 간주하여, 공격 성공률을 극대화하기 위해 최적의 워터마크 투명도와 공간적 위치를 동시에 결정한다.
- 블랙박스 환경에서 쿼리 효율적인 전략을 적용하며, 내부 모델 파rameter가 아닌 모델 출력 확률(예: 예측 클래스 점수)에 의존한다.
- 층별 특징 차이 분석을 활용하여 편향의 전파 정도를 정량화하며, 정상 이미지와 적대적 이미지 간의 특징 맵 변화 비율을 측정한다.
- 실제 TV 방송국의 로고를 사용하여 적대적 편향으로 활용하는 방법을 확장함으로써, 현실감 있는 물리적 세계 적용성을 향상시켰다.
실험 결과
연구 질문
- RQ1일반적으로 저작권 보호에 사용되는 시각적 워터마크가, 딥 네트워크를 속이는 데 효과적인 적대적 편향으로 재사용될 수 있는가?
- RQ2블랙박스 환경에서 공격 성공률을 극대화하기 위해 최적의 워터마크 투명도와 공간적 위치를 자동으로 발견할 수 있는가?
- RQ3제안된 BHE 알고리즘이 표준 히프팅 엣볼루션(BH)보다 높은 성공률을 보이는 적대적 워터마크 설정을 찾는 데서 뛰어난 성능을 보일 수 있는가?
- RQ4Adv-watermark는 일반적인 이미지 변환 방어 및 적대적 훈련에 대해 얼마나 강건한가?
- RQ5동일한 워터마크가 저작권 보호와 적대적 공격의 이중 기능을 수행할 수 있으며, 어느 한 기능도 손상되지 않게 유지될 수 있는가?
주요 결과
- Adv-watermark는 ImageNet 및 CASIA-WebFace에서 기존 최고 성능 기법보다 더 높은 공격 성공률을 기록하였으며, 특히 제한된 쿼리 접근이 가능한 블랙박스 환경에서 뛰어난 성능을 보였다.
- BHE 알고리즘은 표준 히프팅 엣볼루션(BH)에 비해 뚜렷이 뛰어난 성능을 보이며, 해의 다양성이 향상되어 수렴 속도와 전역 최적화 능력이 향상됨을 입증하였다.
- Adv-watermark는 이미지 변환 방어 기법(예: 크기 조정, 흐림, JPEG 압축)에 대해 더 강건하며, 딥 네트워크의 공간 민감성으로 인해 이러한 방어가 공격를 무력화하지 못함을 확인하였다.
- 적대적 훈련은 Adv-watermark에 효과적으로 대응하지 못하며, 한 워터마크로 훈련된 모델도 다른 워터마크 편향에 대해 여전히 취약함을 보여, 워터마크 유형 간 전이성이 있음을 시사하였다.
- 층별 분석 결과, 정상 워터마크에 비해 적대적 워터마크가 VGG16 모델의 깊은 층에서 훨씬 더 큰 특징 편향을 유도하는 것으로 확인되었으며, 이는 공격 효율성이 높은 이유를 설명한다.
- 일상적인 TV 방송국 로고를 사용하여 현실감 있는 적대적 예제를 성공적으로 생성함으로써, 물리적 세계 적용 가능성과 사용자 수용도를 향상시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.